跳到正文

#数据

今日 1 条
今天10月3日周六
10月2日周五
  1. Cloudflare Blog53

    Cloudflare发布2026 Birthday Week网络性能更新

    Cloudflare称,其在8月全球1,000个最大网络中的74%成为连接时间最快的提供商,高于2026年4月的60%。 Cloudflare新增基于Cloudflare Challenge Pages的性能测量方法,目前仅在少量符合条件的免费Challenge Pages上运行,并计划在数据质量和终端性能不受影响时再提高抽样率。

  2. AWS News Blog69

    Amazon S3 Tables 支持全部 Apache Iceberg V3 数据类型

    Amazon S3 Tables 现已支持 Apache Iceberg V3 规范中的全部数据类型,包括 variant、纳秒级时间戳、geometry、geography 和 unknown,并支持 deletion vectors 与 row lineage。

    推荐理由:新增完整 Iceberg V3 数据类型与行级操作能力,并提供 V2 升级路径;但新类型依赖特定引擎版本、Parquet 格式及排序限制,迁移前需核查兼容性。

  3. Hugging Face Blog64

    ServiceNow CoreAI推出AutoSynthData以生成企业智能体训练数据

    ServiceNow CoreAI构建了AutoSynthData,利用目标模型的失败和更强教师模型的成功案例生成并验证企业智能体训练任务。系统在EnterpriseOps Gym的Hybrid和ITSM环境中进行SFT实验,Hybrid的Pass@1提升7.2个百分点,ITSM从18.77%升至27.18%。

    推荐理由:文章公开了企业智能体训练数据的生成、验证与迭代流程,并通过两个ITSM环境实验提供量化结果,便于团队评估其实现方法与训练价值。

  4. Cloudflare Blog66

    Cloudflare推出Pay Per Use内容按使用付费测试版

    Cloudflare推出Pay Per Use测试版,让AI公司为特定内容用途报价,出版方决定是否接受,并按月通过Cloudflare结算。买方通过单一API报告每次使用,出版方可在控制台查看报价、使用次数和收入;Cloudflare同时发布基于开放x402协议、按请求向代理收费的Monetization Gateway测试版。

    推荐理由:Cloudflare以按实际使用付费替代按抓取收费,给出版权方和AI买方提供报价、接受、报告、计费与结算闭环,且已进入测试阶段,适合评估内容商业化接入路径。

  5. Cloudflare Blog79

    Cloudflare Basin 正式发布:基于 Apache Iceberg 与 R2 的无服务器数据平台

    Cloudflare 宣布 Basin 数据分析平台正式可用,包含 Basin Pipelines、Basin Catalog 和 Basin SQL,覆盖数据摄取、Apache Iceberg 元数据管理与查询。

    推荐理由:明确列出 Basin 三项服务的正式可用状态、数据链路与兼容性,适合评估事件摄取、Iceberg 管理和分布式查询的组合方式。

9月30日周三
  1. Google DeepMind Blog74

    Google DeepMind 推出 SynthID Bio 蛋白质水印方法

    Google DeepMind 发布 SynthID Bio,将不可见水印嵌入蛋白质序列和预测的三维结构,实验室测试显示其未损害目标蛋白的生物功能。研究还将其应用于 Evo 2 设计的噬菌体基因组,并公开方法论文、代码、体外数据及研究权重。

    推荐理由:提供面向蛋白质序列与三维结构的可验证水印概念验证,并公开方法论文、代码、体外数据和研究权重,适合评估 AI 生物设计的溯源与筛查方案。

  2. JetBrains Blog27

    Small Talk:对话 Synnax CEO 兼联合创始人 Emiliano Bonilla

    Synnax CEO兼联合创始人Emiliano Bonilla介绍,其团队正构建用于硬件控制及实时采集、整理和审查数据的平台,面向火箭发动机测试替代电子表格和无结构文件。团队约六个月开发了实时编程语言Arc,并将技术从航空航天拓展至量子计算低温控制、石油天然气和制造,正在研发由异常检测参与审查的自动数据复核功能。

9月29日周二
  1. PostgreSQL News67

    Dasha 1.8新增索引建议、I/O分析、模式检查与日志洞察

    Dasha 1.8为PostgreSQL集群性能监控工具,新增基于多主机统计的索引建议、I/O分析、17项模式检查和日志洞察功能。它可读取每个集群主机及副本的信息,支持索引分析、查询与锁等待监控、快照对比,并提供只读MCP连接器。监控集群要求PostgreSQL 14或更新版本,I/O页面要求PostgreSQL 16或更新版本。

    推荐理由:Dasha 1.8补齐索引建议、I/O分析、结构检查与日志洞察,适合需要跨集群诊断和查询计划分析的PostgreSQL小团队;正文同时列出版本、权限及可选组件要求,便于评估部署成本。

9月28日周一
9月24日周四
  1. PostgreSQL News69

    PostgreSQL 19 Beta 4 发布

    PostgreSQL 19 第四个测试版 Beta 4 已开放下载,包含正式发布前的功能预览,细节在测试期仍可能变化。项目计划于10月初进入候选版本阶段,PostgreSQL 19 GA 也可能于10月推出;本版回退 SQL/PGQ、数据校验和在线启停等多项功能,并修复 REPACK、WAIT FOR、逻辑复制及 autovacuum 等问题。

    推荐理由:本次发布列出 Beta 4 的回退与修复范围,可供用户评估升级风险、兼容性及后续测试重点。

9月22日周二
  1. PostgreSQL News66

    PostgresCompare 2.2.0 发布,重建架构并加入数据库流水线与 MCP server

    PostgresCompare 2.2.0 发布,这是该专有产品自 1.2.2 以来的首次公开发布,也是其历史上最大的一次改动。2.x 系列新增数据库流水线、即时比较、数据变更脚本、面向 AI agent 的 MCP server 和六种界面语言,并从 Electron 迁移至 Tauri;该版本支持 Windows、macOS 和 Linux,提供 14 天免费试用。

    推荐理由:这是 PostgresCompare 首次公开 2.x 版本,架构迁移并加入数据库流水线、快速比较、数据变更脚本和 MCP server;还提供跨平台下载、14 天试用及 1.2.2 直接升级路径,便于评估迁移工具能力与部署成本。

9月21日周一
9月19日周六
  1. Google Research Blog58

    Google开源MilleMiglia中程物流实例生成器

    Google与UniBrescia、ENPC Paris合作推出MilleMiglia,用C++生成符合中程物流特征且不暴露私有信息的合成基准实例。其数据格式以Protocol Buffers序列化,在同一文件中纳入固定车辆时刻、配送中心吞吐限制和复杂同步前提。生成规模覆盖精确算法测试用小型问题、大陆级工业问题及机器学习训练数据集,源码、文档和示例实例已在GitHub提供。

9月18日周五
  1. Google AI Blog63

    联合国系统推出面向全球数据的开放平台 UN System Data Commons

    联合国系统推出基于 Google Data Commons 构建的开源平台 UN System Data Commons,将分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。

    推荐理由:联合国系统借此把分散的统计数据统一到可搜索平台,并用自然语言查询和 AI 助手降低研究使用门槛,对研究、报道和政策分析具有直接价值。

9月17日周四
  1. Cisco Talos Blog74

    Cisco Talos调查2026年上半年日本勒索软件事件及The Gentlemen基础设施

    Cisco Talos调查称,2026年1月至7月日本有90家组织受到勒索软件影响,较上年同期增加约4.7%,The Gentlemen活动最频繁。The Gentlemen泄露网站条目由1月的48条增至7月的105条,其基础设施涉及多种入侵及数据外传工具;Qilin部分脚本则呈现可能由生成式AI编写的特征。

    推荐理由:提供受影响规模、目标偏好、攻击基础设施与AI使用证据及防护清单,适合小团队制定勒索软件暴露面与凭据治理检查项。

9月16日周三
  1. Google AI Blog67

    Google介绍AI在科学研究与社会应用中的进展

    Google称其技术现已支持超过300种语言,并发布AI & Economy ATLAS,展示人们在工作和日常生活中的AI使用情况。文章还介绍了AlphaGenome Atlas、WeatherNext 3和Earth AI Planetary Prediction Engine等项目的公开范围与应用数据,同时强调AI收益并非自动实现,仍需应对准确性、安全、滥用及机会差距等风险。

    推荐理由:汇总AI在遗传、灾害预警、教育和语言无障碍方面的具体进展及数据,便于评估其应用范围、实际成效与风险治理。

9月14日周一
9月11日周五
  1. Google Research Blog64

    Google Research提出ToolGrad:用文本“梯度”高效生成工具使用数据集

    Google Research在ACL 2026提出ToolGrad,通过API Proposer、API Executors、API Selector和LLM Updater迭代生成工具调用链、用户查询与AI回复。

    推荐理由:提出先生成工具调用链、再反推用户提示的答案优先方法,并用多模块迭代降低数据生成成本,对构建训练数字代理的高质量工具使用数据具有直接参考价值。

9月10日周四
  1. AWS News Blog68

    Amazon EBS推出跨AWS账户卷克隆功能

    Amazon EBS Volume Clones现已支持将卷复制到其他AWS账户,并可选择使用目标账户的AWS KMS密钥重新加密。复制需通过AWS RAM共享并接受资源共享,且源卷与副本必须位于同一可用区;该功能覆盖所有支持Amazon EBS Volume Clones的AWS区域。

    推荐理由:明确给出跨账户复制的授权、加密、监控、计费与可用区约束,便于团队评估数据隔离和测试环境复制方案。

9月4日周五
  1. Google Research Blog65

    研究跨群体基因组风险预测中的迁移学习

    一项研究评估将 UK Biobank 欧洲人群 GWAS 数据迁移到 Biobank Japan 日本人群、用于八种临床性状 PRS 预测的效果。研究发现,BBJ 样本量低于15,000时合并欧洲数据可提升预测,但样本量增加后外部数据可能降低准确性;PRS-CSx 需要更大目标人群样本,而跨群体 meta-analysis 对 HDL、LDL 等性状更有帮助。

    推荐理由:文章通过系统性样本量消融和多种PRS方法比较,揭示跨群体训练数据并非越多越好,并指出样本规模、性状遗传相关性和方法选择之间的关系,为日本等 underrepresented populations 的基因组风险预测建模提供实证参考。

  2. Google Research Blog79

    Google Research与HHMI Janelia等合作完成雄性果蝇全脑连接图

    Google Research、HHMI Janelia及剑桥大学等地合作者完成了雄性果蝇脑与中枢神经系统的完整连接图,包含超过166,000个神经元和1.25亿个突触连接。该图已通过人工专家标注与校验,可通过开源工具Neuroglancer查看、探索和下载,研究团队称其为迄今按神经元数量计最大的脑图谱。

    推荐理由:完整雄性果蝇脑与中枢神经连接组具有重要科研价值,公开数据与验证流程可为神经科学研究提供可复用的基础资源。

9月2日周三
  1. Google Research Blog72

    Google发布MAPL-EMIT,用深度学习绘制全球甲烷排放

    Google与NASA JPL发布MAPL-EMIT深度学习框架,用于从EMIT高光谱卫星数据中进行全球甲烷羽流检测、增强定量、边界分割和源定位。模型在NASA专家标注数据上捕获84%的羽流,并发现约50%更多合理羽流;Google同时发布Earth Engine全球羽流数据库、Kaggle训练模型与合成羽流,以及GitHub推理库。

    推荐理由:MAPL-EMIT将高光谱卫星数据中的甲烷羽流检测、增强定量、边界分割和源定位整合为深度学习框架,并公开数据、模型与推理库,适合环境监测研究开展复现和后续开发。

8月28日周五
  1. Hugging Face Blog75

    Open ASR Leaderboard 新增首个全球南方语言评测集

    Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN,覆盖印度英语与印地语,并提供公开与私有划分。四个划分合计 4,888 名说话者、12 项说话者属性,Hindi 评测采用 OIWER 接受多种有效正字法;参与模型可按既有 GitHub 流程提交评估。

    推荐理由:新增面向印度英语与印地语的公开、私有评测集,并以说话者元数据和正字法 lattice 支持分组分析与可复现比较,能帮助团队识别 WER 掩盖的群体差异。

8月27日周四
8月26日周三
  1. Microsoft 开发者博客69

    Azure SQL Foundations:从 Hyperscale 入门到将 AI 接入应用

    Microsoft 发布 Azure SQL Database Foundations 系列,包含四集视频,覆盖 Hyperscale 入门、迁移与优化、计算和存储扩展,以及基于运营数据构建 AI 应用。

    推荐理由:以四集视频和配套仓库串起 Hyperscale 入门、迁移优化、扩展及 AI 应用实践,覆盖工具与学习路径,便于开发者按步骤复现。

8月22日周六
  1. Google Research Blog64

    Google Research提出可穿戴传感器候选生物标志物优先级框架

    Google Research介绍多代理系统 Biomarker Discovery Framework,用于在人工监督下优先筛选可穿戴传感器数据中的候选生物标志物。该框架结合假设生成、统计分析、模型训练、对抗验证和文献推理,在三个队列共9,279次参与者观察中识别出心理健康和代谢领域的候选关联,但研究明确这些结果不等同于临床验证或因果结论。

    推荐理由:该框架将统计计算、生成式推理与对抗验证结合,覆盖数据泄漏、过拟合和混杂因素等问题;其多队列结果与专家盲评为可穿戴生物标志物研究提供了可复用的工作流参考。

8月21日周五
  1. Google Research Blog63

    Google Research提出ME-POIs框架,用移动模式增强地点理解

    Google Research提出Mobility-Embedded POIs(ME-POIs),将文本描述与公共基准数据中的聚合、匿名化移动模式结合,用于表示地点随时间变化的活跃节奏。该框架在洛杉矶和休斯敦的未见地点测试中,访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。研究强调其面向地点和商业聚合理解,不用于个人用户分析或个性化。

    推荐理由:ME-POIs把匿名化、聚合的移动模式引入地点表示,报告了未见地点预测任务的量化提升,适合关注时空表示学习与地点属性预测的团队参考。