对《2026年开放数据基础设施报告》的思考
研究团队与同事 Csilla Zsigri、Adrienn Lawson 在 OpenSearch 五周年之际审视全球数据基础设施,探讨这一开源项目的发展及其与企业人工智能快速普及的关系。团队还与 Bianca Lewis 和 OpenSearch Software Foundation 领导团队合作,以回应社区的关键战略问题。
研究团队与同事 Csilla Zsigri、Adrienn Lawson 在 OpenSearch 五周年之际审视全球数据基础设施,探讨这一开源项目的发展及其与企业人工智能快速普及的关系。团队还与 Bianca Lewis 和 OpenSearch Software Foundation 领导团队合作,以回应社区的关键战略问题。
Cloudflare称,其在8月全球1,000个最大网络中的74%成为连接时间最快的提供商,高于2026年4月的60%。 Cloudflare新增基于Cloudflare Challenge Pages的性能测量方法,目前仅在少量符合条件的免费Challenge Pages上运行,并计划在数据质量和终端性能不受影响时再提高抽样率。
NVIDIA Developer Blog 聚焦通过 cuObject 和 SCADA Server SDK 扩展 AI 对大容量文件存储与对象存储的访问。文章指出,AI 工作负载的高速数据访问需求覆盖训练、微调、推理上下文、工具调用、搜索和数据库查询,相关数据分布于本地部署及云端存储。
Amazon Aurora PostgreSQL现已支持使用现有PostgreSQL应用和工具,直接联合查询运营数据与数据湖中的Apache Iceberg、Parquet数据。
推荐理由:提供版本、启用步骤与查询方式,并说明目录联邦、缓存和费用,可帮助团队评估是否减少数据搬运及ETL维护。
Amazon S3 Tables 现已支持 Apache Iceberg V3 规范中的全部数据类型,包括 variant、纳秒级时间戳、geometry、geography 和 unknown,并支持 deletion vectors 与 row lineage。
推荐理由:新增完整 Iceberg V3 数据类型与行级操作能力,并提供 V2 升级路径;但新类型依赖特定引擎版本、Parquet 格式及排序限制,迁移前需核查兼容性。
ServiceNow CoreAI构建了AutoSynthData,利用目标模型的失败和更强教师模型的成功案例生成并验证企业智能体训练任务。系统在EnterpriseOps Gym的Hybrid和ITSM环境中进行SFT实验,Hybrid的Pass@1提升7.2个百分点,ITSM从18.77%升至27.18%。
推荐理由:文章公开了企业智能体训练数据的生成、验证与迭代流程,并通过两个ITSM环境实验提供量化结果,便于团队评估其实现方法与训练价值。
Cloudflare推出Pay Per Use测试版,让AI公司为特定内容用途报价,出版方决定是否接受,并按月通过Cloudflare结算。买方通过单一API报告每次使用,出版方可在控制台查看报价、使用次数和收入;Cloudflare同时发布基于开放x402协议、按请求向代理收费的Monetization Gateway测试版。
推荐理由:Cloudflare以按实际使用付费替代按抓取收费,给出版权方和AI买方提供报价、接受、报告、计费与结算闭环,且已进入测试阶段,适合评估内容商业化接入路径。
Cloudflare 宣布 Basin 数据分析平台正式可用,包含 Basin Pipelines、Basin Catalog 和 Basin SQL,覆盖数据摄取、Apache Iceberg 元数据管理与查询。
推荐理由:明确列出 Basin 三项服务的正式可用状态、数据链路与兼容性,适合评估事件摄取、Iceberg 管理和分布式查询的组合方式。
Cloudflare AI Search 已正式可用,组合 Workers AI、Vectorize、R2 和 Browser Run 提供托管式索引与检索流程。
推荐理由:正式可用与分阶段计费节点明确,并新增多模态检索、OCR和更大文件支持,便于评估索引方案与成本。
Elastic委托Forrester Consulting开展Total Economic Impact™研究,基于企业访谈构建年收入100亿美元、服务2500万客户的复合企业。研究显示,采用Elastic Observability后,第三年系统停机时间最多减少75%,SRE监控与事件解决时间减少95%,可观测性基础设施成本降低70%。
Google DeepMind 发布 SynthID Bio,将不可见水印嵌入蛋白质序列和预测的三维结构,实验室测试显示其未损害目标蛋白的生物功能。研究还将其应用于 Evo 2 设计的噬菌体基因组,并公开方法论文、代码、体外数据及研究权重。
推荐理由:提供面向蛋白质序列与三维结构的可验证水印概念验证,并公开方法论文、代码、体外数据和研究权重,适合评估 AI 生物设计的溯源与筛查方案。
Synnax CEO兼联合创始人Emiliano Bonilla介绍,其团队正构建用于硬件控制及实时采集、整理和审查数据的平台,面向火箭发动机测试替代电子表格和无结构文件。团队约六个月开发了实时编程语言Arc,并将技术从航空航天拓展至量子计算低温控制、石油天然气和制造,正在研发由异常检测参与审查的自动数据复核功能。
Redis Flex 将 RAM 与 SSD 组合在单一 Redis 数据库中,让热数据保留在 RAM、低频使用的键和值移至 SSD。按工作负载可设置 10% 至 50% 的 RAM 比例,并可随需求或内存价格变化调整。
Dasha 1.8为PostgreSQL集群性能监控工具,新增基于多主机统计的索引建议、I/O分析、17项模式检查和日志洞察功能。它可读取每个集群主机及副本的信息,支持索引分析、查询与锁等待监控、快照对比,并提供只读MCP连接器。监控集群要求PostgreSQL 14或更新版本,I/O页面要求PostgreSQL 16或更新版本。
推荐理由:Dasha 1.8补齐索引建议、I/O分析、结构检查与日志洞察,适合需要跨集群诊断和查询计划分析的PostgreSQL小团队;正文同时列出版本、权限及可选组件要求,便于评估部署成本。
pgEdge 宣布推出 Postgres 云数据库平台 pgEdge Starfleet,面向将企业 AI 原型迁移至生产应用的开发与部署需求。平台提供 MCP、RAG、PostgREST、数据库分支及云、私有云和本地部署选项,现可注册 14 天免费试用,月费起价为 25 美元。
PostgreSQL 19 第四个测试版 Beta 4 已开放下载,包含正式发布前的功能预览,细节在测试期仍可能变化。项目计划于10月初进入候选版本阶段,PostgreSQL 19 GA 也可能于10月推出;本版回退 SQL/PGQ、数据校验和在线启停等多项功能,并修复 REPACK、WAIT FOR、逻辑复制及 autovacuum 等问题。
推荐理由:本次发布列出 Beta 4 的回退与修复范围,可供用户评估升级风险、兼容性及后续测试重点。
PostgresCompare 2.2.0 发布,这是该专有产品自 1.2.2 以来的首次公开发布,也是其历史上最大的一次改动。2.x 系列新增数据库流水线、即时比较、数据变更脚本、面向 AI agent 的 MCP server 和六种界面语言,并从 Electron 迁移至 Tauri;该版本支持 Windows、macOS 和 Linux,提供 14 天免费试用。
推荐理由:这是 PostgresCompare 首次公开 2.x 版本,架构迁移并加入数据库流水线、快速比较、数据变更脚本和 MCP server;还提供跨平台下载、14 天试用及 1.2.2 直接升级路径,便于评估迁移工具能力与部署成本。
NVIDIA Earth-2 可将最新观测信息转化为及时天气决策,帮助天气敏感型行业应对条件变化。能源企业通过风电和太阳能资产获取测量数据,应急管理团队使用雷达和本地传感器,卫星提供商则持续观测地球,以支持各领域的物理风险管理。
NVIDIA 在纽约气候周展示 ThinkLabs AI、Atomic Canyon、Redwood Materials、TerraPower 和 Commonwealth Fusion Systems 利用 AI 推进清洁能源项目。相关技术涵盖电网数字孪生、核电运营辅助、AI 工厂离网供电、Natrium 核反应堆选址及聚变实验加速。
V7 借助 GPT-5.6 将成本降低 78%,同时提升准确率。V7 可将分散的公司文件转化为上下文智能体可用的信息,用于完成复杂、带有来源关联的工作。
Google与UniBrescia、ENPC Paris合作推出MilleMiglia,用C++生成符合中程物流特征且不暴露私有信息的合成基准实例。其数据格式以Protocol Buffers序列化,在同一文件中纳入固定车辆时刻、配送中心吞吐限制和复杂同步前提。生成规模覆盖精确算法测试用小型问题、大陆级工业问题及机器学习训练数据集,源码、文档和示例实例已在GitHub提供。
联合国系统推出基于 Google Data Commons 构建的开源平台 UN System Data Commons,将分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
推荐理由:联合国系统借此把分散的统计数据统一到可搜索平台,并用自然语言查询和 AI 助手降低研究使用门槛,对研究、报道和政策分析具有直接价值。
Cisco Talos调查称,2026年1月至7月日本有90家组织受到勒索软件影响,较上年同期增加约4.7%,The Gentlemen活动最频繁。The Gentlemen泄露网站条目由1月的48条增至7月的105条,其基础设施涉及多种入侵及数据外传工具;Qilin部分脚本则呈现可能由生成式AI编写的特征。
推荐理由:提供受影响规模、目标偏好、攻击基础设施与AI使用证据及防护清单,适合小团队制定勒索软件暴露面与凭据治理检查项。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 使用情况与支出,并识别培训需求。通过这些分析,团队可以将 AI 的采用情况与业务结果关联起来。
Hex 的数据智能体借助 GPT-6 Astra,将分析结果转化为员工愿意分享的交互式可视化报告。GPT-6 Astra 的核心作用是把答案呈现为可视化内容,让复杂分析更便于员工内部分享。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线强化学习生成与集合属性对齐的查询扩展,并将其蒸馏到 53.9M 参数的扩散检索器中。框架在实验中让检索器单次并行生成目标集合,相对自回归方法实现 12 至 20 倍推理加速。
Google称其技术现已支持超过300种语言,并发布AI & Economy ATLAS,展示人们在工作和日常生活中的AI使用情况。文章还介绍了AlphaGenome Atlas、WeatherNext 3和Earth AI Planetary Prediction Engine等项目的公开范围与应用数据,同时强调AI收益并非自动实现,仍需应对准确性、安全、滥用及机会差距等风险。
推荐理由:汇总AI在遗传、灾害预警、教育和语言无障碍方面的具体进展及数据,便于评估其应用范围、实际成效与风险治理。
GitLab 介绍完全隔离的单租户 SaaS 方案 GitLab Dedicated,该方案由 GitLab 托管并部署在客户指定的 AWS 区域,支持区域选择、BYOK、AWS PrivateLink 及跨区域异步复制。
Google Research在ACL 2026提出ToolGrad,通过API Proposer、API Executors、API Selector和LLM Updater迭代生成工具调用链、用户查询与AI回复。
推荐理由:提出先生成工具调用链、再反推用户提示的答案优先方法,并用多模块迭代降低数据生成成本,对构建训练数字代理的高质量工具使用数据具有直接参考价值。
OpenAI推出面向金融服务的ChatGPT,结合内置金融数据与GPT-6 Astra。该产品面向研究、建模和客户材料准备,具体可用范围仍需以完整信息为准。
Amazon EBS Volume Clones现已支持将卷复制到其他AWS账户,并可选择使用目标账户的AWS KMS密钥重新加密。复制需通过AWS RAM共享并接受资源共享,且源卷与副本必须位于同一可用区;该功能覆盖所有支持Amazon EBS Volume Clones的AWS区域。
推荐理由:明确给出跨账户复制的授权、加密、监控、计费与可用区约束,便于团队评估数据隔离和测试环境复制方案。
一项研究评估将 UK Biobank 欧洲人群 GWAS 数据迁移到 Biobank Japan 日本人群、用于八种临床性状 PRS 预测的效果。研究发现,BBJ 样本量低于15,000时合并欧洲数据可提升预测,但样本量增加后外部数据可能降低准确性;PRS-CSx 需要更大目标人群样本,而跨群体 meta-analysis 对 HDL、LDL 等性状更有帮助。
推荐理由:文章通过系统性样本量消融和多种PRS方法比较,揭示跨群体训练数据并非越多越好,并指出样本规模、性状遗传相关性和方法选择之间的关系,为日本等 underrepresented populations 的基因组风险预测建模提供实证参考。
Google Research、HHMI Janelia及剑桥大学等地合作者完成了雄性果蝇脑与中枢神经系统的完整连接图,包含超过166,000个神经元和1.25亿个突触连接。该图已通过人工专家标注与校验,可通过开源工具Neuroglancer查看、探索和下载,研究团队称其为迄今按神经元数量计最大的脑图谱。
推荐理由:完整雄性果蝇脑与中枢神经连接组具有重要科研价值,公开数据与验证流程可为神经科学研究提供可复用的基础资源。
Google与NASA JPL发布MAPL-EMIT深度学习框架,用于从EMIT高光谱卫星数据中进行全球甲烷羽流检测、增强定量、边界分割和源定位。模型在NASA专家标注数据上捕获84%的羽流,并发现约50%更多合理羽流;Google同时发布Earth Engine全球羽流数据库、Kaggle训练模型与合成羽流,以及GitHub推理库。
推荐理由:MAPL-EMIT将高光谱卫星数据中的甲烷羽流检测、增强定量、边界分割和源定位整合为深度学习框架,并公开数据、模型与推理库,适合环境监测研究开展复现和后续开发。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN,覆盖印度英语与印地语,并提供公开与私有划分。四个划分合计 4,888 名说话者、12 项说话者属性,Hindi 评测采用 OIWER 接受多种有效正字法;参与模型可按既有 GitHub 流程提交评估。
推荐理由:新增面向印度英语与印地语的公开、私有评测集,并以说话者元数据和正字法 lattice 支持分组分析与可复现比较,能帮助团队识别 WER 掩盖的群体差异。
Google Research 构建了 GlucoFM,一种分离较慢血糖趋势与短期波动的双流自监督基础模型。该模型使用 109,066 小时无标签 CGM 数据预训练,并在四个队列、七项临床预测任务及餐后血糖反应预测中进行了评估。
Home Assistant 宣布首份用户调查的匿名结果现已免费公开。组织于2024年12月启动调查,希望直接听取社区反馈,使项目更包容、易于使用;原文称数据不包含可识别信息,并计划用于改进相关工作。
Microsoft 发布 Azure SQL Database Foundations 系列,包含四集视频,覆盖 Hyperscale 入门、迁移与优化、计算和存储扩展,以及基于运营数据构建 AI 应用。
推荐理由:以四集视频和配套仓库串起 Hyperscale 入门、迁移优化、扩展及 AI 应用实践,覆盖工具与学习路径,便于开发者按步骤复现。
Google Research介绍多代理系统 Biomarker Discovery Framework,用于在人工监督下优先筛选可穿戴传感器数据中的候选生物标志物。该框架结合假设生成、统计分析、模型训练、对抗验证和文献推理,在三个队列共9,279次参与者观察中识别出心理健康和代谢领域的候选关联,但研究明确这些结果不等同于临床验证或因果结论。
推荐理由:该框架将统计计算、生成式推理与对抗验证结合,覆盖数据泄漏、过拟合和混杂因素等问题;其多队列结果与专家盲评为可穿戴生物标志物研究提供了可复用的工作流参考。
Google Research提出Mobility-Embedded POIs(ME-POIs),将文本描述与公共基准数据中的聚合、匿名化移动模式结合,用于表示地点随时间变化的活跃节奏。该框架在洛杉矶和休斯敦的未见地点测试中,访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。研究强调其面向地点和商业聚合理解,不用于个人用户分析或个性化。
推荐理由:ME-POIs把匿名化、聚合的移动模式引入地点表示,报告了未见地点预测任务的量化提升,适合关注时空表示学习与地点属性预测的团队参考。