跳到正文

#数据

今日 1 条
今天10月3日周六
  1. TechSpot54

    新加坡政府推出并测试公共官员约会应用 FirstDate

    新加坡政府数字公共服务机构 GovTech 推出 FirstDate 试点 dating service,面向 21 至 35 岁未婚公共官员,包括丧偶和离异人士。参与者使用 Singpass 登录并填写兴趣、习惯、价值观和偏好问卷,系统通过 Gale-Shapley 算法提供单一匹配,双方有 72 小时决定是否联系;申请截至 Oct. 5,GovTech 尚未决定是否扩大试点。

10月2日周五
  1. Cloudflare Blog66

    Cloudflare推出Pay Per Use内容按使用付费测试版

    Cloudflare推出Pay Per Use测试版,让AI公司为特定内容用途报价,出版方决定是否接受,并按月通过Cloudflare结算。买方通过单一API报告每次使用,出版方可在控制台查看报价、使用次数和收入;Cloudflare同时发布基于开放x402协议、按请求向代理收费的Monetization Gateway测试版。

    推荐理由:Cloudflare以按实际使用付费替代按抓取收费,给出版权方和AI买方提供报价、接受、报告、计费与结算闭环,且已进入测试阶段,适合评估内容商业化接入路径。

  2. Cloudflare Blog79

    Cloudflare Basin 正式发布:基于 Apache Iceberg 与 R2 的无服务器数据平台

    Cloudflare 宣布 Basin 数据分析平台正式可用,包含 Basin Pipelines、Basin Catalog 和 Basin SQL,覆盖数据摄取、Apache Iceberg 元数据管理与查询。

    推荐理由:明确列出 Basin 三项服务的正式可用状态、数据链路与兼容性,适合评估事件摄取、Iceberg 管理和分布式查询的组合方式。

10月1日周四
9月30日周三
  1. Google DeepMind Blog74

    Google DeepMind 推出 SynthID Bio 蛋白质水印方法

    Google DeepMind 发布 SynthID Bio,将不可见水印嵌入蛋白质序列和预测的三维结构,实验室测试显示其未损害目标蛋白的生物功能。研究还将其应用于 Evo 2 设计的噬菌体基因组,并公开方法论文、代码、体外数据及研究权重。

    推荐理由:提供面向蛋白质序列与三维结构的可验证水印概念验证,并公开方法论文、代码、体外数据和研究权重,适合评估 AI 生物设计的溯源与筛查方案。

9月29日周二
  1. PostgreSQL News67

    Dasha 1.8新增索引建议、I/O分析、模式检查与日志洞察

    Dasha 1.8为PostgreSQL集群性能监控工具,新增基于多主机统计的索引建议、I/O分析、17项模式检查和日志洞察功能。它可读取每个集群主机及副本的信息,支持索引分析、查询与锁等待监控、快照对比,并提供只读MCP连接器。监控集群要求PostgreSQL 14或更新版本,I/O页面要求PostgreSQL 16或更新版本。

    推荐理由:Dasha 1.8补齐索引建议、I/O分析、结构检查与日志洞察,适合需要跨集群诊断和查询计划分析的PostgreSQL小团队;正文同时列出版本、权限及可选组件要求,便于评估部署成本。

9月28日周一
  1. 开源中国资讯30

    DataTalk Studio 开源:用对话完成报表开发的 AI-native BI 工作区

    DataTalk Studio 是一个面向数据分析师、业务人员和开发团队的 AI-native BI 工作区,旨在通过自然语言完成报表创建、修改、校验、发布和复用。该项目尝试将数据源管理、指标定义、SQL 编写、图表配置与报表发布等传统 BI 环节整合到同一工作区,减少用户在多个工具之间切换。

9月24日周四
  1. PostgreSQL News69

    PostgreSQL 19 Beta 4 发布

    PostgreSQL 19 第四个测试版 Beta 4 已开放下载,包含正式发布前的功能预览,细节在测试期仍可能变化。项目计划于10月初进入候选版本阶段,PostgreSQL 19 GA 也可能于10月推出;本版回退 SQL/PGQ、数据校验和在线启停等多项功能,并修复 REPACK、WAIT FOR、逻辑复制及 autovacuum 等问题。

    推荐理由:本次发布列出 Beta 4 的回退与修复范围,可供用户评估升级风险、兼容性及后续测试重点。

9月22日周二
  1. Redis Blog66

    Redis Cloud Pro Preview 推出分层存储版 Search on Flex

    Redis 在 Redis Cloud Pro Preview 中推出 Search on Flex,将 Redis Search 索引置于 Flex 分层存储,同时保持查询、索引定义和客户端不变。完整索引位于 SSD,仅热元数据留在 RAM,内存占用约为等效内存索引的 10%;预览版功能少于 Redis Software,相关差距计划后续补齐。

    推荐理由:将搜索索引置于分层存储,可让小团队在保留原有 API 的同时评估 TB 级检索的内存与延迟取舍;预览版现有功能边界也值得在采用前核对。

  2. PostgreSQL News66

    PostgresCompare 2.2.0 发布,重建架构并加入数据库流水线与 MCP server

    PostgresCompare 2.2.0 发布,这是该专有产品自 1.2.2 以来的首次公开发布,也是其历史上最大的一次改动。2.x 系列新增数据库流水线、即时比较、数据变更脚本、面向 AI agent 的 MCP server 和六种界面语言,并从 Electron 迁移至 Tauri;该版本支持 Windows、macOS 和 Linux,提供 14 天免费试用。

    推荐理由:这是 PostgresCompare 首次公开 2.x 版本,架构迁移并加入数据库流水线、快速比较、数据变更脚本和 MCP server;还提供跨平台下载、14 天试用及 1.2.2 直接升级路径,便于评估迁移工具能力与部署成本。

  3. Redis Blog60

    Redis 发布多项企业级能力,涵盖运维、数据集成、扩缩容与搜索

    Redis 宣布推出 Redis Radar、Datadog 集成、多源多管道 RDI、Smooth Scaling 和 Redis Flex Search,覆盖跨环境管理、数据统一、容量调整及 SSD 索引搜索。RDI 支持将多个系统的数据同步至 Redis,Smooth Scaling 用于 Redis Cloud Pro,但扩缩容仍需用户主动发起。

    推荐理由:覆盖 Redis 部署管理、可观测性集成、数据同步、容量调整和大规模搜索,发布信息具体;其中平滑扩缩容仍由用户触发,有助于架构团队准确评估运维与容量规划边界。

9月18日周五
  1. Google AI Blog63

    联合国系统推出面向全球数据的开放平台 UN System Data Commons

    联合国系统推出基于 Google Data Commons 构建的开源平台 UN System Data Commons,将分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。

    推荐理由:联合国系统借此把分散的统计数据统一到可搜索平台,并用自然语言查询和 AI 助手降低研究使用门槛,对研究、报道和政策分析具有直接价值。

9月16日周三
9月14日周一
  1. Redis Blog73

    Redis 8.10 发布:引入紧凑 Hash、JSONPath 扩展与增量备份

    Redis 8.10 已在 Redis Open Source 中正式推出,新增紧凑 Hash、JSONPath 扩展及增量备份与恢复,并优化 Streams 等数据结构。紧凑 Hash 可降低最高 50% 的内存用量并提升最高 2 倍加载吞吐量,备份机制通过 BASE、INCR 和 manifest 协调分片,降低集中创建快照造成的资源峰值。

    推荐理由:覆盖内存与吞吐优化、数据结构命令扩展及集群增量备份,可为Redis 8.10升级评估、容量规划和运维改造提供明确依据。

9月10日周四
  1. AWS News Blog68

    Amazon EBS推出跨AWS账户卷克隆功能

    Amazon EBS Volume Clones现已支持将卷复制到其他AWS账户,并可选择使用目标账户的AWS KMS密钥重新加密。复制需通过AWS RAM共享并接受资源共享,且源卷与副本必须位于同一可用区;该功能覆盖所有支持Amazon EBS Volume Clones的AWS区域。

    推荐理由:明确给出跨账户复制的授权、加密、监控、计费与可用区约束,便于团队评估数据隔离和测试环境复制方案。

9月3日周四
  1. Google DeepMind Blog72

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3 全球天气 AI 模型,引入实时卫星数据,提供逐小时、最高 5 公里的全球预报。

    推荐理由:明确披露模型分辨率、逐小时更新机制、降水评估与产品接入范围,便于开发者判断数据可用性、集成路径及预报应用价值。

9月2日周三
  1. Google Research Blog72

    Google发布MAPL-EMIT,用深度学习绘制全球甲烷排放

    Google与NASA JPL发布MAPL-EMIT深度学习框架,用于从EMIT高光谱卫星数据中进行全球甲烷羽流检测、增强定量、边界分割和源定位。模型在NASA专家标注数据上捕获84%的羽流,并发现约50%更多合理羽流;Google同时发布Earth Engine全球羽流数据库、Kaggle训练模型与合成羽流,以及GitHub推理库。

    推荐理由:MAPL-EMIT将高光谱卫星数据中的甲烷羽流检测、增强定量、边界分割和源定位整合为深度学习框架,并公开数据、模型与推理库,适合环境监测研究开展复现和后续开发。

8月28日周五
  1. Hugging Face Blog75

    Open ASR Leaderboard 新增首个全球南方语言评测集

    Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN,覆盖印度英语与印地语,并提供公开与私有划分。四个划分合计 4,888 名说话者、12 项说话者属性,Hindi 评测采用 OIWER 接受多种有效正字法;参与模型可按既有 GitHub 流程提交评估。

    推荐理由:新增面向印度英语与印地语的公开、私有评测集,并以说话者元数据和正字法 lattice 支持分组分析与可复现比较,能帮助团队识别 WER 掩盖的群体差异。

8月20日周四
  1. Grafana Blog69

    Grafana 13.2 发布:改进数据查询与面板探索

    Grafana 13.2 正式推出 Grafana Cloud 和 Grafana Enterprise 的 saved queries,支持团队共享、搜索、复用和基于角色的访问控制。

    推荐理由:正式引入共享查询库、Terraform 管理与全局入口,并以公开预览的查看侧栏降低只读用户排查面板的门槛,适合评估团队查询复用和治理方式。

8月13日周四
  1. Hugging Face Blog65

    AllenAI 在 OlmoEarth Studio 中开放定制嵌入向量导出

    AllenAI 的 OlmoEarth Studio 现可按需计算并导出 OlmoEarth 地球观测嵌入,结果为轻量 COG 栅格,并支持通过界面或 API 设置参数。输出可选 Nano、Tiny 或 Base 编码器,采用 int8 存储,可用于相似度搜索、少样本分割、变化检测和 PCA 探索;文章同时提供了可复现代码与 Colab notebook。

    推荐理由:提供可按区域、时间、编码器、分辨率和影像来源定制的地球观测嵌入导出,并给出分割与变化检测示例,便于验证下游分析流程。

8月4日周二
7月27日周一
  1. Hugging Face Blog65

    NVIDIA发布Cosmos-H-Dreams:面向外科机器人的实时生成式模拟器

    NVIDIA发布Cosmos-H-Dreams,一款面向外科机器人的实时、动作条件生成式模拟器,可在单张NVIDIA RTX PRO 6000上支持交互式闭环控制。

    推荐理由:NVIDIA发布了面向外科机器人的实时生成式模拟器及代码、模型和适配方法,公开了性能数字、训练流程与应用边界,对仿真评测和团队试验具有直接参考价值。

7月23日周四
6月17日周三
  1. Google DeepMind Blog54

    Google DeepMind与英国政府开发AI规划原型,加速住宅规划审批

    Google DeepMind与英国政府共同开发面向地方规划部门的AI规划原型,目标将规划申请的决策处理时间缩短50%。该原型已在Barnet、Camden和Dorset开展早期试用,可汇总资料、标记相关政策、归纳反馈并起草评估报告,但最终决定权仍由规划人员掌握。政府计划从2027年向英国所有地方议会提供该工具。

  2. Google Research Blog71

    Google发布用于自然恢复规划的Earth AI矢量数据集

    Google Research发布基于Earth AI的矢量数据集,将Farmscapes 2020中的地图转换为可操作的树篱、石墙和小树林清单。方法结合高分辨率深度学习、亚米级影像、1米LiDAR和Google Earth Engine,用于识别并分类英格兰数百万个精细尺度地物。Google还表示将继续研究其在林牧复合系统及“泄漏”识别中的用途。

    推荐理由:将此前高分辨率栅格地图转为可操作的矢量数据集,补充了生态规划与碳核算所需的精细尺度信息。

6月4日周四
  1. Google Research Blog69

    Google开源水文建模框架以支持AI洪水预报

    Google Research在GitHub开源水文建模框架、训练流程和文档,采用Apache 2.0许可,供研究人员和预报机构训练及微调洪水预报模型。框架包含LSTM模型和Caravan数据集训练流程,Google称新版相较前一版本将有测站流域的可靠预测期延长6天、无测站流域延长1天。Google还与CHMI合作验证其模型,并开发了接入Delft-FEWS的适配器。

    推荐理由:Google开源水文建模框架,提供模型架构、训练流程与文档,并支持本地数据接入及Delft-FEWS集成,便于机构构建和定制洪水预报模型。

3月12日周四
  1. Google Research Blog64

    Google Research 在 Flood Hub 推出 AI 驱动的城市山洪预报

    Google Research 宣布在 Flood Hub 推出 Urban Flash Flood forecasts,利用 Groundsource、AI 模型和实时天气预报,预测城市山洪未来24小时的风险。

    推荐理由:文章披露模型的数据构建、时空分辨率、适用范围与评估方法,并说明部分非洲地区仍缺少地面真值,便于判断试点成果及其验证局限。

  2. Google Research Blog71

    Google Research发布Groundsource:用Gemini将新闻报道转化为山洪数据

    Google Research发布Groundsource,利用Gemini从非结构化全球新闻中提取山洪事件的时间、地点和影响信息。团队公开了覆盖150多个国家、包含260万条历史记录的数据集;人工审核显示,82%的提取事件足以用于实际分析。基于该数据集,Google已能在Google Flood Hub推出近全球城市山洪提前24小时预报。

    推荐理由:Groundsource将全球新闻转化为结构化历史灾害数据,并公开提供260万条山洪记录;其时空精度、覆盖率与Google Flood Hub预测部署,为灾害建模和预警研究提供了可评估的数据基础。