跳到正文

#产品与发布

今日 11 条
7月30日周四
  1. Google DeepMind Blog70

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,用于机器人视频理解、任务编排和多机器人协作,并通过 Gemini API 与 Google AI Studio 向开发者公开提供,Gemini Enterprise Agent Platform 提供私有预览。

    推荐理由:正式发布并开放接入,兼顾视频进度判断、工具编排和多机器人协作,给机器人应用开发者提供可直接评估的模型与接口。

  2. WebKit Blog73

    Safari Technology Preview 249 发布

    Safari Technology Preview 249 已开放下载,支持 macOS Golden Gate 和 macOS Tahoe,已安装用户可通过“系统设置”的“软件更新”进行更新。

    推荐理由:发布说明按 Web API、CSS、JavaScript 等领域列出变更与修复,便于前端开发者和测试人员核对兼容性、定位回归并安排预览版验证。

  3. Google DeepMind Blog52

    Google 在 Flow Music 中推出 Lyria 3.5

    Google 在 Flow Music 中推出音乐生成模型 Lyria 3.5,改进音乐性、歌词、演唱质量和创作控制。新模型可生成更丰富、更自然的旋律结构,提升歌词质量、提示遵循能力、结构意识、演唱表现与发音,并更方便地控制输出速度和时长。

7月28日周二
  1. Google DeepMind Blog72

    Google DeepMind 发布 Gemini Robotics 2 机器人模型系列

    Google DeepMind 发布 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,覆盖全身控制、具身推理与端侧运行。

    推荐理由:正式公布机器人控制、具身推理和端侧运行三类模型,并给出开放方式、适配范围与安全基准,便于机器人团队评估集成路径和早期访问条件。

7月27日周一
  1. Open WebUI 官方发布86

    Open WebUI v0.11.0 发布:重做界面并强化安全与协作

    Open WebUI v0.11.0 发布,重做用户界面,并新增子代理、文件夹页面、聊天计时器、通知目标、开放分享和聊天变量等功能。版本还加入 Anthropic API 透传、LDAP 组同步、OpenSERP 搜索及多项性能优化,同时修复终端文件预览、跨会话写入、权限绕过和请求处理等安全与访问控制问题;官方建议生产部署尽快更新。

    推荐理由:这次更新覆盖界面重做、子代理、文件夹协作、通知与分享机制,并集中修复多项访问控制和安全漏洞;生产部署可据此评估升级优先级,但需结合现有配置验证兼容性。

7月23日周四
  1. Hugging Face Blog76

    Diffusers 原生支持 Nunchaku Lite 4-bit 扩散模型推理

    Diffusers 现已原生支持 Nunchaku Lite,可通过 `from_pretrained()` 加载 W4A4 量化检查点,无需单独推理引擎或本地 CUDA 编译。文章介绍 NVFP4、INT4、AWQ 量化配置、GPU 支持范围及 diffuse-compressor 工具链,并展示其在 RTX PRO 6000 上降低显存和延迟的基准结果。

    推荐理由:Nunchaku Lite 已原生接入 Diffusers,可直接加载 4-bit 量化检查点,并提供模型量化、打包与发布流程。文中还给出硬件支持范围、性能基准和兼容性限制,适合评估低显存部署方案。

  2. WebKit Blog65

    Safari Technology Preview 248 发布,新增 WebDriver 数字凭证支持

    Safari Technology Preview 248 现已提供 macOS Golden Gate 和 macOS Tahoe 下载,已安装用户可通过系统设置更新。新版本加入 TC39 BigInt Math 提案和 WebDriver 对 Digital Credentials API 的支持,并更新 CSS、媒体、安全、Web API 及 Web Inspector 等功能与修复。

    推荐理由:本次预览版集中更新 WebKit 的 CSS、JavaScript、Web API、WebDriver 与媒体能力,并修复安全、可访问性和 Web Inspector 问题;适合开发者提前验证兼容性变化。

7月21日周二
7月17日周五
  1. Google DeepMind Blog63

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。该模型将通过 CodeMender 面向政府及可信合作伙伴开展限量试点;Google 称其已在 Chrome、Android、Cloud、Ads 和 YouTube 内部代码库中用于查找和修复漏洞。

    推荐理由:官方测试与内部应用数据可用于评估轻量模型在漏洞发现、验证和修复中的效率、成本与部署边界,但合作方成绩仍有待独立验证。

7月16日周四
  1. Hugging Face Transformers71

    Hugging Face Transformers 发布 v5.14.0

    Hugging Face Transformers 发布 v5.14.0,新增来自 Thinking Machines 的 Inkling 通用多模态模型及 TIPSv2。该版本加入 Multi-Token Prediction 解码、推测解码静态集成验证,并优化缓存、内核与 MoE 解码性能;同时 GPTNeoX 和 GPTBigCode 存在需要更新代码的兼容性变化。

    推荐理由:版本新增 Inkling 多模态模型、MTP 解码与生成优化,并修复 vLLM 兼容、性能回归及缓存等问题;GPTNeoX 权重命名变更和 GPTBigCode 注意力后端调整值得升级前核查。

7月15日周三
7月13日周一
  1. Google DeepMind Blog54

    Google DeepMind与Atal Tinkering Labs启动ATL Saathi试点

    Google DeepMind与Atal Tinkering Labs启动ATL Saathi实时试点,这款Gemini驱动的网页应用为Tinkering Lab教师提供全天候规划与培训助手。它可整理12个核心模块,并为其中10个模块生成项目创意、组装说明、接线图和安全须知,同时首批支持8种语言。应用正在面向全印度100所试点学校推出,后续效果仍待教师反馈验证。

7月11日周六
  1. Hugging Face Transformers51

    Transformers 发布 v5.13.1 补丁版

    Hugging Face Transformers 发布 v5.13.1,重点是使 Transformers 支持最新版 vllm。该版本还改进了自定义模型的 remap_legacy_layer_types 处理,修复了不认识新线性层名称的自定义代码,以及 _LazyAutoMapping.register 接收字符串键时的问题。

7月9日周四
  1. Google Research Blog67

    Google Research 提出 SensorFM:面向可穿戴健康数据的通用表征

    Google Research 提出 SensorFM,以超过一万亿分钟、来自500万名参与者的多模态传感器数据进行预训练,学习可跨多类健康任务复用的生理表征。

    推荐理由:该研究给出大规模无标签传感器预训练、缺失数据处理及跨健康任务评估的完整结果,对可穿戴健康模型的统一表征与低成本适配具有参考价值。

7月8日周三
  1. Kubernetes Blog77

    SIG etcd发布etcd v3.7.0,引入RangeStream并完成V2存储清理

    SIG etcd发布etcd v3.7.0,加入RangeStream、仅键范围查询优化、租约改进和Unix socket支持。该版本完全基于v3store引导,但包含V2 API及相关组件移除等破坏性变更,依赖Go模块、镜像部署和实验参数的用户需在升级前检查兼容性。

    推荐理由:etcd v3.7.0带来RangeStream、性能优化及v3store引导等重要变更,同时移除旧版V2组件并调整容器镜像分发方式;升级前需重点核查兼容性、依赖和部署配置。

  2. Brave Blog68

    Brave发布改进版 Place Search API,统一提供全球地点检索

    Brave发布改进版 Brave Place Search API,公共用户可通过 Brave Search API 的 Search 计划调用,按每千次请求5美元计费。API 基于覆盖全球约2亿个兴趣点的索引,返回排名、地点信息、评分、营业时间、照片和距离等字段;官方以1,000次真实查询比较称,整体质量为6.4分对7.3分,覆盖率和部分长尾查询表现较强,但精度低于 Google Maps。

    推荐理由:Brave正式开放改进版地点搜索API,提供统一的全球兴趣点检索、结构化字段与统一计费,适合个人开发者和小团队评估地图、地点发现及AI应用集成方案。

7月7日周二
  1. Hugging Face Blog70

    Microsoft 推出 Foundry Managed Compute 与 Hugging Face 模型目录

    Microsoft 在 Microsoft Build 2026 宣布 Foundry Managed Compute,以及可一键部署到该服务的 Hugging Face 模型目录。预览版提供每周更新的多模态开放权重模型、预置 Azure 权重与经扫描的运行时,并支持 A100、H100 和 AMD MI300X 加速器及统一 Foundry 端点。

    推荐理由:预览版将经筛选的开放权重模型、周更目录、托管运行时和企业治理整合到同一部署流程,适合评估多模型应用的选型与落地路径。

  2. Hugging Face Blog71

    Hugging Face 与 SkyPilot 推出零出站存储的跨云 AI 工作负载方案

    Hugging Face 与 SkyPilot 联合推出 `store: hf`,可通过 `hf://` URL 将 Hugging Face Bucket 或 Hub 仓库挂载到 SkyPilot 任务,并在 20+ 云、Kubernetes、Slurm 和本地集群间调度 GPU。

    推荐理由:为跨云运行 AI 工作负载提供统一存储接入,团队可按 GPU 资源调度云端或本地集群,减少跨云读取成本与迁移负担。

7月4日周六
  1. Hugging Face Transformers80

    Hugging Face Transformers 发布 v5.13.0

    Hugging Face Transformers v5.13.0 新增 KimiK 2.5、MiMo-V2-Flash、Qwen3 ASR、MiniCPM3 等模型支持。

    推荐理由:新增多类模型支持、统一导出接口并集中修复生成、缓存与量化问题,同时包含迁移要求,升级前需核对兼容性。

7月1日周三
  1. Open WebUI 官方发布72

    Open WebUI v0.10.2 发布,新增推理流与多项管理配置

    Open WebUI v0.10.2 新增流式 reasoning 展示、知识库文件夹上传、记忆系统上下文开关,以及 Ollama 和 OpenAI API 的环境变量配置。版本同时修复意外登出、SQLite 升级、Python 代码执行加载等问题,并包含尚未完全披露的安全与访问控制修复,官方建议生产部署尽快更新。

    推荐理由:本版本集中更新推理流展示、知识库目录、记忆、语音转写和 API 配置,并修复多项登录、数据库升级与代码执行问题;官方还建议生产部署尽快升级,适合 Open WebUI 使用者评估更新。

  2. Google Research Blog67

    Google Research 将 Heat Resilience 数据扩展至全球 50 多个城市

    Google Research 发布覆盖全球 50 多个城市、9 个国家的建筑级屋顶反射率扩展数据集,并通过 Heat Resilience Earth Engine App 公开提供。

    推荐理由:扩展数据集与 Earth Engine App 为城市规划提供建筑级屋顶反射率,30厘米分辨率和公开下载能力有助于定位降温干预对象,兼具研究与实践价值。

6月30日周二
  1. Google Research Blog70

    Google发布面向表格数据的零样本基础模型TabFM

    Google发布TabFM,一种面向表格数据分类与回归的零样本基础模型,可通过单次前向推理处理未见过的新表。模型采用行列交替注意力、行压缩和上下文学习架构,并完全使用数亿个合成数据集训练;现已提供于Hugging Face和GitHub,并原生集成至Google Cloud BigQuery。

    推荐理由:TabFM将表格分类与回归改写为零样本上下文预测,并通过BigQuery开放使用,适合评估减少特征工程和调参工作的企业分析方案。

  2. Open WebUI 官方发布81

    Open WebUI 发布 v0.10.0,新增协作、知识库与事件扩展能力

    Open WebUI 发布 v0.10.0,加入文件夹共享、长对话自动压缩、Computer agent、外部知识库、重构记忆系统及 Event 函数,并提供 Webhook 事件和管理端认证配置。

    推荐理由:新增团队文件夹共享、事件与 Webhook、外部知识库、记忆系统和 Event 函数,并强化权限、认证、会话隔离与多项性能;数据库迁移和默认工具调用方式变化需升级前评估。

6月26日周五
  1. Kubernetes Blog66

    Headlamp 发布 Cluster API 插件首个 Alpha 版本

    Headlamp 发布 Cluster API 插件首个 Alpha 版本,为浏览器中的 Kubernetes 集群生命周期管理提供专门界面。

    推荐理由:首个 Alpha 版本将 Cluster API 资源、拓扑关系、扩缩容与引导配置集中到 Headlamp,并为平台团队提供可视化排障入口;其适用边界和后续改进仍需社区验证。

6月25日周四
  1. Google DeepMind Blog75

    Google DeepMind 将 computer use 原生整合至 Gemini 3.5 Flash

    Google DeepMind 在 Gemini 3.5 Flash 中原生提供内置的 computer use 工具,可让智能体在浏览器、移动端和桌面环境中观察、推理并执行操作。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 使用;Google 还提供可选的企业防护系统,用于敏感或不可逆操作确认及识别间接提示注入后自动停止任务。

    推荐理由:把此前独立的 computer use 模型原生整合进 Gemini 3.5 Flash,并提供企业安全控制与参考实现,便于开发者评估和构建跨平台智能体。

6月23日周二
  1. Python Insider71

    Python 3.15.0 beta 3 发布,进入功能冻结前的测试阶段

    Python 3.15.0b3 已发布,这是计划中的四次 beta 预览之一,自 3.15.0b2 以来包含约 195 项缺陷修复、构建改进和文档变更。该版本仍不推荐用于生产环境,官方建议常规生产版本等待 3.15.0rc1,以降低 ABI 变更风险;下一次预发布版本 3.15.0b4 计划于 2026-07-18 发布。

    推荐理由:官方发布信息明确了测试范围、兼容性风险与后续节点,适合 Python 项目维护者评估升级准备和生产环境使用边界。

  2. Home Assistant Blog78

    Home Assistant 发布基于 matter.js 的 Matter Server 9.0

    Open Home Foundation 发布基于 matter.js 重建的 Home Assistant Matter Server app 9.0,作为原 Python 服务器的兼容替代方案。更新支持 Matter 1.5.1、Thread 1.4 和更新后的 OTBR,并提供网络可视化、设备重连加速及证书撤销检查;首次启动将自动迁移数据。

    推荐理由:基于 matter.js 重建 Matter Server,并同步升级 Matter 与 Thread 支持,直接影响 Home Assistant 用户的迁移、网络稳定性及设备兼容性判断。

6月17日周三
  1. Google DeepMind Blog54

    Google DeepMind与英国政府开发AI规划原型,加速住宅规划审批

    Google DeepMind与英国政府共同开发面向地方规划部门的AI规划原型,目标将规划申请的决策处理时间缩短50%。该原型已在Barnet、Camden和Dorset开展早期试用,可汇总资料、标记相关政策、归纳反馈并起草评估报告,但最终决定权仍由规划人员掌握。政府计划从2027年向英国所有地方议会提供该工具。

  2. Google Research Blog71

    Google发布用于自然恢复规划的Earth AI矢量数据集

    Google Research发布基于Earth AI的矢量数据集,将Farmscapes 2020中的地图转换为可操作的树篱、石墙和小树林清单。方法结合高分辨率深度学习、亚米级影像、1米LiDAR和Google Earth Engine,用于识别并分类英格兰数百万个精细尺度地物。Google还表示将继续研究其在林牧复合系统及“泄漏”识别中的用途。

    推荐理由:将此前高分辨率栅格地图转为可操作的矢量数据集,补充了生态规划与碳核算所需的精细尺度信息。

6月11日周四
  1. Google DeepMind Blog72

    Google DeepMind 发布 DiffusionGemma,专用 GPU 上文本生成最高提速 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,以文本扩散并行生成整块文本,在专用 GPU 上最高实现 4 倍文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,单张 NVIDIA H100 可达 1000+ tokens/s,量化后可装入 18GB VRAM 的高端消费级 GPU。

    推荐理由:提供开放权重、硬件吞吐数据和微调工具链,并明确适用场景与质量取舍,便于开发者评估速度敏感型本地工作流是否值得试用。

6月10日周三
  1. Python Insider64

    Python 3.14.6与3.13.14正式发布

    Python 3.14.6和Python 3.13.14现已发布,分别作为3.14系列第六个和3.13系列第十四个维护版本。自上一版本以来,3.14.6包含约179项错误修复、构建改进和文档变更,3.13.14则包含约240项相关变更。

    推荐理由:为Python 3.14和3.13用户提供明确的维护更新范围与修复规模,便于团队评估升级、排障和兼容性影响。

6月9日周二
  1. Google DeepMind Blog73

    Google 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,可自动检测 70 多种语言并持续生成近实时语音到语音翻译,保留说话者的语调、节奏和音高。模型通过 Gemini Live API 和 Google AI Studio 面向开发者公测,Google Meet 企业私有预览同月开始,Google Translate 则在 Android 和 iOS 全球推出。

    推荐理由:明确覆盖模型能力、开发者接口、企业预览和移动端上线路径,并区分公测、私有预览与全球推出,便于评估实时语音翻译的可用范围和接入方式。

  2. Google DeepMind Blog74

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的统一无编码器多模态模型,可直接处理视觉和音频输入。

    推荐理由:Gemma 4 12B把视觉、音频输入直接接入语言模型骨干,兼顾多模态推理与本地运行资源要求;其开源权重、部署工具和开发文档对想在笔记本上构建智能体应用的团队具有较高实用价值。

6月5日周五
  1. Google Research Blog69

    Google Research 发布 Gemini Enterprise Agent Platform 托管版 Agentic RAG

    Google Research 推出由 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,并加入 Agentic RAG 与 Sufficient Context Agent,以支持多数据源、多跳查询和缺失信息的迭代检索。

    推荐理由:Google以官方研究结果说明了该平台托管版的工作机制、评测设置与公开预览状态,对评估企业多数据源检索的可追溯性和准确性具有直接参考价值。