跳到正文

#AI

今日 0 条
9月10日周四
  1. NVIDIA Developer Blog41

    何时使用 EPD 分离加速多模态模型服务

    Encode-Prefill-Decode(EPD)分离通过拆分视觉编码器阶段与 prefill、decode 阶段,加速多模态模型推理。该技术最适合图像较多的提示、短至中等长度输出,以及量化 MoE 模型。NVIDIA Dynamo 实践指南进一步说明了 EPD 分离的使用时机与方法。

  2. Google AI Blog53

    Google Search推出橄榄球赛事新功能

    Google Search推出Live Game Feed、赛事与球员详细统计,并支持连接Yahoo Fantasy或Sleeper账户获取AI Mode定制建议。Live Game Feed现于美国英语移动端提供本月晚些时候扩展大学队及更多地区,统计更新和比赛轮播将在全球移动端提供。

9月9日周三
  1. Microsoft 开发者博客64

    你的工作可能不需要最智能的模型

    GPT-6 Astra 在三项代码升级场景中的表现并不始终优于 Claude Sonnet 4.6,部分场景成本却明显更高。文章建议先明确任务要求和可容忍的失败,再用固定场景、工作区和 agent 配置比较模型,并在 agent 或扩展更新后重新评估。

    推荐理由:文章用三项升级场景比较 GPT-6 Astra 与 Claude Sonnet 4.6 的质量、成本和配置影响,适合团队据此建立固定场景评测,避免盲目追求更强模型。

  2. Docker Blog45

    沙箱环境的六项优势及 Docker Sandboxes 的实现方式

    Docker Sandboxes 通过独立 microVM、运行时网络与文件系统策略、主机凭据保护及可快速重建的临时环境,为自主运行的 AI 代理提供隔离边界。每个沙箱拥有独立 Linux 内核,凭据保存在主机钥匙串中并仅注入出站请求,任务结束后可删除环境并按代码配置重建。原文还指出,Docker Sandboxes 提供真实 Linux 开发环境,并支持多个代理并行运行。

  3. Kubernetes Blog80

    Kubernetes v1.37 推进工作负载感知调度

    Kubernetes v1.37 将 Workload、PodGroup、gang scheduling、Workload-Aware Preemption 及 PodGroup 的 DRA ResourceClaim 支持推进至 Beta,并引入 CompositePodGroup API。

    推荐理由:涵盖 API 升级、层级调度、抢占、拓扑约束与控制器集成,能帮助团队评估复杂批处理和分布式工作负载的升级影响。

9月8日周二
  1. Google DeepMind Blog80

    Google DeepMind 发布 AlphaGenome Atlas 人类基因组变异预测图谱

    Google DeepMind 发布 AlphaGenome Atlas,收录人类基因组中90亿个单核苷酸变异的分子效应预测。该平台提供 AVI 评分、特征归因和超过2500种 DNA 序列基序,现可通过网站及 AlphaGenome API 使用;其基础模型尚未获准用于临床用途。

    推荐理由:将90亿个单核苷酸变异预测整理为可检索资源,并提供AVI评分与特征归因,有助于研究人员开展变异排序和机制分析。

  2. Elastic Blog44

    Elastic{ON} 2026 全球巡回活动将于9月启动,延续至2027年3月

    Elastic{ON} 2026 将于9月启动,途经孟买、纽约、阿姆斯特丹、旧金山、伦敦、新加坡和华盛顿特区,并安排一场数字活动。活动设置搜索、安全和可观测性三条面向实践者的专题轨道,涵盖主题演讲、工作坊、客户案例、现场演示及 Elastic 下一次版本预览;Elastic 即将推出的 AI SRE 将在可观测性专题中展示自主检测、调查和解决事件的能力。

  3. GitLab Blog75

    在 GitLab Duo Self-Hosted 中接入 Microsoft Foundry 模型

    GitLab Duo Self-Hosted 可通过本地 AI Gateway 接入 Microsoft Foundry 托管的模型,并按 GitLab Duo 功能分别配置模型。文章还说明数据路径、模型兼容性、部署条件、健康检查、日志验证及模型选择注意事项;Foundry 目录中的模型不一定已获 GitLab 支持。

    推荐理由:教程覆盖模型部署、AI Gateway 配置、功能级模型分配、数据路径与验证方法,并强调 GitLab 支持矩阵和 Microsoft Foundry 可用性需双重核对,适合自托管团队落地时参考。

  4. Redis Blog70

    使用 Databricks Real-Time Mode 与 Redis 实现实时个性化

    Databricks Real-Time Mode 与 Redis 可将点击流连续转换为实时个性化推荐,并在应用请求路径中低延迟提供结果。教程通过 Kafka、ForeachWriter、Redis Sorted Set 与 Hash 展示实现过程,网站每次渲染仅执行一次流水线读取。

    推荐理由:给出从Kafka摄取、RTM会话评分到Redis低延迟读取的完整实现路径,并以吞吐量和p99延迟数据验证方案,适合评估实时推荐架构及迁移成本。

9月7日周一
  1. AWS News Blog71

    AWS Weekly Roundup:Claude Fable 5.1 上线 AWS、Amazon Linux 2027 预览及多项服务更新(2026年9月7日)

    AWS Weekly Roundup 汇总了 Claude Fable 5.1 在 AWS 上线、Amazon Linux 2027 公测以及多项 AWS 服务更新。

    推荐理由:汇总了模型、云实例、操作系统、Lambda、Agent Registry、Redshift 与认证等更新,并说明数据保留和访问方式,适合跟踪 AWS 近期功能与兼容性变化。

9月5日周六
  1. Anthropic Python SDK54

    Anthropic Python SDK v1.4.0 发布

    Anthropic Python SDK v1.4.0 于2026-09-04发布,新增 Claude Tag 分类、用户使用报告拆分和组织合规设置状态命名类型。该版本还支持更多端点发送 workspace ID,修复消息资源自定义代码合并问题,并对传入 httpx 对象而非 httpx2 对象时返回更清晰的错误。

9月4日周五
  1. Elastic Blog64

    为什么 token 价格下降 75%,AI 账单却增至三倍?

    Elastic 分析称,token 混合单价过去一年下降约 75%,但代理式工作流常消耗聊天机器人任务 5 至 30 倍的 token,使企业 AI 账单仍持续上升。文章建议先按代理运行记录输入输出 token、模型、重试次数和任务完成状态,再以单个完成任务成本等指标替代单纯 token 看板。

    推荐理由:解释代理式工作流因多轮推理、重试和上下文重复而推高成本,并给出按任务采集指标、比较运行差异的实践方法。

  2. Docker Blog61

    YOLO 模式:在受控边界内使用 AI 代理自主执行任务

    YOLO 模式是让 AI 代理自动批准并执行文件读写、命令和工具调用的运行方式,风险主要取决于代理所在环境。文章建议在隔离、临时且无真实凭据的环境中运行,并通过限定网络、文件系统和工具访问范围控制影响。

    推荐理由:文章围绕编程代理的 YOLO 模式说明风险边界与使用前提,并结合隔离沙箱、权限范围和临时环境给出可执行的实践建议。

  3. Framework Blog77

    Framework Desktop 本地 AI 内存配置指南:32GB、64GB 与 128GB

    Framework Desktop 以 32GB、64GB 和 128GB 三种内存配置运行本地 AI,并根据截至 2026 年 8 月的测试给出模型、量化与推理引擎建议。32GB 可通过合适量化运行 Qwen3.8-27B,并支持图像、编辑及短视频生成;64GB 可使用更高精度或更大模型,128GB 则在模型选择、量化方式和上下文空间上最宽。

    推荐理由:按32GB、64GB和128GB给出模型、量化与引擎选择,并结合Linux实测和图像视频工作流,助于本地AI配置决策。

  4. Google Research Blog79

    Google Research与HHMI Janelia等合作完成雄性果蝇全脑连接图

    Google Research、HHMI Janelia及剑桥大学等地合作者完成了雄性果蝇脑与中枢神经系统的完整连接图,包含超过166,000个神经元和1.25亿个突触连接。该图已通过人工专家标注与校验,可通过开源工具Neuroglancer查看、探索和下载,研究团队称其为迄今按神经元数量计最大的脑图谱。

    推荐理由:完整雄性果蝇脑与中枢神经连接组具有重要科研价值,公开数据与验证流程可为神经科学研究提供可复用的基础资源。

9月3日周四
  1. Google DeepMind Blog72

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3 全球天气 AI 模型,引入实时卫星数据,提供逐小时、最高 5 公里的全球预报。

    推荐理由:明确披露模型分辨率、逐小时更新机制、降水评估与产品接入范围,便于开发者判断数据可用性、集成路径及预报应用价值。

  2. Hugging Face Blog72

    H Company 发布 NeoMME 多语言多模态编码器

    H Company 发布 NeoMME,一套 260M 和 800M 参数的多语言多模态编码器,以单一双向 Transformer 同时处理文本 token 和原始图像 patch,不依赖独立预训练视觉塔或因果语言模型。

    推荐理由:同时公布模型、技术报告与 Transformers 支持,并给出检索效果、压缩和吞吐数据,便于评估小团队构建多模态检索与 visual RAG 的成本和可行性。

  3. Hugging Face Blog60

    funes 为编码代理提供本地、可溯源的记忆层

    funes 为 Claude Code、Codex、pi 和 Hermes 提供本地运行的持久记忆层,通过增量索引、混合检索和重排序返回原始会话记录及来源。安装后可使用 recall 和 get 在对话中检索历史内容,也可用 ask 发起只读查询;绑定 Hugging Face dataset 后,记忆可跨机器使用,并在发布前进行凭据脱敏和秘密扫描。

    推荐理由:介绍 funes 的本地记忆索引、跨代理检索与共享机制,并给出安装和查询方式,便于评估其隐私、溯源及协作价值。

  4. Hugging Face Blog77

    使用 TRL 和 OpenEnv 训练编码模型绘制水彩画

    文章作者使用 TRL 和 OpenEnv 开源复现了训练语言模型生成 p5.brush JavaScript 水彩画的方法,基于 Qwen/Qwen3.5-35B-A3B 和人工评级的 178 幅参考画训练并比较三种奖励组合。

    推荐理由:文章提供完整工程复现路径与公开产物,涵盖奖励设计、训练配置、基础设施故障处理和三种奖励权重对比,适合小团队评估审美强化学习实验的实现成本与可复现性。

  5. Hugging Face Blog84

    使用100步GRPO微调LFM2.5-350M以提升结构化输出能力

    LFM2.5-350M通过TRL进行100步GRPO微调后,在IFStruct基准上的通过率由22.6%提升至29.7%。教程使用约500条训练样本和LoRA,涵盖奖励函数、GPU训练配置、GGUF转换及基于llama.cpp的复测流程。

    推荐理由:提供从基线评测、GRPO与LoRA训练到GGUF转换和复测的完整流程,并明确硬件、配置与结果,便于低成本验证结构化输出微调方案。

  6. Elastic Blog62

    腾讯云与 Elastic 联合发布 Tencent Cloud ES 企业版

    腾讯云与 Elastic 在深圳宣布深化合作,并联合推出 Tencent Cloud Elasticsearch Service (ES) Enterprise Edition。企业版支持关键词与语义搜索、模型和智能体调用搜索结果;原文称,所选 AI 搜索场景性能最高提升 5 倍,混合搜索延迟降低 60%,内存消耗减少超过 50%。

    推荐理由:给出了企业版能力边界、性能指标和真实场景数据,便于评估搜索增强AI方案的兼容性与迁移成本。

  7. NVIDIA Developer Blog77

    现代 CUDA 工具箱实践:六步优化 CUDA 图像处理代码

    NVIDIA 通过六步改造 CUDA 图像处理示例,依次使用 Compute Sanitizer、CCCL API、NVTX、CUB、内存池、固定内存和 CUDA streams 提升代码安全性与性能。示例中,中位计算从 2.142 秒降至 773 微秒,整体处理时间从 6.8 秒降至约 23 毫秒,文章同时提供代码和 Google Colab 练习。

    推荐理由:通过六步递进演示如何用 NVIDIA 工具定位 CUDA 错误、分析瓶颈并改善数据传输与执行并行性,适合需要系统排查和优化 GPU 程序的个人开发者。