使用 AIPerf 对大规模 LLM 推理进行基准测试
AIPerf用于对大规模LLM推理进行基准测试,替代依赖curl命令、自编asyncio脚本或一次性负载生成器的手工测试方式。现有测试方案可能受到单进程性能限制和Python GIL并发上限影响,AIPerf聚焦大规模部署场景下的推理性能测量。
AIPerf用于对大规模LLM推理进行基准测试,替代依赖curl命令、自编asyncio脚本或一次性负载生成器的手工测试方式。现有测试方案可能受到单进程性能限制和Python GIL并发上限影响,AIPerf聚焦大规模部署场景下的推理性能测量。
Google与UniBrescia、ENPC Paris合作推出MilleMiglia,用C++生成符合中程物流特征且不暴露私有信息的合成基准实例。其数据格式以Protocol Buffers序列化,在同一文件中纳入固定车辆时刻、配送中心吞吐限制和复杂同步前提。生成规模覆盖精确算法测试用小型问题、大陆级工业问题及机器学习训练数据集,源码、文档和示例实例已在GitHub提供。
Anthropic Python SDK v1.7.0 于 2026-09-18 发布,新增限流显示名称并弃用 group_type,同时为工具运行器加入 compact_before_next_turn()。该版本还修复 Bedrock 事件流错误处理、X | Y 联合类型解析和多个 anthropic-beta 请求头合并问题,并将 Pydantic 依赖要求提高至 1.10 或更高版本。
Google宣布扩展 AI & Economy Research Program,迎来2025年诺贝尔经济学奖得主 Philippe Aghion、教授 Ajay Agrawal 及多位研究人员,以推进人工智能影响经济活动的跨学科研究。
Google Envisioning Studio与Jane Wade、Sergio Hudson共创Styling Suite和Runway Visualization两款Google Flow工具,服务纽约时装周筹备。
OpenAI发布澳大利亚青少年安全蓝图,提出一项由六大支柱组成的路线图,旨在打造更安全的 AI 体验。该蓝图聚焦保护并赋能青少年。
GitLab 于 2026 年 9 月 17 日发布 GitLab 19.4,扩展 GitLab MCP server 的工具治理、项目、代码库、合并请求、工作项和漏洞管理能力。新版本还加入 Kotlin、Dart 和 Scala 的 Advanced SAST 支持,并在许可证数据中支持 SPDX 表达式。部分功能处于 beta 或实验阶段,使用者需按对应的套餐、部署条件和版本要求评估。
推荐理由:覆盖 MCP 工具治理、Advanced SAST、SPDX 许可表达式与凭据自动吊销,并明确 beta、实验功能和部署注意事项,适合升级评估。
GitLab提出面向代理式软件开发的机器速度安全框架,覆盖攻击面发现、基础控制强化和已发布软件持续防护。框架要求将安全策略置于执行路径,为代理设置可追溯身份与受限权限,并以从检测到经验证修复的时间为核心指标。
推荐理由:文章以GitLab实践为依据,提出覆盖发现、基础控制和上线后持续防护的三层方法,并强调以检测至经验证修复时间衡量成效,适合安全与工程团队设计治理流程。
Elastic提出以同一平台实时检测SNAP付款错误,帮助美国各州在FY2028财政年度前应对州政府分担福利成本的风险。平台通过可定制规则、无监督与有监督机器学习及Elastic Agent Builder调查案例,识别收入超限、行为漂移和异常活动。自FY2028起,错误率达到6%及10%的州将分别承担相应份额的福利成本。
AWS 今日宣布正式推出由第六代 Intel Xeon Scalable Processors(Granite Rapids)支持的低成本突发式 Amazon EC2 T8i 实例。
推荐理由:提供从 T3 升级到 T8i 的规格、CPU 积分模式、区域及购买限制信息,便于低成本工作负载选型与迁移评估。
Google Research发布一项研究实验,探索让教育者通过生成式UI创建符合课程目标的互动式、引导式教育模拟。团队同时发布30多个面向中学物理、化学、生物和数学的英文 STEM 互动内容,均由AI生成并经教师审核;美国12名教师的初步研究显示,互动内容质量平均评分为8/10。
推荐理由:展示了生成式UI用于课程定制教学模拟的实验路径,并以教师审核、试点反馈和评价机制说明后续落地仍需验证。
联合国系统推出基于 Google Data Commons 构建的开源平台 UN System Data Commons,将分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
推荐理由:联合国系统借此把分散的统计数据统一到可搜索平台,并用自然语言查询和 AI 助手降低研究使用门槛,对研究、报道和政策分析具有直接价值。
AWS Elastic Beanstalk 正式推出全托管 Cluster Mode,可基于 Amazon EKS 共享基础设施持续部署、扩缩容、打补丁、监控和升级多套应用。
推荐理由:正式发布的 Cluster Mode 以共享 EKS 基础设施承载多套应用,适合评估统一运维、成本边界及逐环境迁移方案。
AI发展放缓不太可能显著改变网络安全,因为现有模型已具备较强的攻防能力,新增模型带来的安全能力提升也趋于渐进。文章建议改善智能体框架与工具,同时优先落实资产和角色清单、身份管理、最小权限及网络分段等安全基础。
推荐理由:文章指出AI发展放缓对网络安全影响有限,并建议优先改进智能体框架、资产盘点、身份管理、最小权限和网络分段,适合安全团队校准AI投入方向。
Linux Foundation 2026年9月通讯重点介绍六项进展:Agentic AI Foundation迎来Gates Foundation,Linux Foundation纳入TRACE开放规范,Xen Project成立安全委员会,OpenSearch获SiliconANGLE 2026 TechForward Awards奖项。
Cooley 利用 ChatGPT 构建 GO Public,为 IPO 流程引入智能辅助。该工具旨在帮助律师更早发现潜在问题,并将判断力集中于关键环节。
WebKit 宣布 Safari 27.0,发布说明涵盖 83 项功能,并加入 Safari MCP、Customizable Select、HTML Model、Scroll Anchoring 以及多项 CSS、Web API 和 Web Inspector 更新。
Cisco Talos调查称,2026年1月至7月日本有90家组织受到勒索软件影响,较上年同期增加约4.7%,The Gentlemen活动最频繁。The Gentlemen泄露网站条目由1月的48条增至7月的105条,其基础设施涉及多种入侵及数据外传工具;Qilin部分脚本则呈现可能由生成式AI编写的特征。
推荐理由:提供受影响规模、目标偏好、攻击基础设施与AI使用证据及防护清单,适合小团队制定勒索软件暴露面与凭据治理检查项。
Elastic 认为,澳大利亚推进 AI 应用的关键不只是模型能力,而是建设更干净、互联且可信的数据基础。其研究显示,澳大利亚组织中的 AI 表现不佳时,归咎于数据的可能性是归咎于 AI 模型的两倍。Elastic 同时强调,公共部门应通过可搜索的日志提升 AI 系统的可见性、可追溯性与安全治理能力。
GitLab 19.4 将 GitLab Credits 按用户、命名空间和项目进行归因,支持设置个人额度、团队例外和详细使用报表。Premium 和 Ultimate 已可使用相关可见性功能,但使用量按周期同步,达到上限时可能存在同步延迟;月度导出最多覆盖 31 天,并包含按事件明细。
推荐理由:GitLab 19.4 增加按用户、团队和项目追踪 GitLab Credits 消耗的能力,并提供额度上限、例外覆盖和按事件导出,便于团队核算 AI 支出与设置使用边界。
OpenAI推出Astra for Law,面向法律工作提供前沿智能、定制律所工作流、互联法律数据源,以及处理保密客户工作所需的法律级控制。
GitLab.com 将自 2026 年 10 月 19 日起按 Free、Premium 和 Ultimate 订阅层级实施新的速率限制,其中 Free 账户和未认证请求先行,Premium 与 Ultimate 于 2027 年 1 月调整。
推荐理由:明确 GitLab.com 限流将按订阅层级调整,并给出预览窗口、匿名请求额度及应对方法,便于 API 使用者提前验证自动化负载和调整调用策略。
GitLab 19.4 扩展 GitLab MCP server,新增 CI/CD、合并请求、代码仓库、项目、工作项和漏洞工具,并加入“Created as”合并请求触发动作。代理默认可自动执行只读操作,写入、合并和删除操作则等待团队指定的人工复核;这些 MCP 工具目前处于 Beta,漏洞工具仅适用于 Ultimate。
GitLab Duo CLI 在 GitLab 19.4 中提供 /goal 目标驱动命令,开发者定义任务及完成条件后,GitLab 可在本地持续修改、验证并迭代。
推荐理由:明确给出 /goal 的命令格式、验证与人工干预机制,并列出 GitLab、CLI、部署方式及订阅层级要求,便于开发团队评估自动化流程。
GitLab Duo Agent Platform新增Kimi K3、GLM 5.3和minimax M3三款托管开放权重模型,团队可将其选为可选模型或按功能设为默认模型。GitLab称,Kimi K3、GLM 5.3和minimax M3分别可提供1.82、5和8次调用每GitLab Credit的用量表现;管理员还可集中控制模型范围,并选择GitLab托管、自托管或混合部署。
推荐理由:GitLab新增三款托管开放权重模型,并提供按功能配置、调用量与成本权衡的模型选择机制,适合评估智能体工作负载的价格性能方案。
AI 代理可用于检查 3D 场景、编写 OpenUSD 中的仿真相关数据、添加物理属性并渲染预检视图。相关工作流从 Blender 场景开始,最终生成可按 simulation-ready(SimReady)要求验证的 OpenUSD 交付结果。
TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度快 6.4 倍。该结果面向车辆、机器人等边缘设备上的 AI agent 推理需求;这类系统需要快速生成 token,并处理包含工具选择、结果评估和持续推理的较长对话流程。
AWS 宣布逐步向新客户推出项目化简化体验,以合理默认值启动项目,并支持编码代理配置和部署资源。大多数新客户无需信用卡即可开始,并获得 AWS Free Tier 的 100 美元免费额度。项目达到免费额度后可升级付费方案并设置每月消费上限;启用多区域和治理等高级功能时无需迁移或停机。
推荐理由:项目化默认值、编码代理配置流程与费用上限降低了新用户上手门槛,也便于小团队先构建再逐步启用高级能力。
OpenAI发布模型失准报告框架,用于跟踪、调查和披露模型失准。OpenAI同时公布六份报告,记录模型出现的意外或令人担忧的行为。
推荐理由:OpenAI同步提供模型失准的跟踪、调查与披露框架及六份异常行为报告,有助于理解其模型安全事件的报告路径与公开材料范围。
文章聚焦使用 Agentic AI 将 CUDA Tile 操作从 Python 翻译到 Rust。cuTile Rust(cutile-rs)将 Rust 所有权模型扩展至基于 tile 的 GPU 内核,把可变输出拆分为互不重叠的部分,并在内核启动间保持主机侧所有权契约;程序员还可在需要更低层级控制时局部选择退出该机制。
OpenAI与AARP将在美国10座城市为1,000名老年人举办免费的ChatGPT动手工作坊。活动旨在帮助参与者安全掌握实用的AI技能,提升日常生活中的AI应用能力。
NVIDIA Vera Rubin NVL72首次提交MLPerf Inference v6.1预览结果,在Qwen3-VL上吞吐最高为GB300 NVL72的3.7倍,在DeepSeek-R1上最高为2.5倍。
推荐理由:文章提供Vera Rubin NVL72、GB300 NVL72的预览与扩展效率数据,并区分已验证结果和提交后结果,有助于基础设施采购者评估吞吐、扩展性与软件优化价值。
OpenAI 探索由 AI 驱动的广告新体验,包括 Sponsored Agents,以及面向营销人员的工具。其相关方案还提供与 HubSpot 和 Shopify 的集成,具体形式与推出时间尚未说明。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 使用情况与支出,并识别培训需求。通过这些分析,团队可以将 AI 的采用情况与业务结果关联起来。
Hex 的数据智能体借助 GPT-6 Astra,将分析结果转化为员工愿意分享的交互式可视化报告。GPT-6 Astra 的核心作用是把答案呈现为可视化内容,让复杂分析更便于员工内部分享。
Waldek Mastykarz 指出,AI 编程智能体即使答案正确,也可能通过环境检索而非模型内部知识完成评测。以 Vally 评测 GPT-5.6 Luna 对 Dev Proxy 版本行为的案例显示,禁用网络和单个命令仍可暴露本地安装、源码及 Git 历史。评测应先定义能力与信息边界,按工作区统一限制文件系统访问,并检查包含工具调用和失败尝试的完整轨迹。
推荐理由:文章以 Vally 评测 GPT-5.6 Luna 为例,说明仅禁用网络和单个工具仍可能通过本地安装、源码与 Git 历史获取答案。对设计 AI 编程智能体评测、隔离信息边界和审查完整轨迹具有直接方法价值。
OpenAI发布经济研究,探讨劳动者如何在传统职能之外使用AI,以及哪些新活动逐渐成为其工作中的固定环节。研究聚焦AI在工作实践中的新用法和持续性变化。
CISA于2026年8月20日发布Logging Reference Architecture(LRA),将OMB M-26-14的日志要求转化为架构、运营和治理决策。联邦民事行政部门机构需在2026年11月18日前提交Agency Logging Plan,并分别达到规定的成熟度期限;文章重点分析六个月主动可搜索数据、就绪度验证、统一策略执行、身份与云及OT遥测,以及AI系统日志。
推荐理由:文章把CISA日志架构要求拆解为存储分层、可观测性验证、统一策略、遥测覆盖和AI审计等实施重点,并附规划与评审材料,适合联邦机构制定日志路线图。
SAST 适合作为每次提交的基线扫描,可固定、可复现地检测注入、硬编码密钥等问题;LLM 安全扫描器则适合在合并请求级别结合上下文分析业务逻辑,并通过生成测试验证漏洞。企业若让 LLM 扫描每次提交,成本更高且结果更难预测,GitLab Advanced SAST 与 Security Review Flow 可在同一流水线中协同运行。
Elastic宣布跨项目搜索(cross-project search,CPS)在Elastic Cloud Serverless正式可用,支持对最多100个关联项目执行统一查询并原位合并结果。该功能覆盖Observability、Security、Search和vector database工作负载,支持按项目标签和权限控制查询范围,并可通过Cloud API密钥进行程序化访问。