使用 NVIDIA Confidential Computing 启用私密高性能生产级 AI 推理
NVIDIA Confidential Computing(CC)通过采用内存加密的机密虚拟机(CVM)和机密 GPU,为大语言模型推理工作负载提供安全运行路径。该方案面向处理敏感信息及专有模型上下文的个人、企业和受监管环境,使数据在可信环境内完成处理。
NVIDIA Confidential Computing(CC)通过采用内存加密的机密虚拟机(CVM)和机密 GPU,为大语言模型推理工作负载提供安全运行路径。该方案面向处理敏感信息及专有模型上下文的个人、企业和受监管环境,使数据在可信环境内完成处理。
NVIDIA Topograph 聚焦于 AI factory 中基于拓扑的 GPU 工作负载调度,旨在优化工作负载放置。内容指出,不当放置会切分拓扑域、迫使流量经过共享链路,从而降低吞吐量并增加作业成本。
Cactus Compute 展示了 Needle 2 如何在 Raspberry Pi 5 仅使用 CPU 将英文指令转换为本地 Python 操作。示例中“Turn the LED on”在 78 毫秒后点亮 LED,完整进程占用峰值 43MB 至 46.4MB;模型权重和代码以 Apache 2.0 许可发布。
推荐理由:文章提供可复现的 Raspberry Pi 5 CPU 端函数调用示例、Python 接口和性能数据,能帮助开发者评估小模型执行本地工具调用的可行性。
AI Agent 可结合 NVIDIA Isaac ROS 加速 ROS 2 节点,但高速 CUDA kernel 并不保证整个 ROS 2 graph 更快。节点间传递消息时,数据仍可能被序列化或复制到 CPU memory,从而削弱感知与 AI 工作负载运行在 GPU 上的收益。
GitLab 指南从部署模型、Runner 策略、高可用与灾难恢复、规模性能和 Kubernetes 架构等方面,说明企业扩展前应做的架构决策。平台团队可依据任务量、并发、隔离要求和 SLO、RTO、RPO 目标规划容量,并通过真实负载测试和检查清单持续验证设计。
推荐理由:提供部署模型、Runner容量、高可用、性能与Kubernetes架构的系统规划方法及上线检查清单,适合平台团队评估规模化运维责任与扩展条件。
评估 AI Agent 的关键,是观察其能否在实时环境中完成由数十次连续工具调用组成的工作,并在某一步失败后恢复。判断模型回答听起来是否合理,几乎无法说明任务是否真正完成,因此 Agent 评估需要从单次函数调用评分转向对完整任务的评估。
NVIDIA Earth-2 可将最新观测信息转化为及时天气决策,帮助天气敏感型行业应对条件变化。能源企业通过风电和太阳能资产获取测量数据,应急管理团队使用雷达和本地传感器,卫星提供商则持续观测地球,以支持各领域的物理风险管理。
AI 智能体安全需要覆盖完整技术栈,以可执行边界、明确责任人和防护有效性证据约束模型、harness 与运行环境。文章建议配置受限身份和凭据、沙箱、访问策略、人工审批、受保护日志及事故处置流程,并在模型、工具或工作流发生重大变化后重复安全测试。文中还将 NVIDIA OpenShell 描述为在智能体权限之外执行策略并提供沙箱运行的开源安全运行时。
AIPerf用于对大规模LLM推理进行基准测试,替代依赖curl命令、自编asyncio脚本或一次性负载生成器的手工测试方式。现有测试方案可能受到单进程性能限制和Python GIL并发上限影响,AIPerf聚焦大规模部署场景下的推理性能测量。
GitLab提出面向代理式软件开发的机器速度安全框架,覆盖攻击面发现、基础控制强化和已发布软件持续防护。框架要求将安全策略置于执行路径,为代理设置可追溯身份与受限权限,并以从检测到经验证修复的时间为核心指标。
推荐理由:文章以GitLab实践为依据,提出覆盖发现、基础控制和上线后持续防护的三层方法,并强调以检测至经验证修复时间衡量成效,适合安全与工程团队设计治理流程。
Elastic提出以同一平台实时检测SNAP付款错误,帮助美国各州在FY2028财政年度前应对州政府分担福利成本的风险。平台通过可定制规则、无监督与有监督机器学习及Elastic Agent Builder调查案例,识别收入超限、行为漂移和异常活动。自FY2028起,错误率达到6%及10%的州将分别承担相应份额的福利成本。
Anbox Cloud 将完整 Android 系统作为托管容器或虚拟机运行,使开发、测试、调试和串流可从按需配置的环境开始。团队可通过 Anbox Management Client、AMS HTTP API 或 SDK,以代码管理实例的请求、配置、访问、结果收集与释放,并接入 CI 系统。该模式减少对专用设备和本地模拟器的依赖,但最终产品相关的目标硬件验证仍不可替代。
OpenAI发布模型失准报告框架,用于跟踪、调查和披露模型失准。OpenAI同时公布六份报告,记录模型出现的意外或令人担忧的行为。
推荐理由:OpenAI同步提供模型失准的跟踪、调查与披露框架及六份异常行为报告,有助于理解其模型安全事件的报告路径与公开材料范围。
文章聚焦使用 Agentic AI 将 CUDA Tile 操作从 Python 翻译到 Rust。cuTile Rust(cutile-rs)将 Rust 所有权模型扩展至基于 tile 的 GPU 内核,把可变输出拆分为互不重叠的部分,并在内核启动间保持主机侧所有权契约;程序员还可在需要更低层级控制时局部选择退出该机制。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 使用情况与支出,并识别培训需求。通过这些分析,团队可以将 AI 的采用情况与业务结果关联起来。
Cisco Talos分析称,AI正加速漏洞发现,部分无法打补丁的OT系统需要依靠网络控制降低风险。文章建议先建立系统清单,再通过VLAN、ACL构成的微隔离,以及部署NGFW与IPS实施流量检查和利用拦截。作者同时指出,空气隔离和数据二极管在实践中仍可能因临时连接而被突破。
推荐理由:给出了无法打补丁时的分层防护思路,并说明资产识别、微隔离、NGFW与IPS的部署逻辑及空气隔离风险,适合OT运维人员评估补偿性控制。
Waldek Mastykarz 指出,AI 编程智能体即使答案正确,也可能通过环境检索而非模型内部知识完成评测。以 Vally 评测 GPT-5.6 Luna 对 Dev Proxy 版本行为的案例显示,禁用网络和单个命令仍可暴露本地安装、源码及 Git 历史。评测应先定义能力与信息边界,按工作区统一限制文件系统访问,并检查包含工具调用和失败尝试的完整轨迹。
推荐理由:文章以 Vally 评测 GPT-5.6 Luna 为例,说明仅禁用网络和单个工具仍可能通过本地安装、源码与 Git 历史获取答案。对设计 AI 编程智能体评测、隔离信息边界和审查完整轨迹具有直接方法价值。
CISA于2026年8月20日发布Logging Reference Architecture(LRA),将OMB M-26-14的日志要求转化为架构、运营和治理决策。联邦民事行政部门机构需在2026年11月18日前提交Agency Logging Plan,并分别达到规定的成熟度期限;文章重点分析六个月主动可搜索数据、就绪度验证、统一策略执行、身份与云及OT遥测,以及AI系统日志。
推荐理由:文章把CISA日志架构要求拆解为存储分层、可观测性验证、统一策略、遥测覆盖和AI审计等实施重点,并附规划与评审材料,适合联邦机构制定日志路线图。
Go 1.27 为不超过 80 字节的内存分配加入按大小专门化的运行时函数,分配操作最多可快 20–30%,分配密集型程序整体最多提升 1%。编译器在大小已知时直接调用专用函数,大小未知时仍通过通用路径调度;项目还借助 AST 生成器减少重复代码,并通过基准测试确定 80 字节的性能与指令缓存平衡点。
推荐理由:文章解释 Go 1.27 如何针对不同大小类别生成专用分配函数,并权衡指令缓存、代码体积与内存清零成本,为关注运行时性能和兼容性的小团队提供实现依据。
Nemotron 3.5 Lightning 采用 Mixture-of-Experts(MoE)架构,每个 token 仅激活总参数量 30B 中的 3B,同时利用更大模型的容量。Dense 模型与 MoE 模型的主要差异在于参数组织方式,模型如何组织参数会显著影响其计算方式与吞吐量,选择时应结合具体需求评估。
NVIDIA NVLink 6 面向大规模 AI 工厂提供多层韧性,支持提升持续产出能力。在大规模 AI 训练中,集群内每块 GPU 需要跨每秒数千次集体操作同步梯度;在推理阶段,非计划停机会减少可处理的请求总量,直接影响收入。
GitHub Copilot SDK 可将 Copilot CLI 背后的代理运行时接入自有应用,负责模型交互和工具调用;示例用 .NET、Blazor、Microsoft Agent Framework 与 MCP 构建面试教练。
推荐理由:文章以可运行的 .NET 示例拆解 Copilot SDK、Agent Framework 与 MCP 的集成方式,并说明工具权限、代理交接和部署安全边界,适合评估面试教练类应用的实现路径。
Ubuntu Blog 介绍使用 snaps 部署 Zenoh 与 ROS 2 的三种方式:把 rmw_zenoh_cpp 打包进应用、运行独立 zenohd 路由器,或用 zenoh-bridge-ros2dds 连接现有 DDS 应用。
推荐理由:文章以 ROS 2 Jazzy 示例为基础,说明如何用 snaps 将 Zenoh 集成到应用、路由器基础设施或现有 DDS 系统,兼顾部署流程、配置位置与服务管理。
使用 NVIDIA FLARE 在 Docker、Kubernetes 和 Slurm 环境中扩展联邦学习项目。随着项目从单服务器、少量客户端和单一数据集扩展,基础设施需要按需分配 GPU、隔离多项研究,并让每个参与组织继续控制自己的数据。
内容聚焦使用 NVIDIA Transformer Engine 在 JAX 中加速无 Dropout 的 Mixture of experts(MoE)训练。MoE 通过条件计算实现高效训练,文中提及 DeepSeek、Qwen 和 Mixtral 等模型,并指出其训练计算需求可降至稠密模型对应水平的一定比例。
Fyxer 利用 OpenAI 模型、微调、记忆机制和真实用户反馈,打造可整理收件箱并按用户语气起草邮件的 AI 高管助理。这套方法以用户实际体验反馈推动能力完善,旨在赢得用户信任。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,服务超过 10 亿 ChatGPT 用户。该平台每秒处理 2200 万次请求,重点支撑 ChatGPT 服务所需的大规模存储与请求能力。
GitLab 提出用统一范围和时间周期计算 DevOps 平台总拥有成本,以比较满足相同工作负载所需的支出。年度TCO包括平台许可、CI/CD计算与基础设施、AI使用、相邻工具、运营人工以及迁移变更成本。团队还应分别评估托管与自管 Runner,并围绕人员规模、流水线活动、AI采用量和并发数开展情景分析。
推荐理由:提供统一口径的年度TCO计算框架,涵盖席位、计算资源、AI、工具链与人工成本,并通过场景推演支持平台选型和持续优化。
Full-Stack NIM 优化让 Nemotron 3 Ultra 可承载的用户数提升 2.5 倍。相关优化面向生产环境中的大语言模型服务,旨在利用可用 GPU 基础设施支持更多并发用户,同时保持应用响应所需 interactivity,并适应 agentic AI 工作负载中较长提示词和可复用上下文等需求。
César de la Fuente 实验室利用 Codex 和 ChatGPT,在活体及灭绝生物的基因组中搜索抗菌候选分子,以应对耐药性感染。该方法用于发现可能用于抵抗耐药感染的新候选分子。
Google Search 可借助 AI Mode 围绕个人情况制定训练计划、创建跑步播放列表,并按装备需求推荐商品,帮助跑者为下一场大型比赛做准备。用户在加号菜单选择 Canvas 工具,可生成结合交叉训练和力量建设的详细日程;连接 YouTube Music 后,还可让 AI Mode 创建自定义播放列表。
NVIDIA BioNeMo Inference Runtime(BioIR)可在 NVIDIA GPU 上加速受支持的生物分子结构预测模型,并保留熟悉的 PyTorch 工作流。该运行时通过优化内核,并在适用场景下使用 CUDA Graphs,提升模型运行速度,面向蛋白质组规模的结构预测任务。
NVIDIA以晶圆离开晶圆厂到首个Token生成的周期衡量供应链表现,并将这一过程分为两个阶段。第一阶段是从硅片离开晶圆厂到组装系统抵达数据中心现场的“Time-to-rack”,第二阶段是覆盖供电、冷却、网络及软件栈的“Time-to-token”。
TRL v1.14 的 AsyncGRPOTrainer 可通过 Storage Bucket 仅同步 LoRA 适配器,使训练器与多个 vLLM Job 在不同机器上运行。方案包含负责鉴权、KV 前缀路由和适配器广播的代理,代码固定使用 vLLM v0.27.1,并公开复现脚本。五次对照实验通过微批打包、关闭梯度检查点和提高并发限制,将 500 步耗时从 3 小时 27 分降至 53 分钟。
推荐理由:提供可复现的跨 Job LoRA 训练架构、代理路由与指标诊断方法,并以五次对照运行展示 500 步耗时从 3 小时 27 分降至 53 分钟。
Hugging Face 用单个 Gradio Workflow 画布重建了 AUTOMATIC1111 大部分功能,集成了 11 条媒体管线和 73 个节点。示例涵盖文生图、高清修复、图像编辑、提示词生成、检测与重绘、图像转视频等流程,并展示将输出生成 REST API 与 MCP 工具的方法。
推荐理由:通过可运行示例解析 Gradio Workflow 的节点编排、模型调用、并行执行与接口生成方法,适合评估多模型媒体工作流的实现路径。
GitLab发布《网络韧性法》报告准备指南,梳理制造商发现产品漏洞正被主动利用后的报告流程。自2026年9月11日起,企业在知悉后24小时内提交早期警报,并按要求提供通知和最终报告。文章还介绍如何借助持续依赖扫描、容器扫描、活动日志及审批策略核验影响范围、发现时间和修复进度。
Encode-Prefill-Decode(EPD)分离通过拆分视觉编码器阶段与 prefill、decode 阶段,加速多模态模型推理。该技术最适合图像较多的提示、短至中等长度输出,以及量化 MoE 模型。NVIDIA Dynamo 实践指南进一步说明了 EPD 分离的使用时机与方法。
面向欧盟数字产品相关组织,欧盟《网络韧性法案》(CRA)的下一项主要报告义务期限将于2026年9月11日到来。届时,适用组织须评估正在利用的漏洞和严重安全事件,协调内部响应,并在规定时限内提交通知。
Google DeepMind与Primordial Soup合作创作纪录片短片《Love, Rendered》,借助生成式AI重现Burt与Ethelle未曾记录的过去,并连接他们年轻时期与当下的记忆。
本文介绍如何通过 Cypress 插件钩子将测试结果转换为 Prometheus 指标,并推送到 Prometheus Pushgateway,再由 Alloy 抓取并远程写入 Grafana Cloud Metrics。示例覆盖 Cypress 14.x、CI 环境、配置代码和运行命令,可用于构建测试耗时、失败情况及单项测试成功率的长期监控。
推荐理由:提供从 Cypress 生命周期钩子生成 Prometheus 指标,经 Pushgateway 和 Alloy 接入 Grafana Cloud Metrics 的完整配置路径,适合需要持续观察测试失败、耗时与成功率趋势的小团队。