GPT-6 Astra 在《魔兽世界》盲操作,40分钟零死亡完成兽人新手区
agent-wow开发者称,OpenAI的GPT-6 Astra未观看任何渲染画面,仅依据网络流量、服务器任务文件和寻路数据,在40分钟内零死亡完成《魔兽世界》兽人新手区。该实验通过Codex中的单次提示驱动开源客户端,在本地私有服务器运行,任务目标是按顺序完成试炼谷任务并抵达Sen’jin Village。
agent-wow开发者称,OpenAI的GPT-6 Astra未观看任何渲染画面,仅依据网络流量、服务器任务文件和寻路数据,在40分钟内零死亡完成《魔兽世界》兽人新手区。该实验通过Codex中的单次提示驱动开源客户端,在本地私有服务器运行,任务目标是按顺序完成试炼谷任务并抵达Sen’jin Village。
Circuit Breaker Labs以模拟不同年龄、背景、语言和文化用户的AI代理,对模型进行红队测试,排查危险及心理伤害互动。其专有评分方法可生成可审计、可解释的分数,每日运行数万至数十万次模拟交互。该初创公司目前聚焦AI教练、日记和心理健康支持等高风险应用,团队仅有5人。
Uber Eats已重构搜索链路的主要部分,报告端到端延迟降低50%。改动包括Above-the-Fold测量、减少检索工作、并行 hydration、广告数据重设计和基础设施优化,并引入agentic coding workflow;Uber还在探索microbatching、基于产品的检索和HTTP multipart streaming。
再生成能力改变了 UI 复用经济:模型可基于成熟设计系统按需生成多数标准界面,使维持规范组件包的理由更难成立。设计系统、tokens、 guidelines 与 tests 应继续作为核心,以保障界面一致性。
Apex Compute 正为其硬件开发一款基于 Mesa 的开源 Vulkan 驱动。这家2024年成立于加州的公司旨在生产用于实时边缘 AI 推理的高能效加速器,目前拥有可授权和部署的 FPGA 原型。其原型宣称速度为 NVIDIA Jetson 的20倍,功耗低于10W,成本仅为其五分之一。
Debasish Mandal 使用 Google AI Studio 中的 Gemini 3.8 Flash 构建了一款待办应用,可将语音记录转写为任务,并估算时长、难度和优先级后排序。应用支持最快、最难、最重要等排序方式、任务调整和完成进度展示,作者通过多轮提示修改界面与交互。作者称目前使用免费 API,但若扩展到 Play Store 可能需要付费。
一名用户将花4美元购得的初代 Amazon Echo Spot 改造成定制控制面板,由 Claude Code 逐步指导完成。该设备运行基于 LineageOS 的定制 Android 界面,并与 PC 上的小型 AI 代理配合,提供市场洞察、本地语音转文字、PC 使用状态及 Claude Code 任务进度显示。
社区团队将初代《Halo: Combat Evolved》移植到网页浏览器、Android、Linux、PS4 和 PS5,并支持完整多人及战役模式,PlayStation 设备需越狱。相关项目多由 AI 工具推动,《Halo: CE》还出现了最多支持 128 名玩家的新模式,PC 版《Halo 3》移植项目也正在推进。
ServiceNow CoreAI构建了AutoSynthData,利用目标模型的失败和更强教师模型的成功案例生成并验证企业智能体训练任务。系统在EnterpriseOps Gym的Hybrid和ITSM环境中进行SFT实验,Hybrid的Pass@1提升7.2个百分点,ITSM从18.77%升至27.18%。
推荐理由:文章公开了企业智能体训练数据的生成、验证与迭代流程,并通过两个ITSM环境实验提供量化结果,便于团队评估其实现方法与训练价值。
OpenAI硬件负责人Richard Ho介绍,团队借助Codex等内部模型和AI辅助工程流程,将Jalapeño ASIC从初始RTL推进至流片仅用九个月。AI还参与了内核编写与优化,但签核阶段仍使用Synopsys、Cadence等工具的静态时序与信号完整性分析。报道同时提到,B0版本每瓦性能据称较A0提升最高25%,但Richard Ho强调九个月并非所有芯片都能达到的固定周期。
开发者“stmonty”使用单张 RTX 3080 Ti 训练约 1250 万参数的世界模型,让其尝试在《Pokémon Red》中从存档处选择初始宝可梦。模型先通过 192 个数字的压缩屏幕摘要学习按钮效果,再以 14 次按键生成计划;微调后成功选中 Squirtle,100 次运行中有 52 次获得初始宝可梦。项目代码以 lePokeRed 在 GitHub 开源,推荐使用 CUDA GPU。
作者开源了 Zentrola,用于探索团队管理 Codex 和 Claude Code 配置与权限的方法。材料提出 API Key 分发、模型权限、离职撤权及上游故障通知等问题,但未提供具体功能与实现细节。
NVIDIA TensorRT Model Connect 是一个基于 NVIDIA TensorRT 构建、使用 C++ 编写的开源 AI 模型参考实现集合,围绕 coding agents 设计。其开发经验表明,并行工作、模型族隔离、可逆变更和 GPU 支持的验证是项目的核心实践。
Photo Scrubber 可识别照片中的人脸并自动模糊,目标是避免分享陌生人可辨识面孔的图像。工具由 GPT-6 Astra 构建,采用编译为 WebAssembly 的 Google MediaPipe C++ 库和 BlazeFace 人脸检测模型。
Cloudflare 正开发内部工具 CryptoLabe,以两阶段扫描发现代码中的密码学用法、评估迁移分类,并生成面向产品经理和工程师的报告。该工具依托 Workers、Durable Objects、Workflows、AI Gateway 等组件,但仍在演进,尚未提供客户使用;Cloudflare 也强调扫描结果需由相关工程师复核,公开的提示词只是起点。
推荐理由:披露 CryptoLabe 的分阶段扫描、分类、编排与人工复核方法,并说明缺少 ground-truth 数据集和完整覆盖,可供团队设计后量子迁移盘点流程时参考。
Muse AI Agent代用户记录了一次MX Keys Mini取货失败:配送人员到场后无人下楼,并留下负面评分。自动回复在9:27错误表示用户在家,加剧了失误;Agent已代为道歉并提议改为不再承诺用户在场。
Bluesky reply bot checker 通过分析账户近期帖子的打字速度、发布时间和互动模式,查找自动回复机器人的行为信号。该工具会展示全部测量指标与判断规则,并提供触发信号的回复示例;其检查项还包括秒级回复、只回复高关注者却从不发布原创内容,以及频繁使用问号。
FOSS Force 作者所在的网站托管公司因商业平台限制,放弃原有网站并迁移到 MIT 许可的 Astro 静态网站框架。迁移解决了性能和后续维护困难,但也带来非程序员无法独立编辑发布的缺口;作者随后借助 AI 自行开发替代内容管理系统。文章还区分了开源框架与专有部署托管服务:前者便于迁移,后者仍可能成为依赖。
Simon Willison用Claude Opus 5.5将三张鸦鹉照片制作为可交互的Kākāpō Party像素动画,点击或按键可触发派对效果。随后,他让本地Claude Code会话调用Playwright加载HTML、按预定位置点击并录制15秒视频,用于Keynote演示最后一页。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营和销售现代化车队管理方案。公司称,Codex 帮助其销售额提升 60%,并节省超过 75 个小时。
Simon Willison表示,使用编程代理的时间越长,他越确信这些工具让软件工程变得更加困难。编程代理能够完成令人惊叹的工作,但要充分发挥其潜力,需要非凡的自律与知识。
Google与UniBrescia、ENPC Paris合作推出MilleMiglia,用C++生成符合中程物流特征且不暴露私有信息的合成基准实例。其数据格式以Protocol Buffers序列化,在同一文件中纳入固定车辆时刻、配送中心吞吐限制和复杂同步前提。生成规模覆盖精确算法测试用小型问题、大陆级工业问题及机器学习训练数据集,源码、文档和示例实例已在GitHub提供。
Google Envisioning Studio与Jane Wade、Sergio Hudson共创Styling Suite和Runway Visualization两款Google Flow工具,服务纽约时装周筹备。
Cooley 利用 ChatGPT 构建 GO Public,为 IPO 流程引入智能辅助。该工具旨在帮助律师更早发现潜在问题,并将判断力集中于关键环节。
Fyxer 利用 OpenAI 模型、微调、记忆机制和真实用户反馈,打造可整理收件箱并按用户语气起草邮件的 AI 高管助理。这套方法以用户实际体验反馈推动能力完善,旨在赢得用户信任。
Hugging Face 用单个 Gradio Workflow 画布重建了 AUTOMATIC1111 大部分功能,集成了 11 条媒体管线和 73 个节点。示例涵盖文生图、高清修复、图像编辑、提示词生成、检测与重绘、图像转视频等流程,并展示将输出生成 REST API 与 MCP 工具的方法。
推荐理由:通过可运行示例解析 Gradio Workflow 的节点编排、模型调用、并行执行与接口生成方法,适合评估多模型媒体工作流的实现路径。
Google DeepMind与Primordial Soup合作创作纪录片短片《Love, Rendered》,借助生成式AI重现Burt与Ethelle未曾记录的过去,并连接他们年轻时期与当下的记忆。
MIT研究人员使用GPT-5.6 Sol与Codex自主运行量子计算实验。该组合可分析实验结果并校准量子比特,展示了大模型辅助量子计算实验的流程。
Jennifer Kohl 介绍开源 SBX AI Evaluation Kit,用 Docker Sandboxes 统一执行 AI 评估命令并保存运行证据。工具不会运行模型或自动生成评估判断,而是通过执行器抽象、YAML 定义、结构化 JSON 记录和配置摘要,让本地与沙箱工作流更易重跑、检查和比较。
推荐理由:通过执行器抽象、YAML 定义、JSON 运行记录和配置摘要,帮助个人与小团队在本地或 Docker Sandboxes 中重跑、比较并检查 AI 评估流程。
Fimo 提出让网站通过智能体在上线后持续改进,避免其逐渐落后于市场与公司变化。自主权应从小范围授权开始,团队可查看运行记录、日志及变更前后对比,再根据表现逐步放宽限制,让智能体处理已委派任务,而非将整个网站完全交由其接管。
Google Research与Google DeepMind提出AMIE (Video),基于Gemini和Project Astra进行实时视频临床问诊,并通过异步多智能体架构处理对话、临床推理及视听信息。
推荐理由:该研究展示了实时视听临床AI的架构、评测方法与随机对照结果,同时明确模拟场景和技术限制,为个人及小团队评估医疗AI原型提供了清晰边界。
MacPaw在赞助文章中介绍了主动式AI助手Eney,尝试以更具个性且易用的角色交互融入用户工作流,而非采用传统文本框界面。Eney通过粉色圆形形象、简洁表情和克制的情绪动作传达任务状态;设计团队强调,技术虽能加快流程,但风格、艺术方向、完整性判断与情感敏感度仍由人类设计师掌控。
PRX 团队将公开与内部数据集混合,用 VLM 重新生成图像长描述,再把经过筛选和去重的数据转换为可流式读取的 MDS 语料。团队以 Lance 完成数据构建、查询和探索,并选择 Qwen3-VL-8B 进行描述生成;同时记录了 7B 训练中动态计算文本潜变量、使用质量 92 的 JPEG 以及分片跳过列表等实践。
推荐理由:系统介绍 PRX 训练数据策略及 Lance、MDS、Ray Data 等工具的分工,并给出长描述、JPEG 存储、过滤和去重等可复用的工程取舍。
Google提出一种面向私人分析的新型安全聚合方案,将单次消息的密码协议与可信执行环境结合,用于在保护原始设备数据的同时获取汇总洞察。Google表示,该方案已用于评估AI系统在Pixel Recorder中的表现,Android SafetyCore也将利用相关指标改进分类器,同时保持用户内容仅留在设备上。
推荐理由:文章说明了零信任聚合如何结合新型密码协议与TEE,并说明其在SafetyCore中的具体评估用途,便于团队理解大设备规模隐私分析与安全设计的取舍。
Calico Life Sciences 团队正利用 Co-Scientist 串联衰老生物学中的分散成果,形成可供验证的新假设。该系统帮助团队辨析质量不一、无法复现等文献噪声,并获得专家认可。团队还提出了代谢如何调控 ISR 的新假设并持续完善实验设计,实验已产生关于 ISR 与健康、疾病关系的新发现,团队计划公布结果。
Mozilla 正在 Firefox Nightly 内置 PDF 编辑器中试验用完全本地的端侧 AI 模型自动生成图片替代文本,推理引擎已作为新的 ml 组件合入。
推荐理由:文章披露Firefox本地图像转文本实验的模型、推理架构、缓存与训练代码,并明确当前范围和后续计划,对无障碍技术研究与浏览器端侧AI实现有参考价值。