跳到正文

#AI

今日 2 条
今天10月3日周六
  1. Tom’s Hardware59

    GPT-6 Astra 在《魔兽世界》盲操作,40分钟零死亡完成兽人新手区

    agent-wow开发者称,OpenAI的GPT-6 Astra未观看任何渲染画面,仅依据网络流量、服务器任务文件和寻路数据,在40分钟内零死亡完成《魔兽世界》兽人新手区。该实验通过Codex中的单次提示驱动开源客户端,在本地私有服务器运行,任务目标是按顺序完成试炼谷任务并抵达Sen’jin Village。

  2. TechCrunch47

    Circuit Breaker Labs用仿真用户开展AI安全红队测试

    Circuit Breaker Labs以模拟不同年龄、背景、语言和文化用户的AI代理,对模型进行红队测试,排查危险及心理伤害互动。其专有评分方法可生成可审计、可解释的分数,每日运行数万至数十万次模拟交互。该初创公司目前聚焦AI教练、日记和心理健康支持等高风险应用,团队仅有5人。

10月2日周五
  1. Android Police58

    作者用 Gemini 构建语音整理待办事项应用

    Debasish Mandal 使用 Google AI Studio 中的 Gemini 3.8 Flash 构建了一款待办应用,可将语音记录转写为任务,并估算时长、难度和优先级后排序。应用支持最快、最难、最重要等排序方式、任务调整和完成进度展示,作者通过多轮提示修改界面与交互。作者称目前使用免费 API,但若扩展到 Play Store 可能需要付费。

  2. Hugging Face Blog64

    ServiceNow CoreAI推出AutoSynthData以生成企业智能体训练数据

    ServiceNow CoreAI构建了AutoSynthData,利用目标模型的失败和更强教师模型的成功案例生成并验证企业智能体训练任务。系统在EnterpriseOps Gym的Hybrid和ITSM环境中进行SFT实验,Hybrid的Pass@1提升7.2个百分点,ITSM从18.77%升至27.18%。

    推荐理由:文章公开了企业智能体训练数据的生成、验证与迭代流程,并通过两个ITSM环境实验提供量化结果,便于团队评估其实现方法与训练价值。

  3. Tom’s Hardware68

    OpenAI硬件负责人拆解Jalapeño ASIC的AI辅助设计

    OpenAI硬件负责人Richard Ho介绍,团队借助Codex等内部模型和AI辅助工程流程,将Jalapeño ASIC从初始RTL推进至流片仅用九个月。AI还参与了内核编写与优化,但签核阶段仍使用Synopsys、Cadence等工具的静态时序与信号完整性分析。报道同时提到,B0版本每瓦性能据称较A0提升最高25%,但Richard Ho强调九个月并非所有芯片都能达到的固定周期。

  4. Tom’s Hardware60

    开发者用单张 RTX 3080 Ti 训练小型 AI 玩《Pokémon Red》

    开发者“stmonty”使用单张 RTX 3080 Ti 训练约 1250 万参数的世界模型,让其尝试在《Pokémon Red》中从存档处选择初始宝可梦。模型先通过 192 个数字的压缩屏幕摘要学习按钮效果,再以 14 次按键生成计划;微调后成功选中 Squirtle,100 次运行中有 52 次获得初始宝可梦。项目代码以 lePokeRed 在 GitHub 开源,推荐使用 CUDA GPU。

10月1日周四
9月30日周三
9月29日周二
  1. Cloudflare Blog70

    Cloudflare 介绍用 AI 工具 CryptoLabe 推进后量子迁移

    Cloudflare 正开发内部工具 CryptoLabe,以两阶段扫描发现代码中的密码学用法、评估迁移分类,并生成面向产品经理和工程师的报告。该工具依托 Workers、Durable Objects、Workflows、AI Gateway 等组件,但仍在演进,尚未提供客户使用;Cloudflare 也强调扫描结果需由相关工程师复核,公开的提示词只是起点。

    推荐理由:披露 CryptoLabe 的分阶段扫描、分类、编排与人工复核方法,并说明缺少 ground-truth 数据集和完整覆盖,可供团队设计后量子迁移盘点流程时参考。

9月28日周一
  1. Simon Willison46

    Bluesky 自动回复机器人检查器

    Bluesky reply bot checker 通过分析账户近期帖子的打字速度、发布时间和互动模式,查找自动回复机器人的行为信号。该工具会展示全部测量指标与判断规则,并提供触发信号的回复示例;其检查项还包括秒级回复、只回复高关注者却从不发布原创内容,以及频繁使用问号。

  2. FOSS Force55

    网站公司摆脱商业平台锁定并迁移至 Astro

    FOSS Force 作者所在的网站托管公司因商业平台限制,放弃原有网站并迁移到 MIT 许可的 Astro 静态网站框架。迁移解决了性能和后续维护困难,但也带来非程序员无法独立编辑发布的缺口;作者随后借助 AI 自行开发替代内容管理系统。文章还区分了开源框架与专有部署托管服务:前者便于迁移,后者仍可能成为依赖。

9月27日周日
9月26日周六
9月25日周五
9月19日周六
  1. Google Research Blog58

    Google开源MilleMiglia中程物流实例生成器

    Google与UniBrescia、ENPC Paris合作推出MilleMiglia,用C++生成符合中程物流特征且不暴露私有信息的合成基准实例。其数据格式以Protocol Buffers序列化,在同一文件中纳入固定车辆时刻、配送中心吞吐限制和复杂同步前提。生成规模覆盖精确算法测试用小型问题、大陆级工业问题及机器学习训练数据集,源码、文档和示例实例已在GitHub提供。

9月18日周五
9月17日周四
9月14日周一
9月10日周四
  1. Hugging Face Blog70

    使用 Gradio Workflow 重建 AUTOMATIC1111

    Hugging Face 用单个 Gradio Workflow 画布重建了 AUTOMATIC1111 大部分功能,集成了 11 条媒体管线和 73 个节点。示例涵盖文生图、高清修复、图像编辑、提示词生成、检测与重绘、图像转视频等流程,并展示将输出生成 REST API 与 MCP 工具的方法。

    推荐理由:通过可运行示例解析 Gradio Workflow 的节点编排、模型调用、并行执行与接口生成方法,适合评估多模型媒体工作流的实现路径。

9月9日周三
9月2日周三
  1. Docker Blog62

    使用 Docker Sandboxes 构建可复现的 AI 评估工作流

    Jennifer Kohl 介绍开源 SBX AI Evaluation Kit,用 Docker Sandboxes 统一执行 AI 评估命令并保存运行证据。工具不会运行模型或自动生成评估判断,而是通过执行器抽象、YAML 定义、结构化 JSON 记录和配置摘要,让本地与沙箱工作流更易重跑、检查和比较。

    推荐理由:通过执行器抽象、YAML 定义、JSON 运行记录和配置摘要,帮助个人与小团队在本地或 Docker Sandboxes 中重跑、比较并检查 AI 评估流程。

8月25日周二
  1. Smashing Magazine24

    为什么你的网站永远不该停止变化

    Fimo 提出让网站通过智能体在上线后持续改进,避免其逐渐落后于市场与公司变化。自主权应从小范围授权开始,团队可查看运行记录、日志及变更前后对比,再根据表现逐步放宽限制,让智能体处理已委派任务,而非将整个网站完全交由其接管。

8月12日周三
  1. Google Research Blog65

    Google推进AMIE实时视听临床问诊研究

    Google Research与Google DeepMind提出AMIE (Video),基于Gemini和Project Astra进行实时视频临床问诊,并通过异步多智能体架构处理对话、临床推理及视听信息。

    推荐理由:该研究展示了实时视听临床AI的架构、评测方法与随机对照结果,同时明确模拟场景和技术限制,为个人及小团队评估医疗AI原型提供了清晰边界。

7月28日周二
  1. Smashing Magazine28

    跳出文本框:AI时代的数字设计

    MacPaw在赞助文章中介绍了主动式AI助手Eney,尝试以更具个性且易用的角色交互融入用户工作流,而非采用传统文本框界面。Eney通过粉色圆形形象、简洁表情和克制的情绪动作传达任务状态;设计团队强调,技术虽能加快流程,但风格、艺术方向、完整性判断与情感敏感度仍由人类设计师掌控。

7月6日周一
  1. Hugging Face Blog78

    PRX 数据策略:用 Lance 构建训练语料并流式输出 MDS

    PRX 团队将公开与内部数据集混合,用 VLM 重新生成图像长描述,再把经过筛选和去重的数据转换为可流式读取的 MDS 语料。团队以 Lance 完成数据构建、查询和探索,并选择 Qwen3-VL-8B 进行描述生成;同时记录了 7B 训练中动态计算文本潜变量、使用质量 92 的 JPEG 以及分片跳过列表等实践。

    推荐理由:系统介绍 PRX 训练数据策略及 Lance、MDS、Ray Data 等工具的分工,并给出长描述、JPEG 存储、过滤和去重等可复用的工程取舍。

5月28日周四
  1. Google Research Blog66

    Google提出结合密码协议与TEE的零信任私人分析方案

    Google提出一种面向私人分析的新型安全聚合方案,将单次消息的密码协议与可信执行环境结合,用于在保护原始设备数据的同时获取汇总洞察。Google表示,该方案已用于评估AI系统在Pixel Recorder中的表现,Android SafetyCore也将利用相关指标改进分类器,同时保持用户内容仅留在设备上。

    推荐理由:文章说明了零信任聚合如何结合新型密码协议与TEE,并说明其在SafetyCore中的具体评估用途,便于团队理解大设备规模隐私分析与安全设计的取舍。

5月16日周六
  1. Google DeepMind Blog50

    Calico 借助 Co-Scientist 为衰老研究开辟新路径

    Calico Life Sciences 团队正利用 Co-Scientist 串联衰老生物学中的分散成果,形成可供验证的新假设。该系统帮助团队辨析质量不一、无法复现等文献噪声,并获得专家认可。团队还提出了代谢如何调控 ISR 的新假设并持续完善实验设计,实验已产生关于 ISR 与健康、疾病关系的新发现,团队计划公布结果。

6月1日周六
  1. Mozilla Hacks73

    Mozilla 在 Firefox Nightly 试验本地生成图片替代文本

    Mozilla 正在 Firefox Nightly 内置 PDF 编辑器中试验用完全本地的端侧 AI 模型自动生成图片替代文本,推理引擎已作为新的 ml 组件合入。

    推荐理由:文章披露Firefox本地图像转文本实验的模型、推理架构、缓存与训练代码,并明确当前范围和后续计划,对无障碍技术研究与浏览器端侧AI实现有参考价值。