跳到正文

技术研究与历史

技术研究、标准与历史资料

50条精选

最新精选

第 21–40 条 · 共 50 条
8月12日周三
  1. Tailscale Blog77

    Tailscale 追踪 SQLite 16 年历史 WAL-Reset 缺陷并完成修复

    Tailscale 公开了追踪 SQLite 16 年历史 WAL-Reset 缺陷的过程:checkpoint 与写入事务之间的罕见竞态会导致页面丢失和数据库损坏,该问题在六个月内造成 19 次数据库损坏。

    推荐理由:文章完整复盘了数据库故障取证、跨团队定位和分阶段修复过程,并说明非标准但受支持的 SQLite checkpoint 方案如何放大罕见竞态风险,对运维团队排查类似问题很有参考价值。

  2. Google Research Blog68

    Google Research提出知识画像方法,揭示前沿LLM事实召回瓶颈

    Google Research提出知识画像框架与WikiProfile基准,用2,150条Wikipedia事实分析13个LLM的编码、召回和识别能力。实验显示,Gemini-3-Pro和GPT-5虽有95–98%的事实完成编码,却仍无法直接召回26–34%的已编码事实;思考可恢复约40–65%的此类事实。研究认为,事实性瓶颈正从知识获取转向知识利用。

    推荐理由:文章用知识画像区分事实的编码、召回与识别,并以13个LLM的大规模实验说明前沿模型的瓶颈更多在知识调用,适合评估改进方向。

  3. Google Research Blog65

    Google推进AMIE实时视听临床问诊研究

    Google Research与Google DeepMind提出AMIE (Video),基于Gemini和Project Astra进行实时视频临床问诊,并通过异步多智能体架构处理对话、临床推理及视听信息。

    推荐理由:该研究展示了实时视听临床AI的架构、评测方法与随机对照结果,同时明确模拟场景和技术限制,为个人及小团队评估医疗AI原型提供了清晰边界。

8月11日周二
8月6日周四
  1. PortSwigger Research83

    PortSwigger Research 用 HTTP Terminator 探索 AI 自主安全研究

    James Kettle 构建并开源 HTTP Terminator,用于自动生成、验证和扩展 HTTP desync 攻击研究,发现了新的触发器、模式、武器化技术及 Shared-Parser Confusion 等线索。

    推荐理由:文章以实际测试和开源工具为基础,拆解自主安全研究从假设生成、验证到武器化与级联发现的方法,并明确人类在发现链中的作用,适合安全研究与自动化工具实践参考。

7月31日周五
  1. Google Research Blog61

    Google Research提出基于证据链的可验证自主科研框架 Science One

    Google Research提出 Chain-of-Evidence(CoE)框架及实验性原型 Science One,用于为研究主张建立和维护证据链,并配套 CoE Audit 自动审计论文、代码、实验结果与参考文献。

    推荐理由:文章把可验证性落实为证据链,并配套独立审计流程,能帮助研究团队评估AI科研代理的引用、分数、代码与方法一致性,方法与结果信息较完整。

  2. Krebs on Security77

    Bitsight分析揭示H96电视盒子参与广告欺诈与住宅代理

    Bitsight研究人员发现,H96电视盒子会伪装成手机访问AI生成网站并点击广告,相关网络由Fengwo Group运营。分析显示,设备在电视开启时通常充当住宅代理,电视关闭时则参与广告欺诈;Bitsight估算单个旧域名关联的欺诈网络日收入接近5万美元。作者建议消费者选择知名厂商设备,并核实是否采用官方Android TV OS及Play Protect认证。

    推荐理由:文章通过Bitsight对域名、应用、证书和设备遥测的关联分析,揭示H96电视盒子兼具广告欺诈与住宅代理风险,并提供识别官方Android TV与检查预装软件的实际决策依据。

7月27日周一
7月23日周四
  1. Google Research Blog67

    Google Research 发布 SymptomAI 对话式症状评估研究结果

    Google Research 与 Google DeepMind 开展了包含 13,917 名参与者的随机研究,比较五种 Gemini Flash 2.0 SymptomAI 对话代理的鉴别诊断表现。

    推荐理由:大规模随机研究与临床专家标注结合可穿戴设备信号,展示了对话式症状评估的研究价值,同时明确其为研究用途,不能替代正式临床诊断。

  2. Google Research Blog71

    Google Research 用强化学习让量子计算机从错误中持续校准

    Google Research 在 Nature 发表研究,将强化学习框架接入量子纠错,使自主智能体根据错误检测结果持续调整数千个控制参数,并在计算过程中抑制量子系统漂移。在 Willow 超导处理器上的实验表明,逻辑稳定性提升 3.5 倍,专家校准后再经强化学习微调可额外降低 20% 的逻辑错误率;数值模拟覆盖数百个量子比特和数万控制参数,研究团队认为所需训练迭代次数与系统规模无关。

    推荐理由:将强化学习接入量子纠错事件,可在计算过程中动态调整控制参数并抑制漂移;实验还给出稳定性提升和错误率降低数据,对评估量子控制方法具有直接参考价值。

7月8日周三
  1. Google Research Blog67

    Google Research通过导航协同改道改善城市交通拥堵

    Google Research在《Nature Cities》发表研究,利用导航平台协调少量出行路线,在10个美国城市改善交通状况。研究采用为期六个月的全市交叉实验;目标路段的驾驶速度中位数提高约2%,燃油消耗率中位数下降0.5%至1.0%,受影响路段整体速度中位数提高约0.35%。

    推荐理由:研究以10个美国城市开展真实世界对照实验,展示了少量导航改道如何改善全市交通,具备交通治理和方法验证价值。

6月27日周六
  1. Google Research Blog70

    Google Research 为 Pixel 上的 Gemini Nano v3 引入冻结式 MTP 加速架构

    Google Research 宣布将冻结的 Gemini Nano v3 与 Multi-Token Prediction(MTP)head 结合,并面向 Pixel 9 和 Pixel 10 系列推出加速方案。

    推荐理由:文章说明冻结主模型并集成MTP head、复用KV cache的移动端推理方案,给出速度、内存和部署影响,具有架构研究与端侧优化参考价值。

6月25日周四
  1. Google Research Blog68

    Google Research 研究推理如何扩展 LLM 的参数知识回忆能力

    Google Research 将研究推理如何让 LLM 回忆原本难以获得的参数知识,计划在 COLM 2026 展示相关结果。对 Gemini-2.5(Flash、Pro)和 Qwen3-32B 的实验表明,该作用主要与计算缓冲和事实启动有关;审计数十万条推理轨迹显示,中间事实出现幻觉会显著降低最终答案正确率。

    推荐理由:研究通过可开关推理的受控实验,区分额外计算与相关事实生成对参数知识回忆的影响,并指出中间事实幻觉会降低最终正确率,为测试时筛选和过程奖励提供依据。

6月8日周一
  1. Google DeepMind Blog64

    Google DeepMind发布Sierra Leone AI学习预注册试验结果

    Google DeepMind公布Sierra Leone预注册试验结果:使用Guided Learning的学生数学成绩较对照组提高0.258个标准差,113,000多次互动中91.4%用于建立概念理解。教师主导课程、目标12小时时增益更高,团队还发布教师培训指南和RCT方法手册,并计划在其他国家开展试验。

    推荐理由:预注册试验提供了AI辅助数学学习的效果与互动数据,并强调教师主导设计,有助于小团队评估课堂应用价值;同时指出收益分布不均和跨国证据仍需验证。

5月28日周四
  1. Google Research Blog66

    Google提出结合密码协议与TEE的零信任私人分析方案

    Google提出一种面向私人分析的新型安全聚合方案,将单次消息的密码协议与可信执行环境结合,用于在保护原始设备数据的同时获取汇总洞察。Google表示,该方案已用于评估AI系统在Pixel Recorder中的表现,Android SafetyCore也将利用相关指标改进分类器,同时保持用户内容仅留在设备上。

    推荐理由:文章说明了零信任聚合如何结合新型密码协议与TEE,并说明其在SafetyCore中的具体评估用途,便于团队理解大设备规模隐私分析与安全设计的取舍。

4月22日周三
  1. Google DeepMind Blog70

    Google DeepMind提出Decoupled DiLoCo分布式AI训练架构

    Google DeepMind提出Decoupled DiLoCo,通过解耦的计算“岛屿”和异步数据传输,在降低通信带宽的同时提升分布式训练的故障韧性。系统可在四个美国区域、使用2–5 Gbps广域网络训练12 billion parameter模型,速度超过传统同步方法的20倍;测试还显示其可在TPU v6e和TPU v5p混合训练中保持与单一芯片类型训练相同的ML性能。

    推荐理由:介绍一种面向全球分布式预训练的解耦异步架构,并给出故障恢复、带宽、速度及混用硬件的实验结果,具有评估大规模训练基础设施的参考价值。

  2. Google Research Blog66

    ReasoningBank:让智能体从经验中学习

    ReasoningBank提出一种智能体记忆框架,从成功和失败经历中提炼高层推理模式,并通过检索、提取与整合支持测试时自我进化。使用Gemini-2.5-Flash在WebArena和SWE-Bench-Verified上测试,其成功率分别较无记忆基线高8.3%和4.6%;结合MaTTS后,WebArena成功率再提高3%。

    推荐理由:文章介绍ReasoningBank如何从成功与失败经验中提炼可迁移记忆,并报告其在网页浏览和软件工程基准上的效果,适合评估智能体记忆设计与测试时扩展方案。

4月9日周四
  1. Google Research Blog66

    Google Research发布ConvApparel用户模拟器数据集与真实性评估框架

    Google Research提出ConvApparel数据集,用于测量LLM用户模拟器与真实人类交互之间的真实性差距。数据集包含服装购物领域超过4,000段人类—AI多轮对话,接近15,000轮,并结合人口统计对齐、人类相似度评分和反事实验证评估Prompted、ICL与SFT模拟器;实验显示数据驱动方法在统计对齐和应对未见过的低效代理方面优于提示基线,但仍存在真实性差距。

    推荐理由:ConvApparel以受控双智能体数据采集和三类验证指标衡量用户模拟器的真实性差距,适合评估合成用户能否支持对话式代理训练与测试。

4月3日周五
  1. Google Research Blog62

    Google Research 提出评估 LLM 行为倾向对齐的框架

    Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。

    推荐理由:提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。

4月1日周三
  1. Google Research Blog67

    构建更好的AI基准:需要多少评分者才够用?

    Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。

    推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。