跳到正文

#技术研究与历史

今日 12 条
8月24日周一
8月21日周五
  1. Google Research Blog63

    Google Research提出ME-POIs框架,用移动模式增强地点理解

    Google Research提出Mobility-Embedded POIs(ME-POIs),将文本描述与公共基准数据中的聚合、匿名化移动模式结合,用于表示地点随时间变化的活跃节奏。该框架在洛杉矶和休斯敦的未见地点测试中,访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。研究强调其面向地点和商业聚合理解,不用于个人用户分析或个性化。

    推荐理由:ME-POIs把匿名化、聚合的移动模式引入地点表示,报告了未见地点预测任务的量化提升,适合关注时空表示学习与地点属性预测的团队参考。

  2. Hugging Face Blog77

    研究语音识别模型对公开基准的优化行为

    研究团队评估11个广泛使用的开源ASR模型,发现部分高分模型会依据声学线索复现VoxPopuli和LibriSpeech中与音频不符的参考转录。模型还会恢复被遮蔽数字,并根据基准选择“any one”等正字法,部分模型在公开基准上的表现不能直接代表对新音频的转录能力。团队在Open ASR Leaderboard加入“Benchmark fitting”标签页,并开源相关脚本与未归一化模型输出。

    推荐理由:文章用参考转录分歧、遮蔽数字和正字法切换三类测试,揭示公开语音识别基准可能被模型拟合,并提供可复现脚本帮助改进评测设计。

8月17日周一
  1. Google Research Blog66

    Google Research提出PhotoScan:从智能手机照片估算三维体成分与心代谢风险

    Google Research推出研究原型PhotoScan,利用深度学习从标准2D智能手机照片估算体脂率、Android-to-Gynoid脂肪比和内脏与皮下脂肪面积比,并以DXA结果作为真值进行微调和验证。该框架在独立队列中估算三项指标,并结合人口统计信息将胰岛素抵抗分类AUROC从0.692提升至0.760;研究团队称其仍处于研究原型阶段。

    推荐理由:提供从预训练、微调到独立验证的完整研究路径,并以DXA和代谢指标比较结果,展示了手机影像估计体成分及预测胰岛素抵抗的研究方法与局限。

8月12日周三
  1. Tailscale Blog77

    Tailscale 追踪 SQLite 16 年历史 WAL-Reset 缺陷并完成修复

    Tailscale 公开了追踪 SQLite 16 年历史 WAL-Reset 缺陷的过程:checkpoint 与写入事务之间的罕见竞态会导致页面丢失和数据库损坏,该问题在六个月内造成 19 次数据库损坏。

    推荐理由:文章完整复盘了数据库故障取证、跨团队定位和分阶段修复过程,并说明非标准但受支持的 SQLite checkpoint 方案如何放大罕见竞态风险,对运维团队排查类似问题很有参考价值。

  2. Google Research Blog68

    Google Research提出知识画像方法,揭示前沿LLM事实召回瓶颈

    Google Research提出知识画像框架与WikiProfile基准,用2,150条Wikipedia事实分析13个LLM的编码、召回和识别能力。实验显示,Gemini-3-Pro和GPT-5虽有95–98%的事实完成编码,却仍无法直接召回26–34%的已编码事实;思考可恢复约40–65%的此类事实。研究认为,事实性瓶颈正从知识获取转向知识利用。

    推荐理由:文章用知识画像区分事实的编码、召回与识别,并以13个LLM的大规模实验说明前沿模型的瓶颈更多在知识调用,适合评估改进方向。

  3. Google Research Blog65

    Google推进AMIE实时视听临床问诊研究

    Google Research与Google DeepMind提出AMIE (Video),基于Gemini和Project Astra进行实时视频临床问诊,并通过异步多智能体架构处理对话、临床推理及视听信息。

    推荐理由:该研究展示了实时视听临床AI的架构、评测方法与随机对照结果,同时明确模拟场景和技术限制,为个人及小团队评估医疗AI原型提供了清晰边界。

8月11日周二
8月6日周四
  1. PortSwigger Research83

    PortSwigger Research 用 HTTP Terminator 探索 AI 自主安全研究

    James Kettle 构建并开源 HTTP Terminator,用于自动生成、验证和扩展 HTTP desync 攻击研究,发现了新的触发器、模式、武器化技术及 Shared-Parser Confusion 等线索。

    推荐理由:文章以实际测试和开源工具为基础,拆解自主安全研究从假设生成、验证到武器化与级联发现的方法,并明确人类在发现链中的作用,适合安全研究与自动化工具实践参考。

7月31日周五
  1. Google Research Blog61

    Google Research提出基于证据链的可验证自主科研框架 Science One

    Google Research提出 Chain-of-Evidence(CoE)框架及实验性原型 Science One,用于为研究主张建立和维护证据链,并配套 CoE Audit 自动审计论文、代码、实验结果与参考文献。

    推荐理由:文章把可验证性落实为证据链,并配套独立审计流程,能帮助研究团队评估AI科研代理的引用、分数、代码与方法一致性,方法与结果信息较完整。

  2. Krebs on Security77

    Bitsight分析揭示H96电视盒子参与广告欺诈与住宅代理

    Bitsight研究人员发现,H96电视盒子会伪装成手机访问AI生成网站并点击广告,相关网络由Fengwo Group运营。分析显示,设备在电视开启时通常充当住宅代理,电视关闭时则参与广告欺诈;Bitsight估算单个旧域名关联的欺诈网络日收入接近5万美元。作者建议消费者选择知名厂商设备,并核实是否采用官方Android TV OS及Play Protect认证。

    推荐理由:文章通过Bitsight对域名、应用、证书和设备遥测的关联分析,揭示H96电视盒子兼具广告欺诈与住宅代理风险,并提供识别官方Android TV与检查预装软件的实际决策依据。

7月29日周三
7月27日周一
7月23日周四
  1. Google Research Blog67

    Google Research 发布 SymptomAI 对话式症状评估研究结果

    Google Research 与 Google DeepMind 开展了包含 13,917 名参与者的随机研究,比较五种 Gemini Flash 2.0 SymptomAI 对话代理的鉴别诊断表现。

    推荐理由:大规模随机研究与临床专家标注结合可穿戴设备信号,展示了对话式症状评估的研究价值,同时明确其为研究用途,不能替代正式临床诊断。

  2. Google Research Blog71

    Google Research 用强化学习让量子计算机从错误中持续校准

    Google Research 在 Nature 发表研究,将强化学习框架接入量子纠错,使自主智能体根据错误检测结果持续调整数千个控制参数,并在计算过程中抑制量子系统漂移。在 Willow 超导处理器上的实验表明,逻辑稳定性提升 3.5 倍,专家校准后再经强化学习微调可额外降低 20% 的逻辑错误率;数值模拟覆盖数百个量子比特和数万控制参数,研究团队认为所需训练迭代次数与系统规模无关。

    推荐理由:将强化学习接入量子纠错事件,可在计算过程中动态调整控制参数并抑制漂移;实验还给出稳定性提升和错误率降低数据,对评估量子控制方法具有直接参考价值。

7月16日周四
  1. Hugging Face Blog43

    DharmaOCR:新模型涌现,巴西葡萄牙语OCR专门化优势仍存

    DharmaOCR在巴西葡萄牙语OCR基准测试中取得0.925分,高于Mistral OCR4的0.798分和Unlimited-OCR的0.7587分,显示出专门化带来的显著优势。其训练先通过监督微调适配葡萄牙语词汇、语法和文档结构,再以Direct Preference Optimization抑制重复或不连贯输出,降低推理时间和成本并提升生产环境稳定性。

7月15日周三
  1. Smashing Magazine35

    不,人们并不想在生活中加入更多 AI

    人们并不想要更多脱离实际工作流的 AI;新增 AI 功能往往采用率和留存率较低,同时带来高昂交付成本、声誉风险,以及核查“AI 幻觉”等额外负担。真正有价值的方向,是让 AI 融入既有工作流,稳定、可靠地接管繁琐任务,而不是强迫人们改变工作方式。

7月8日周三
  1. Google Research Blog67

    Google Research通过导航协同改道改善城市交通拥堵

    Google Research在《Nature Cities》发表研究,利用导航平台协调少量出行路线,在10个美国城市改善交通状况。研究采用为期六个月的全市交叉实验;目标路段的驾驶速度中位数提高约2%,燃油消耗率中位数下降0.5%至1.0%,受影响路段整体速度中位数提高约0.35%。

    推荐理由:研究以10个美国城市开展真实世界对照实验,展示了少量导航改道如何改善全市交通,具备交通治理和方法验证价值。

6月27日周六
  1. Google Research Blog70

    Google Research 为 Pixel 上的 Gemini Nano v3 引入冻结式 MTP 加速架构

    Google Research 宣布将冻结的 Gemini Nano v3 与 Multi-Token Prediction(MTP)head 结合,并面向 Pixel 9 和 Pixel 10 系列推出加速方案。

    推荐理由:文章说明冻结主模型并集成MTP head、复用KV cache的移动端推理方案,给出速度、内存和部署影响,具有架构研究与端侧优化参考价值。

6月25日周四
  1. Google Research Blog68

    Google Research 研究推理如何扩展 LLM 的参数知识回忆能力

    Google Research 将研究推理如何让 LLM 回忆原本难以获得的参数知识,计划在 COLM 2026 展示相关结果。对 Gemini-2.5(Flash、Pro)和 Qwen3-32B 的实验表明,该作用主要与计算缓冲和事实启动有关;审计数十万条推理轨迹显示,中间事实出现幻觉会显著降低最终答案正确率。

    推荐理由:研究通过可开关推理的受控实验,区分额外计算与相关事实生成对参数知识回忆的影响,并指出中间事实幻觉会降低最终正确率,为测试时筛选和过程奖励提供依据。

6月13日周六
6月8日周一
  1. Google DeepMind Blog64

    Google DeepMind发布Sierra Leone AI学习预注册试验结果

    Google DeepMind公布Sierra Leone预注册试验结果:使用Guided Learning的学生数学成绩较对照组提高0.258个标准差,113,000多次互动中91.4%用于建立概念理解。教师主导课程、目标12小时时增益更高,团队还发布教师培训指南和RCT方法手册,并计划在其他国家开展试验。

    推荐理由:预注册试验提供了AI辅助数学学习的效果与互动数据,并强调教师主导设计,有助于小团队评估课堂应用价值;同时指出收益分布不均和跨国证据仍需验证。

6月6日周六
  1. Sebastian Raschka60

    LLM研究论文清单:2026年1月至5月

    Sebastian Raschka整理了2026年1月至5月期间关注的LLM研究论文,按模型架构、训练扩展、推理效率、长上下文、强化学习、代理系统等主题分类。该清单包含论文链接和作者的部分阅读判断,但明确不覆盖全年全部论文,作者也只详细阅读了其中一部分。

5月28日周四
  1. Google Research Blog66

    Google提出结合密码协议与TEE的零信任私人分析方案

    Google提出一种面向私人分析的新型安全聚合方案,将单次消息的密码协议与可信执行环境结合,用于在保护原始设备数据的同时获取汇总洞察。Google表示,该方案已用于评估AI系统在Pixel Recorder中的表现,Android SafetyCore也将利用相关指标改进分类器,同时保持用户内容仅留在设备上。

    推荐理由:文章说明了零信任聚合如何结合新型密码协议与TEE,并说明其在SafetyCore中的具体评估用途,便于团队理解大设备规模隐私分析与安全设计的取舍。

5月21日周四
5月19日周二
5月16日周六
  1. Google DeepMind Blog31

    Clare Bryant利用Co-Scientist寻找新发传染病背后的分子开关

    剑桥大学Clare Bryant使用Co-Scientist寻找病原体跨物种传播时引发严重疾病的分子开关。她以禽流感研究申请测试该工具,生成并排序假设,再将候选蛋白缩小到具体氨基酸;团队正构建含相应突变的细胞系。她表示,通常需要两至三年实验才能达到这一精度,现在有望六个月完成。

  2. Google DeepMind Blog47

    爱丁堡大学团队利用 Co-Scientist 加速肝病机制发现

    爱丁堡大学生物工程师 Filippo Menolascina 利用 Co-Scientist 梳理肝脏生物学与药理学文献,筛选值得关注的机制及可测试的候选联合疗法。该系统提出假设,将 NLRP3 炎症小体定位为连接 MASH 炎症与代谢的分子桥梁,并解释了 resmetirom 仅对部分符合条件的患者有效的原因。该假设随后经实验验证,可能为靶向双重疗法铺路。

5月15日周五
  1. Smashing Magazine40

    用户体验投资回报率的十大数据支撑事实

    这份分析梳理了用户体验投资回报率的十大数据支撑事实,说明设计、研究与分析如何影响业务表现。数据显示,设计阶段修复问题的成本最高可低至上线后修复的1/100;页面加载增加1秒,转化率和满意度可能分别下降20%和16%;合理运用留白可使内容理解力最高提升20%。

4月22日周三
  1. Google DeepMind Blog70

    Google DeepMind提出Decoupled DiLoCo分布式AI训练架构

    Google DeepMind提出Decoupled DiLoCo,通过解耦的计算“岛屿”和异步数据传输,在降低通信带宽的同时提升分布式训练的故障韧性。系统可在四个美国区域、使用2–5 Gbps广域网络训练12 billion parameter模型,速度超过传统同步方法的20倍;测试还显示其可在TPU v6e和TPU v5p混合训练中保持与单一芯片类型训练相同的ML性能。

    推荐理由:介绍一种面向全球分布式预训练的解耦异步架构,并给出故障恢复、带宽、速度及混用硬件的实验结果,具有评估大规模训练基础设施的参考价值。

  2. Google Research Blog66

    ReasoningBank:让智能体从经验中学习

    ReasoningBank提出一种智能体记忆框架,从成功和失败经历中提炼高层推理模式,并通过检索、提取与整合支持测试时自我进化。使用Gemini-2.5-Flash在WebArena和SWE-Bench-Verified上测试,其成功率分别较无记忆基线高8.3%和4.6%;结合MaTTS后,WebArena成功率再提高3%。

    推荐理由:文章介绍ReasoningBank如何从成功与失败经验中提炼可迁移记忆,并报告其在网页浏览和软件工程基准上的效果,适合评估智能体记忆设计与测试时扩展方案。

4月9日周四
  1. Google Research Blog66

    Google Research发布ConvApparel用户模拟器数据集与真实性评估框架

    Google Research提出ConvApparel数据集,用于测量LLM用户模拟器与真实人类交互之间的真实性差距。数据集包含服装购物领域超过4,000段人类—AI多轮对话,接近15,000轮,并结合人口统计对齐、人类相似度评分和反事实验证评估Prompted、ICL与SFT模拟器;实验显示数据驱动方法在统计对齐和应对未见过的低效代理方面优于提示基线,但仍存在真实性差距。

    推荐理由:ConvApparel以受控双智能体数据采集和三类验证指标衡量用户模拟器的真实性差距,适合评估合成用户能否支持对话式代理训练与测试。

4月3日周五
  1. Google Research Blog62

    Google Research 提出评估 LLM 行为倾向对齐的框架

    Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。

    推荐理由:提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。

4月1日周三
  1. Google Research Blog67

    构建更好的AI基准:需要多少评分者才够用?

    Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。

    推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。

3月31日周二
  1. Google Research Blog74

    Google提出负责任披露量子密码漏洞并更新椭圆曲线密码攻击资源估算

    Google发布白皮书,更新了未来量子计算机破解保护加密货币的256位椭圆曲线离散对数问题(ECDLP-256)所需资源估算,称其可能在少于1,200个逻辑量子比特和9,000万次Toffoli门,或少于1,450个逻辑量子比特和7,000万次Toffoli门的电路上实现。Google建议区块链逐步迁移至抗量子攻击的后量子密码学(PQC),并采用零知识证明验证漏洞估算,以避免公开敏感攻击细节。

    推荐理由:白皮书给出了可验证的量子资源估算,并用零知识证明支持负责任披露;其迁移至后量子密码学的建议可为区块链安全规划提供决策依据。

3月25日周三
  1. Google Research Blog70

    Google Research提出TurboQuant向量量化压缩方法

    Google Research提出TurboQuant向量量化压缩方法,并介绍其使用的PolarQuant与QJL,分别处理极坐标量化和1比特残差误差。文中称,该方法无需训练或微调即可将KV cache量化至3比特,在长上下文测试中保持模型准确性,并减少至少6倍的键值内存。

    推荐理由:文章给出算法机制、理论依据和多类基准结果,并明确量化精度、内存与速度指标,适合评估长上下文和向量搜索压缩方案。

3月24日周二