跳到正文

全部动态

今日 21 条
6月8日周一
  1. Google DeepMind Blog64

    Google DeepMind发布Sierra Leone AI学习预注册试验结果

    Google DeepMind公布Sierra Leone预注册试验结果:使用Guided Learning的学生数学成绩较对照组提高0.258个标准差,113,000多次互动中91.4%用于建立概念理解。教师主导课程、目标12小时时增益更高,团队还发布教师培训指南和RCT方法手册,并计划在其他国家开展试验。

    推荐理由:预注册试验提供了AI辅助数学学习的效果与互动数据,并强调教师主导设计,有助于小团队评估课堂应用价值;同时指出收益分布不均和跨国证据仍需验证。

6月6日周六
  1. Sebastian Raschka60

    LLM研究论文清单:2026年1月至5月

    Sebastian Raschka整理了2026年1月至5月期间关注的LLM研究论文,按模型架构、训练扩展、推理效率、长上下文、强化学习、代理系统等主题分类。该清单包含论文链接和作者的部分阅读判断,但明确不覆盖全年全部论文,作者也只详细阅读了其中一部分。

6月5日周五
  1. Google Research Blog73

    Google Research 发布 PHRM 被动心率监测研究与资源

    Google Research 发布 PHRM 研究系统,利用日常手机使用中的前置摄像头和深度学习,在后台估算心率与每日静息心率。研究使用超过 35 万个视频片段和近 700 名经同意的研究参与者,释放面向合资格研究人员申请访问的数据集与预训练 PHRM-mini 模型。

    推荐理由:公布手机摄像头被动估算心率与静息心率的研究系统、数据集及预训练模型,并披露实验室和真实生活验证结果及申请条件。

5月21日周四
5月19日周二
5月16日周六
  1. Sebastian Raschka74

    近期LLM架构发展:KV共享、mHC与压缩注意力

    近期开源权重LLM架构普遍通过KV共享、逐层注意力预算、压缩注意力和残差流优化来降低长上下文成本。文章分析Gemma 4的跨层KV共享与逐层嵌入、Laguna XS.2的逐层注意力头预算、ZAYA1-8B的压缩卷积注意力,以及DeepSeek V4的mHC与CSA/HCA,并指出这些设计会增加实现复杂度。

  2. Google DeepMind Blog31

    Clare Bryant利用Co-Scientist寻找新发传染病背后的分子开关

    剑桥大学Clare Bryant使用Co-Scientist寻找病原体跨物种传播时引发严重疾病的分子开关。她以禽流感研究申请测试该工具,生成并排序假设,再将候选蛋白缩小到具体氨基酸;团队正构建含相应突变的细胞系。她表示,通常需要两至三年实验才能达到这一精度,现在有望六个月完成。

  3. Google DeepMind Blog47

    爱丁堡大学团队利用 Co-Scientist 加速肝病机制发现

    爱丁堡大学生物工程师 Filippo Menolascina 利用 Co-Scientist 梳理肝脏生物学与药理学文献,筛选值得关注的机制及可测试的候选联合疗法。该系统提出假设,将 NLRP3 炎症小体定位为连接 MASH 炎症与代谢的分子桥梁,并解释了 resmetirom 仅对部分符合条件的患者有效的原因。该假设随后经实验验证,可能为靶向双重疗法铺路。

  4. Google DeepMind Blog61

    WeatherNext助力国家飓风中心提前预测飓风Melissa登陆牙买加

    Google DeepMind表示,其AI天气模型WeatherNext帮助美国国家飓风中心提前五天预测飓风Melissa以5级强度登陆牙买加,预测信心为80%,三天后接近100%。该模型通过50组情景预测评估风暴路径与强度,相关信息已通过Weather Lab以实验展示形式开放。

    推荐理由:文章提供了WeatherNext参与飓风预测的官方案例,披露预测提前量、置信度和专家协作方式,对评估AI气象模型的实际应用边界与灾害预警价值具有参考意义。

5月15日周五
  1. Smashing Magazine40

    用户体验投资回报率的十大数据支撑事实

    这份分析梳理了用户体验投资回报率的十大数据支撑事实,说明设计、研究与分析如何影响业务表现。数据显示,设计阶段修复问题的成本最高可低至上线后修复的1/100;页面加载增加1秒,转化率和满意度可能分别下降20%和16%;合理运用留白可使内容理解力最高提升20%。

5月5日周二
  1. Mozilla Hacks64

    Mozilla推进用于开放网络的可验证JavaScript安全机制WAICT

    Mozilla与Cloudflare、Freedom of the Press Foundation和Meta合作推进WAICT,使网站能够将客户端代码加密绑定到清单,并将清单提交至可公开审计的日志。启用WAICT后,Firefox Nightly可通过pref测试原型;未公开记录的代码会被浏览器拒绝。该实现仍在开发中,相关规范正在开放制定并征集早期反馈。

    推荐理由:WAICT把客户端代码完整性、公开日志和浏览器拒绝未公开代码结合起来,适合评估高敏感数据Web应用的供应链安全,但当前仍处于原型和规范化阶段。

4月30日周四
  1. Google Research Blog64

    Google Research介绍ERA在科学研究中的四类应用

    Google Research介绍ERA在流行病预测、宇宙学、CO₂监测和神经回路研究中的四类应用。团队将其用于每周提交流感、COVID-19和RSV住院预测,结合Gemini Deep Think推导宇宙弦辐射相关公式,并基于GOES East观测估算CO₂。ERA还根据simZFish结构信息提出可通过新视觉刺激测试的神经回路方案。

    推荐理由:四个跨领域案例展示了ERA从基准研究走向实际任务的过程,并提供预测、数学推导、卫星观测建模与神经机制发现等方法的参考价值。

4月27日周一
4月22日周三
  1. Google DeepMind Blog70

    Google DeepMind提出Decoupled DiLoCo分布式AI训练架构

    Google DeepMind提出Decoupled DiLoCo,通过解耦的计算“岛屿”和异步数据传输,在降低通信带宽的同时提升分布式训练的故障韧性。系统可在四个美国区域、使用2–5 Gbps广域网络训练12 billion parameter模型,速度超过传统同步方法的20倍;测试还显示其可在TPU v6e和TPU v5p混合训练中保持与单一芯片类型训练相同的ML性能。

    推荐理由:介绍一种面向全球分布式预训练的解耦异步架构,并给出故障恢复、带宽、速度及混用硬件的实验结果,具有评估大规模训练基础设施的参考价值。

  2. Google Research Blog66

    ReasoningBank:让智能体从经验中学习

    ReasoningBank提出一种智能体记忆框架,从成功和失败经历中提炼高层推理模式,并通过检索、提取与整合支持测试时自我进化。使用Gemini-2.5-Flash在WebArena和SWE-Bench-Verified上测试,其成功率分别较无记忆基线高8.3%和4.6%;结合MaTTS后,WebArena成功率再提高3%。

    推荐理由:文章介绍ReasoningBank如何从成功与失败经验中提炼可迁移记忆,并报告其在网页浏览和软件工程基准上的效果,适合评估智能体记忆设计与测试时扩展方案。

4月16日周四
  1. Google Research Blog64

    Simula:从第一性原理设计面向真实世界的合成数据集

    Google Research 推出推理优先、无需种子数据的合成数据集框架 Simula,通过全局多样化、局部分化、复杂化和双批评质量检查控制生成过程。Simula 在五个领域生成的最多 512K 条数据实验中,完整系统持续优于较简单的基线,但高复杂度数据仅在 GSM8k 数学推理中带来 10% 的准确率提升,在法律推理任务 LEXam 中反而降低表现,说明数据配置需适配使用模型的能力。

    推荐理由:将合成数据生成拆解为可控机制,并提供跨领域实验结果,有助于团队评估数据质量、复杂度与模型适配之间的关系。

  2. Google Research Blog64

    Google Research以合成神经元提升脑图谱重建效率

    Google Research提出MoGen,通过合成神经元形态增强PATHFINDER训练数据,使小鼠轴突重建错误率降低4.4%。在10%训练数据来自MoGen的实验中,改善主要来自合并错误减少;完整小鼠脑规模下估计可节省157人年人工校对工作。该论文将在ICLR 2026展示,MoGen及其物种专用模型已开源。

    推荐理由:论文给出了合成神经元数据对连接组重建的可量化增益,并开源模型及物种版本,便于研究团队复核和复现实验。

4月9日周四
  1. Google Research Blog66

    Google Research发布ConvApparel用户模拟器数据集与真实性评估框架

    Google Research提出ConvApparel数据集,用于测量LLM用户模拟器与真实人类交互之间的真实性差距。数据集包含服装购物领域超过4,000段人类—AI多轮对话,接近15,000轮,并结合人口统计对齐、人类相似度评分和反事实验证评估Prompted、ICL与SFT模拟器;实验显示数据驱动方法在统计对齐和应对未见过的低效代理方面优于提示基线,但仍存在真实性差距。

    推荐理由:ConvApparel以受控双智能体数据采集和三类验证指标衡量用户模拟器的真实性差距,适合评估合成用户能否支持对话式代理训练与测试。

4月3日周五
  1. Google Research Blog62

    Google Research 提出评估 LLM 行为倾向对齐的框架

    Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。

    推荐理由:提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。

4月1日周三
  1. Google Research Blog67

    构建更好的AI基准:需要多少评分者才够用?

    Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。

    推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。

3月31日周二
  1. Google Research Blog74

    Google提出负责任披露量子密码漏洞并更新椭圆曲线密码攻击资源估算

    Google发布白皮书,更新了未来量子计算机破解保护加密货币的256位椭圆曲线离散对数问题(ECDLP-256)所需资源估算,称其可能在少于1,200个逻辑量子比特和9,000万次Toffoli门,或少于1,450个逻辑量子比特和7,000万次Toffoli门的电路上实现。Google建议区块链逐步迁移至抗量子攻击的后量子密码学(PQC),并采用零知识证明验证漏洞估算,以避免公开敏感攻击细节。

    推荐理由:白皮书给出了可验证的量子资源估算,并用零知识证明支持负责任披露;其迁移至后量子密码学的建议可为区块链安全规划提供决策依据。

3月25日周三
  1. Google Research Blog70

    Google Research提出TurboQuant向量量化压缩方法

    Google Research提出TurboQuant向量量化压缩方法,并介绍其使用的PolarQuant与QJL,分别处理极坐标量化和1比特残差误差。文中称,该方法无需训练或微调即可将KV cache量化至3比特,在长上下文测试中保持模型准确性,并减少至少6倍的键值内存。

    推荐理由:文章给出算法机制、理论依据和多类基准结果,并明确量化精度、内存与速度指标,适合评估长上下文和向量搜索压缩方案。

  2. Google Research Blog57

    Google Research介绍S2Vec城市环境自监督学习框架

    Google Research开发了S2Vec,一种通过S2 Geometry划分和要素栅格化学习建成环境通用嵌入的自监督框架。模型使用掩码自编码,在美国人口密度和收入等社会经济指标的零样本地理适应任务中通常表现最佳,但单独处理树冠覆盖和高程等环境任务仍需改进;与卫星图像嵌入融合通常可提升效果。

3月18日周三
  1. Google Research Blog71

    Google Research与NHS研究机器学习乳腺癌筛查工作流

    Google Research与多家NHS机构开展AIMS研究,评估AI乳腺癌检测系统在单次阅片及双人阅片仲裁流程中的表现。研究显示,AI单独阅片的癌症检出率由每千人7.54例升至9.33例,并发现原流程漏检的25%间期癌;AI辅助工作流在敏感度和特异度上不劣于传统流程,但研究仍需进一步验证前瞻性临床有效性。

    推荐理由:提供NHS真实工作流中的研究数据与部署观察,能帮助医疗团队评估AI阅片系统的检测表现、流程可行性及数据漂移问题。

3月17日周二
  1. Google Research Blog60

    Google Research与Cornell University测试LLM回答高温超导研究问题

    Google Research与Cornell University评估六种LLM回答高温超导专家问题的能力,NotebookLM和基于同一资料库构建的自定义RAG系统总体表现最佳。研究测试访问于2024年12月,使用67个问题、1,726份实验论文和综述文章,发现依赖开放网络资料的模型更容易混淆成熟理论与推测,并暴露出时间、上下文及图像理解方面的不足。

    推荐理由:该研究以高温超导问题比较六种LLM,并用专家盲评检验准确性、全面性与证据支持,为科学领域构建可信AI工具提供方法和评估参考。

3月12日周四
  1. Google Research Blog61

    Google Research与BIDMC开展AMIE对话式诊断AI真实临床可行性研究

    Google Research与Beth Israel Deaconess Medical Center开展AMIE对话式诊断AI单中心前瞻性可行性研究,100名成人患者完成诊前交互,98人按预约就诊。

    推荐理由:这项单中心前瞻性可行性研究提供了真实基层医疗流程中的安全、诊断表现和医患体验证据,同时明确指出缺乏对照比较等限制,适合用于判断后续临床验证的研究设计。

3月8日周日
2月27日周五
  1. Mozilla Hacks60

    WebAssembly 为何仍是 Web 上的二等语言

    Mozilla Hacks 分析 WebAssembly 虽已加入 SIMD、异常处理、尾调用、64 位内存和 GC 等能力,但仍依赖 JavaScript 完成加载和 Web API 访问,开发体验与工具链支持不足。文章提出 WebAssembly Component Model 作为潜在方向,目标是提供跨语言链接和直接调用 Web API 的统一能力;相关平台集成与工具仍在设计中。

    推荐理由:文章从加载、API 桥接、工具链和性能成本分析 WebAssembly 的开发门槛,并讨论 Component Model 的潜力与未完成状态,适合评估技术路线时参考。

2月25日周三
12月30日周二
  1. Sebastian Raschka65

    Sebastian Raschka 回顾 2025 年大语言模型进展、问题与趋势

    Sebastian Raschka 回顾了 2025 年大语言模型在推理模型、RLVR 与 GRPO、架构效率、工具使用和评测方面的发展,并指出基准测试难以充分代表真实能力。文章还分析了这些技术对编码、技术写作、研究和个人生产力的影响。作者据此预测未来将进一步扩展 RLVR、推理时扩展和本地工具使用,但这些内容属于趋势判断。

  2. Sebastian Raschka21

    LLM研究论文:2025年7月至12月清单

    Sebastian Raschka整理了2025年7月至12月期间收集并分类的LLM研究论文清单,涵盖推理模型、强化学习、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态及数据集等主题。他表示主要浏览了论文摘要,仅阅读了其中很小一部分,并将清单与同日发布的《State of LLMs 2025》分开整理。

12月10日周三
  1. PortSwigger Research83

    SAML 认证绕过研究:解析器差异与 Void Canonicalization 攻击

    PortSwigger Research 研究人员展示了利用 XML 解析器差异、属性污染、命名空间混淆和 Void Canonicalization,在 Ruby-SAML、php-saml 等 SAML 生态中绕过 XML Signature 验证并实现完整认证绕过的方法。研究还介绍了用于分析解析器差异的开源工具,并列出严格 XSD、仅处理已签名元素及更新 SAML/XML 库等防御措施。

    推荐理由:文章系统拆解属性污染、命名空间混淆和 Void Canonicalization 如何造成 SAML 认证绕过,并给出受影响库、修复时间线与防御建议。

12月3日周三
11月4日周二
  1. Sebastian Raschka64

    Sebastian Raschka 介绍标准 LLM 之外的模型架构

    Sebastian Raschka 对标准自回归 Transformer 之外的 LLM 架构进行概览,涵盖线性注意力混合模型、文本扩散模型、代码世界模型和小型递归 Transformer。文中比较了它们在长上下文效率、并行生成、代码状态建模和结构化推理方面的特点,同时指出准确率、工具调用、训练复杂度与适用范围等取舍。

9月3日周三
  1. PortSwigger Research72

    Cookie Chaos:如何绕过 __Host- 和 __Secure- Cookie 前缀

    PortSwigger Research展示了利用浏览器与服务器解析差异绕过 __Host- 和 __Secure- Cookie 前缀的方法。文章测试了Django、ASP.NET及部分Java服务器的解析行为,并介绍使用Burp Suite Custom Action检测后端是否可能受到影响。

    推荐理由:文章通过Unicode空白字符和传统Cookie解析差异,演示浏览器与后端解释不一致时如何绕过__Host-、__Secure-前缀限制,并提供Burp Suite Custom Action辅助检测,适合安全测试人员理解攻击面与排查配置风险。

8月26日周二
  1. PortSwigger Research67

    使用链式 CSS 条件语句通过内联样式窃取属性数据

    PortSwigger Research 研究人员展示如何利用链式 CSS 条件语句和 image-set(),在不导入样式表的情况下从内联样式中的属性读取数据。文章提供 div 样式、data-uid 范围判断及 Burp Suite Custom Action 示例,并指出该技术当时仅适用于基于 Chromium 的浏览器。

    推荐理由:文章给出可复现的内联 CSS 属性数据外泄方法,涵盖条件语句、嵌套 if、引号差异及请求构造,并明确 Chromium 浏览器限制,适合开展 CSS 注入验证与防御测试。

8月9日周六
  1. Sebastian Raschka69

    从GPT-2到gpt-oss:分析OpenAI开放权重模型的架构进展

    OpenAI本周发布gpt-oss-20b和gpt-oss-120b,这是其自GPT-2以来首次共享大型开放权重模型,架构分析涵盖MoE、GQA、滑动窗口注意力、RMSNorm和注意力偏置等变化。文章还比较了gpt-oss与Qwen3在模型深度、宽度、专家数量及MXFP4量化部署方面的差异,并指出gpt-oss-20b可借助MXFP4在支持该格式的消费级GPU上运行。

8月7日周四
  1. PortSwigger Research88

    PortSwigger研究HTTP/1.1请求走私与desync攻击

    PortSwigger研究称,HTTP/1.1固有的请求分离缺陷可被新的请求走私与desync攻击利用,研究中的案例涉及Akamai、Cloudflare和Netlify等基础设施。作者还发布开源工具HTTP Request Smuggler v3.0,用于检测解析差异和目标特有弱点;相关技术与案例在两周内获得超过20万美元漏洞赏金。

    推荐理由:文章通过授权测试和多个云基础设施案例,说明HTTP/1.1请求边界模糊会放大解析差异风险,并介绍可系统检测差异的开源工具。对代理链审计、漏洞检测和迁移到上游HTTP/2具有直接参考价值。