跳到正文

全部动态

今日 21 条
9月4日周五
  1. Google Research Blog79

    Google Research与HHMI Janelia等合作完成雄性果蝇全脑连接图

    Google Research、HHMI Janelia及剑桥大学等地合作者完成了雄性果蝇脑与中枢神经系统的完整连接图,包含超过166,000个神经元和1.25亿个突触连接。该图已通过人工专家标注与校验,可通过开源工具Neuroglancer查看、探索和下载,研究团队称其为迄今按神经元数量计最大的脑图谱。

    推荐理由:完整雄性果蝇脑与中枢神经连接组具有重要科研价值,公开数据与验证流程可为神经科学研究提供可复用的基础资源。

9月2日周三
  1. Hugging Face Blog72

    BenchMIRT:LLM基准实际测量了哪些能力?

    AllenAI推出BenchMIRT,以多维项目反应理论分析LLM基准中每道题背后的能力信号。它使用100个LLM、16个基准和超过34K道题训练,独立识别出安全与通用推理两个主要维度;保留10%题目通常仍能呈现相近能力图景,预测未见题答案的准确率为79%,高于简单方法的70%。分析未涵盖2025年3月后发布的模型,且筛选高信息量题目可能削弱安全评测。

    推荐理由:BenchMIRT提供按单题分析基准能力信号的方法,并量化问题筛选与性能预测效果,适合研究评测设计和解释模型分数,但对较新模型的适用性仍需验证。

8月27日周四
  1. Google DeepMind Blog61

    Google DeepMind启动专有前沿AI模型双重盲测试点

    Google DeepMind与Singapore AI Safety Institute、OpenMined、AVERI和MLCommons合作,对Gemini Flash Lite开展专有模型双重盲测。评估在保护隐私的加密“盒子”环境中进行,外部测试题不会在测试前提供给模型,以减少benchmark contamination并提升评估完整性。

    推荐理由:Google DeepMind与外部机构开展双重盲测试点,把专有前沿模型评估置于加密环境,降低测试题泄露与基准污染对结果可信度的影响。

8月26日周三
8月25日周二
  1. PortSwigger Research70

    标签名里能藏什么?JavaScript 或许可以

    PortSwigger Research 测试了HTML标签名的字符转换及其在JavaScript、XSS和WAF绕过中的利用方式。研究发现,localName、part、classList等属性可与onfocus、autofocus和tabindex组合执行代码,文中称相关向量可在所有浏览器工作。

    推荐理由:文章通过浏览器实验揭示标签名、localName及事件属性可组合成XSS向量,并分析其对WAF特征匹配的影响,适合前端安全测试与防护研究参考。

  2. Hugging Face Blog61

    Quantization-Aware Healing:4-bit 压缩模型在部分基准上超过原始全精度版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),让结构压缩并量化为 MXFP4 的模型直接从压缩前的原始模型蒸馏。

    推荐理由:文章以基准数据说明结构压缩后再进行 MXFP4 量化时,直接从原始模型蒸馏的 QAH 可避免恢复上限,并在长上下文、数学和代码任务上取得收益;结果包含与 QAT 的对比,但对完整训练细节仍需查阅论文。

8月24日周一
8月22日周六
  1. Google Research Blog64

    Google Research提出可穿戴传感器候选生物标志物优先级框架

    Google Research介绍多代理系统 Biomarker Discovery Framework,用于在人工监督下优先筛选可穿戴传感器数据中的候选生物标志物。该框架结合假设生成、统计分析、模型训练、对抗验证和文献推理,在三个队列共9,279次参与者观察中识别出心理健康和代谢领域的候选关联,但研究明确这些结果不等同于临床验证或因果结论。

    推荐理由:该框架将统计计算、生成式推理与对抗验证结合,覆盖数据泄漏、过拟合和混杂因素等问题;其多队列结果与专家盲评为可穿戴生物标志物研究提供了可复用的工作流参考。

8月21日周五
  1. Google Research Blog63

    Google Research提出ME-POIs框架,用移动模式增强地点理解

    Google Research提出Mobility-Embedded POIs(ME-POIs),将文本描述与公共基准数据中的聚合、匿名化移动模式结合,用于表示地点随时间变化的活跃节奏。该框架在洛杉矶和休斯敦的未见地点测试中,访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。研究强调其面向地点和商业聚合理解,不用于个人用户分析或个性化。

    推荐理由:ME-POIs把匿名化、聚合的移动模式引入地点表示,报告了未见地点预测任务的量化提升,适合关注时空表示学习与地点属性预测的团队参考。

  2. Hugging Face Blog77

    研究语音识别模型对公开基准的优化行为

    研究团队评估11个广泛使用的开源ASR模型,发现部分高分模型会依据声学线索复现VoxPopuli和LibriSpeech中与音频不符的参考转录。模型还会恢复被遮蔽数字,并根据基准选择“any one”等正字法,部分模型在公开基准上的表现不能直接代表对新音频的转录能力。团队在Open ASR Leaderboard加入“Benchmark fitting”标签页,并开源相关脚本与未归一化模型输出。

    推荐理由:文章用参考转录分歧、遮蔽数字和正字法切换三类测试,揭示公开语音识别基准可能被模型拟合,并提供可复现脚本帮助改进评测设计。

8月19日周三
  1. Hugging Face Blog65

    ALTK-Evolve:智能体需要多少记忆取决于模型能力

    ALTK-Evolve 在八个模型上的评估显示,智能体记忆不是越多越好,而应按模型能力校准:能力较强的模型可使用完整指南集,较弱模型适合精简核心加按任务检索,已饱和模型未显示可测收益。

    推荐理由:文章以八个模型在 AppWorld 上的实验说明智能体记忆应按模型能力校准,并比较完整指南与检索式注入的准确率和 token 成本,为 Agent 记忆设计提供可操作的分层策略。

8月17日周一
  1. Google Research Blog66

    Google Research提出PhotoScan:从智能手机照片估算三维体成分与心代谢风险

    Google Research推出研究原型PhotoScan,利用深度学习从标准2D智能手机照片估算体脂率、Android-to-Gynoid脂肪比和内脏与皮下脂肪面积比,并以DXA结果作为真值进行微调和验证。该框架在独立队列中估算三项指标,并结合人口统计信息将胰岛素抵抗分类AUROC从0.692提升至0.760;研究团队称其仍处于研究原型阶段。

    推荐理由:提供从预训练、微调到独立验证的完整研究路径,并以DXA和代谢指标比较结果,展示了手机影像估计体成分及预测胰岛素抵抗的研究方法与局限。

8月14日周五
  1. Hugging Face Blog72

    Hugging Face 发布 2026 年夏季开放模型生态观察

    Hugging Face 发布了基于 2026 年前七个月 Hugging Face Hub 活动的开放模型生态观察。数据显示,公共模型仓库从 243 万增至 296 万,但约 85.6% 的模型累计下载量不足 200;Qwen 已形成大规模社区衍生生态,代理流量也成为新的重要使用来源。报告强调,下载量、点赞和衍生模型分别反映不同层面的活动,不能直接等同于模型质量或整体市场采用情况。

    推荐理由:报告基于 Hugging Face Hub 前七个月的活动数据,分析模型规模、下载与关注度、许可、社区衍生和代理流量等生态变化,对评估开放模型的实际使用结构与平台趋势具有参考价值。

8月12日周三
  1. Google Research Blog68

    Google Research提出知识画像方法,揭示前沿LLM事实召回瓶颈

    Google Research提出知识画像框架与WikiProfile基准,用2,150条Wikipedia事实分析13个LLM的编码、召回和识别能力。实验显示,Gemini-3-Pro和GPT-5虽有95–98%的事实完成编码,却仍无法直接召回26–34%的已编码事实;思考可恢复约40–65%的此类事实。研究认为,事实性瓶颈正从知识获取转向知识利用。

    推荐理由:文章用知识画像区分事实的编码、召回与识别,并以13个LLM的大规模实验说明前沿模型的瓶颈更多在知识调用,适合评估改进方向。

8月10日周一
  1. Hugging Face Blog72

    让知识蒸馏达到可规模化运行的成本:Multiverse Computing 的分块 KL 损失方案

    Multiverse Computing 提出 Efficient Knowledge Distillation for LLMs,结合离线 top-K logits 缓存与 fused chunked KL loss,降低知识蒸馏的显存占用并支持单 GPU 长上下文训练。

    推荐理由:文章给出可复现实验与开源实现,说明如何通过缓存和分块计算降低长上下文蒸馏的显存与成本,适合需要优化模型压缩流程的小团队参考。

8月7日周五
  1. PortSwigger Research79

    CSS:收件箱中的攻击面与 Webmail 绕过研究

    PortSwigger Research 研究了 Webmail 客户端中不可信 HTML/CSS 与可信界面之间的信任边界问题,并在 Fastmail、ProtonMail、Gmail、Outlook 等客户端中展示了 CSS 消毒绕过和攻击方法。

    推荐理由:文章以多个 Webmail 客户端的实际测试为基础,系统展示 CSS 消毒绕过、代理绕过、令牌外泄和密码窃取路径,并给出隔离、CSP、白名单及选择器限制等防御建议。

8月6日周四
  1. PortSwigger Research79

    CRLF 驱动的去同步攻击:斩断 HTTP 流

    PortSwigger Research 展示 HTTP 请求头注入可升级为请求拆分、响应队列投毒和自我复制的去同步攻击。研究还介绍通过浏览器执行连接锁定与 IP 锁定去同步、获取 XSS 和 HTTPOnly Cookie 的方法,并开源 Burp Suite 扩展、nuclei 模板及实验环境。

    推荐理由:文章系统展示请求头注入如何升级为去同步攻击,并分析连接锁定、IP 锁定场景及浏览器触发方法;同时开源扫描工具、nuclei 模板和实验环境,对安全测试研究与防护配置有直接价值。

  2. PortSwigger Research83

    PortSwigger Research 用 HTTP Terminator 探索 AI 自主安全研究

    James Kettle 构建并开源 HTTP Terminator,用于自动生成、验证和扩展 HTTP desync 攻击研究,发现了新的触发器、模式、武器化技术及 Shared-Parser Confusion 等线索。

    推荐理由:文章以实际测试和开源工具为基础,拆解自主安全研究从假设生成、验证到武器化与级联发现的方法,并明确人类在发现链中的作用,适合安全研究与自动化工具实践参考。

7月31日周五
  1. Krebs on Security77

    Bitsight分析揭示H96电视盒子参与广告欺诈与住宅代理

    Bitsight研究人员发现,H96电视盒子会伪装成手机访问AI生成网站并点击广告,相关网络由Fengwo Group运营。分析显示,设备在电视开启时通常充当住宅代理,电视关闭时则参与广告欺诈;Bitsight估算单个旧域名关联的欺诈网络日收入接近5万美元。作者建议消费者选择知名厂商设备,并核实是否采用官方Android TV OS及Play Protect认证。

    推荐理由:文章通过Bitsight对域名、应用、证书和设备遥测的关联分析,揭示H96电视盒子兼具广告欺诈与住宅代理风险,并提供识别官方Android TV与检查预装软件的实际决策依据。

7月29日周三
7月23日周四
  1. Google Research Blog67

    Google Research 发布 SymptomAI 对话式症状评估研究结果

    Google Research 与 Google DeepMind 开展了包含 13,917 名参与者的随机研究,比较五种 Gemini Flash 2.0 SymptomAI 对话代理的鉴别诊断表现。

    推荐理由:大规模随机研究与临床专家标注结合可穿戴设备信号,展示了对话式症状评估的研究价值,同时明确其为研究用途,不能替代正式临床诊断。

  2. Google Research Blog71

    Google Research 用强化学习让量子计算机从错误中持续校准

    Google Research 在 Nature 发表研究,将强化学习框架接入量子纠错,使自主智能体根据错误检测结果持续调整数千个控制参数,并在计算过程中抑制量子系统漂移。在 Willow 超导处理器上的实验表明,逻辑稳定性提升 3.5 倍,专家校准后再经强化学习微调可额外降低 20% 的逻辑错误率;数值模拟覆盖数百个量子比特和数万控制参数,研究团队认为所需训练迭代次数与系统规模无关。

    推荐理由:将强化学习接入量子纠错事件,可在计算过程中动态调整控制参数并抑制漂移;实验还给出稳定性提升和错误率降低数据,对评估量子控制方法具有直接参考价值。

7月16日周四
  1. Hugging Face Blog43

    DharmaOCR:新模型涌现,巴西葡萄牙语OCR专门化优势仍存

    DharmaOCR在巴西葡萄牙语OCR基准测试中取得0.925分,高于Mistral OCR4的0.798分和Unlimited-OCR的0.7587分,显示出专门化带来的显著优势。其训练先通过监督微调适配葡萄牙语词汇、语法和文档结构,再以Direct Preference Optimization抑制重复或不连贯输出,降低推理时间和成本并提升生产环境稳定性。

7月15日周三
  1. Smashing Magazine35

    不,人们并不想在生活中加入更多 AI

    人们并不想要更多脱离实际工作流的 AI;新增 AI 功能往往采用率和留存率较低,同时带来高昂交付成本、声誉风险,以及核查“AI 幻觉”等额外负担。真正有价值的方向,是让 AI 融入既有工作流,稳定、可靠地接管繁琐任务,而不是强迫人们改变工作方式。

7月9日周四
  1. Google Research Blog67

    Google Research 提出 SensorFM:面向可穿戴健康数据的通用表征

    Google Research 提出 SensorFM,以超过一万亿分钟、来自500万名参与者的多模态传感器数据进行预训练,学习可跨多类健康任务复用的生理表征。

    推荐理由:该研究给出大规模无标签传感器预训练、缺失数据处理及跨健康任务评估的完整结果,对可穿戴健康模型的统一表征与低成本适配具有参考价值。

7月8日周三
  1. Google Research Blog67

    Google Research通过导航协同改道改善城市交通拥堵

    Google Research在《Nature Cities》发表研究,利用导航平台协调少量出行路线,在10个美国城市改善交通状况。研究采用为期六个月的全市交叉实验;目标路段的驾驶速度中位数提高约2%,燃油消耗率中位数下降0.5%至1.0%,受影响路段整体速度中位数提高约0.35%。

    推荐理由:研究以10个美国城市开展真实世界对照实验,展示了少量导航改道如何改善全市交通,具备交通治理和方法验证价值。

7月1日周三
  1. Hugging Face Blog73

    ScarfBench:评测企业Java框架迁移AI智能体

    IBM Research推出开源基准ScarfBench,用于评测AI智能体在Enterprise Java跨框架迁移中的构建、部署和行为保持能力。基准包含34个应用、102个框架实现和204项迁移任务;测试显示当前最强智能体的行为成功率低于10%,且智能体自报成功不能替代独立构建与测试验证。

    推荐理由:ScarfBench将企业Java跨框架迁移从代码生成推进到构建、部署和行为验证,揭示智能体成功率、过度自信及依赖管理之间的差距,对评估现代化方案具有直接参考价值。

6月27日周六
  1. Google Research Blog70

    Google Research 为 Pixel 上的 Gemini Nano v3 引入冻结式 MTP 加速架构

    Google Research 宣布将冻结的 Gemini Nano v3 与 Multi-Token Prediction(MTP)head 结合,并面向 Pixel 9 和 Pixel 10 系列推出加速方案。

    推荐理由:文章说明冻结主模型并集成MTP head、复用KV cache的移动端推理方案,给出速度、内存和部署影响,具有架构研究与端侧优化参考价值。

6月25日周四
  1. Google Research Blog77

    Google Research:利用线性弹性缓存优化云基础设施总成本

    Google Research提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并利用轻量级机器学习动态预测页面生存时间,以平衡内存占用与缓存未命中成本。该策略已集成Spanner数月:相较固定容量缓存,内存使用量减少15.5%,缓存未命中率增加5.5%,总拥有成本降低约5%,实际I/O成本影响仅0.5%。

    推荐理由:文章把缓存容量管理转化为带成本的动态决策问题,并给出Spanner生产环境与公开缓存轨迹的对照结果,适合需要权衡内存成本、缓存命中率和I/O开销的团队参考。

  2. Google Research Blog68

    Google Research 研究推理如何扩展 LLM 的参数知识回忆能力

    Google Research 将研究推理如何让 LLM 回忆原本难以获得的参数知识,计划在 COLM 2026 展示相关结果。对 Gemini-2.5(Flash、Pro)和 Qwen3-32B 的实验表明,该作用主要与计算缓冲和事实启动有关;审计数十万条推理轨迹显示,中间事实出现幻觉会显著降低最终答案正确率。

    推荐理由:研究通过可开关推理的受控实验,区分额外计算与相关事实生成对参数知识回忆的影响,并指出中间事实幻觉会降低最终正确率,为测试时筛选和过程奖励提供依据。

6月23日周二
6月13日周六
6月11日周四
  1. Google Research Blog63

    Google Research提出Regularized f-Divergence Kernel Tests机器遗忘审计框架

    Google Research提出Regularized f-Divergence Kernel Tests,用于通过相对分布距离审计机器遗忘和差分隐私。该框架在AISTATS 2026展示,实验称其能以更少样本捕捉细微隐私违规,并避免传统双样本检验将安全重训模型误判为遗忘失败。

    推荐理由:提出面向机器遗忘与差分隐私审计的相对分布检验框架,并用理论与实验说明其在降低误报、捕捉细微隐私违规和适配不同数据偏移方面的价值。

6月10日周三