跳到正文

#AI

今日 0 条
4月21日周二
4月16日周四
  1. Google Research Blog64

    Simula:从第一性原理设计面向真实世界的合成数据集

    Google Research 推出推理优先、无需种子数据的合成数据集框架 Simula,通过全局多样化、局部分化、复杂化和双批评质量检查控制生成过程。Simula 在五个领域生成的最多 512K 条数据实验中,完整系统持续优于较简单的基线,但高复杂度数据仅在 GSM8k 数学推理中带来 10% 的准确率提升,在法律推理任务 LEXam 中反而降低表现,说明数据配置需适配使用模型的能力。

    推荐理由:将合成数据生成拆解为可控机制,并提供跨领域实验结果,有助于团队评估数据质量、复杂度与模型适配之间的关系。

  2. Google Research Blog64

    Google Research以合成神经元提升脑图谱重建效率

    Google Research提出MoGen,通过合成神经元形态增强PATHFINDER训练数据,使小鼠轴突重建错误率降低4.4%。在10%训练数据来自MoGen的实验中,改善主要来自合并错误减少;完整小鼠脑规模下估计可节省157人年人工校对工作。该论文将在ICLR 2026展示,MoGen及其物种专用模型已开源。

    推荐理由:论文给出了合成神经元数据对连接组重建的可量化增益,并开源模型及物种版本,便于研究团队复核和复现实验。

  3. Google DeepMind Blog69

    Google 发布 Gemini 3.1 Flash TTS 文本转语音模型

    Google 发布 Gemini 3.1 Flash TTS,并通过 Gemini API、Google AI Studio 和 Vertex AI 推出预览,面向 Workspace 用户经由 Google Vids 提供。模型支持多说话者对话、70 多种语言和可嵌入文本的 audio tags;所有生成音频均带有 SynthID 水印。

    推荐理由:正式发布信息明确了预览渠道、语言支持、音频标签与 SynthID 等关键细节,开发者可据此评估语音应用的集成方式与控制能力。

4月14日周二
  1. Google Research Blog61

    Google Research发布Vantage生成式AI未来技能评估实验

    Google Research与New York University合作推出Vantage研究实验,通过生成式AI模拟多方对话,评估高中和大学学生的合作与问题解决等未来技能。Vantage目前已在Google Labs开放英文注册;研究显示,其Executive LLM能引导对话产生更多与目标技能相关的信息,AI Evaluator的评分与人类专家评分具有较高一致性。

    推荐理由:Vantage把生成式AI对话、动态情境和评估量规结合起来,为高中与大学教师提供了可扩展的技能练习与评估研究环境,值得关注其模拟技能向真实场景迁移的验证进展。

4月13日周一
  1. Google DeepMind Blog68

    Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

    Google DeepMind 发布 Gemini Robotics-ER 1.6,用于机器人的视觉与空间理解、任务规划和成功检测,并可原生调用 Google Search、VLA 模型及第三方函数。

    推荐理由:为机器人提供可经 API 调用的高级推理模型,并公开开发示例;空间、多视角、仪表读数与安全评测结果可用于技术选型和应用验证。

4月9日周四
  1. Google Research Blog66

    Google Research发布ConvApparel用户模拟器数据集与真实性评估框架

    Google Research提出ConvApparel数据集,用于测量LLM用户模拟器与真实人类交互之间的真实性差距。数据集包含服装购物领域超过4,000段人类—AI多轮对话,接近15,000轮,并结合人口统计对齐、人类相似度评分和反事实验证评估Prompted、ICL与SFT模拟器;实验显示数据驱动方法在统计对齐和应对未见过的低效代理方面优于提示基线,但仍存在真实性差距。

    推荐理由:ConvApparel以受控双智能体数据采集和三类验证指标衡量用户模拟器的真实性差距,适合评估合成用户能否支持对话式代理训练与测试。

  2. Google Research Blog59

    Google Research 发布 PaperVizAgent 与 ScholarPeer 学术研究代理框架

    Google Research 推出 PaperVizAgent 和 ScholarPeer,分别用于生成学术图表和自动化评估论文。PaperVizAgent 通过五个专门代理协作生成图示或可执行的 Python 统计绘图代码,ScholarPeer 结合网络检索与多代理流程生成基于文献的评审报告;两者目前仍是实验性研究原型,不应作为编辑或出版决策的最终依据。

4月3日周五
  1. Google Research Blog62

    Google Research 提出评估 LLM 行为倾向对齐的框架

    Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。

    推荐理由:提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。

4月1日周三
  1. Google Research Blog67

    构建更好的AI基准:需要多少评分者才够用?

    Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。

    推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。

3月31日周二
  1. Google Research Blog74

    Google提出负责任披露量子密码漏洞并更新椭圆曲线密码攻击资源估算

    Google发布白皮书,更新了未来量子计算机破解保护加密货币的256位椭圆曲线离散对数问题(ECDLP-256)所需资源估算,称其可能在少于1,200个逻辑量子比特和9,000万次Toffoli门,或少于1,450个逻辑量子比特和7,000万次Toffoli门的电路上实现。Google建议区块链逐步迁移至抗量子攻击的后量子密码学(PQC),并采用零知识证明验证漏洞估算,以避免公开敏感攻击细节。

    推荐理由:白皮书给出了可验证的量子资源估算,并用零知识证明支持负责任披露;其迁移至后量子密码学的建议可为区块链安全规划提供决策依据。

3月25日周三
  1. Google Research Blog69

    Vibe Coding XR:使用 XR Blocks 和 Gemini 加速 AI 与 XR 原型开发

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与网页端 XR Blocks 框架结合,可将自然语言直接生成具备物理感知的 Android XR 应用,生成时间低于 60 秒。

    推荐理由:将自然语言直接生成具备物理感知的 Android XR 应用,并公开早期评测与开源框架,便于开发者评估快速原型的可靠性和适用边界。

  2. Google Research Blog70

    Google Research提出TurboQuant向量量化压缩方法

    Google Research提出TurboQuant向量量化压缩方法,并介绍其使用的PolarQuant与QJL,分别处理极坐标量化和1比特残差误差。文中称,该方法无需训练或微调即可将KV cache量化至3比特,在长上下文测试中保持模型准确性,并减少至少6倍的键值内存。

    推荐理由:文章给出算法机制、理论依据和多类基准结果,并明确量化精度、内存与速度指标,适合评估长上下文和向量搜索压缩方案。

  3. Google Research Blog57

    Google Research介绍S2Vec城市环境自监督学习框架

    Google Research开发了S2Vec,一种通过S2 Geometry划分和要素栅格化学习建成环境通用嵌入的自监督框架。模型使用掩码自编码,在美国人口密度和收入等社会经济指标的零样本地理适应任务中通常表现最佳,但单独处理树冠覆盖和高程等环境任务仍需改进;与卫星图像嵌入融合通常可提升效果。

3月18日周三
  1. Google Research Blog62

    Google Research 在 The Check Up 展示医疗 AI 研究与生态进展

    Google Research 在 The Check Up 活动概述其医疗 AI 研究,覆盖个性化健康、临床协作、开发者生态、公共卫生和生物医学研究。文中称,乳腺癌检测系统识别出 25% 此前漏诊的 interval cancers,HAI-DEF 则提供免费开放权重模型 MedGemma;MedGemma Impact Challenge 已收到 850 多份投稿。

    推荐理由:集中梳理医疗多模态模型、临床筛查、开发者工具与公共卫生研究,便于了解各项目的当前结果、测试阶段及合作方向。

  2. Google Research Blog71

    Google Research与NHS研究机器学习乳腺癌筛查工作流

    Google Research与多家NHS机构开展AIMS研究,评估AI乳腺癌检测系统在单次阅片及双人阅片仲裁流程中的表现。研究显示,AI单独阅片的癌症检出率由每千人7.54例升至9.33例,并发现原流程漏检的25%间期癌;AI辅助工作流在敏感度和特异度上不劣于传统流程,但研究仍需进一步验证前瞻性临床有效性。

    推荐理由:提供NHS真实工作流中的研究数据与部署观察,能帮助医疗团队评估AI阅片系统的检测表现、流程可行性及数据漂移问题。

3月17日周二
  1. Google Research Blog60

    Google Research与Cornell University测试LLM回答高温超导研究问题

    Google Research与Cornell University评估六种LLM回答高温超导专家问题的能力,NotebookLM和基于同一资料库构建的自定义RAG系统总体表现最佳。研究测试访问于2024年12月,使用67个问题、1,726份实验论文和综述文章,发现依赖开放网络资料的模型更容易混淆成熟理论与推测,并暴露出时间、上下文及图像理解方面的不足。

    推荐理由:该研究以高温超导问题比较六种LLM,并用专家盲评检验准确性、全面性与证据支持,为科学领域构建可信AI工具提供方法和评估参考。

3月12日周四
  1. Google Research Blog64

    Google Research 在 Flood Hub 推出 AI 驱动的城市山洪预报

    Google Research 宣布在 Flood Hub 推出 Urban Flash Flood forecasts,利用 Groundsource、AI 模型和实时天气预报,预测城市山洪未来24小时的风险。

    推荐理由:文章披露模型的数据构建、时空分辨率、适用范围与评估方法,并说明部分非洲地区仍缺少地面真值,便于判断试点成果及其验证局限。

  2. Google Research Blog71

    Google Research发布Groundsource:用Gemini将新闻报道转化为山洪数据

    Google Research发布Groundsource,利用Gemini从非结构化全球新闻中提取山洪事件的时间、地点和影响信息。团队公开了覆盖150多个国家、包含260万条历史记录的数据集;人工审核显示,82%的提取事件足以用于实际分析。基于该数据集,Google已能在Google Flood Hub推出近全球城市山洪提前24小时预报。

    推荐理由:Groundsource将全球新闻转化为结构化历史灾害数据,并公开提供260万条山洪记录;其时空精度、覆盖率与Google Flood Hub预测部署,为灾害建模和预警研究提供了可评估的数据基础。

  3. Google Research Blog61

    Google Research与BIDMC开展AMIE对话式诊断AI真实临床可行性研究

    Google Research与Beth Israel Deaconess Medical Center开展AMIE对话式诊断AI单中心前瞻性可行性研究,100名成人患者完成诊前交互,98人按预约就诊。

    推荐理由:这项单中心前瞻性可行性研究提供了真实基层医疗流程中的安全、诊断表现和医患体验证据,同时明确指出缺乏对照比较等限制,适合用于判断后续临床验证的研究设计。

2月18日周三
2月17日周二
  1. Go Blog81

    使用 go fix 现代化 Go 代码

    Go 1.26 发布了完全重写的 go fix 子命令,可通过分析器识别并应用更现代的 Go 语言和库写法。文章介绍运行 go fix、预览差异、选择分析器、跨平台构建配置、重复运行至固定点,以及 Go analysis framework 和 self-service 现代化的基础设施。

    推荐理由:文章系统讲解 Go 1.26 重写后的 go fix 用法、modernizer、冲突处理与分析框架,并展示如何借助 go fix 批量现代化 Go 代码。

1月14日周三
  1. Python Insider61

    Python 3.15.0 alpha 5 发布,修正构建版本并预览新特性

    Python 3.15.0a5 是 Python 3.15 的第五个 alpha 预览版本,因 3.15.0a4 误用旧版 main 构建而额外发布,并正确基于 2026-01-14 的 main 构建。当前变更包括 PEP 799 采样分析器、PEP 686 默认 UTF-8、PEP 782 PyBytesWriter C API,以及 JIT 和错误消息改进;官方不建议将其用于生产环境。

    推荐理由:明确说明 alpha 5 的修正原因与测试定位,并列出 PEP、性能变化及后续时间表,便于开发者评估预览版本和迁移风险。

11月11日周二
  1. PortSwigger Research72

    PortSwigger 发布 HTTP Anomaly Rank 并集成至 Turbo Intruder

    PortSwigger 发布 HTTP Anomaly Rank,可按响应属性稳定性和独特性计算异常分数,并自动将最异常的结果排在 Turbo Intruder 结果表顶部。该算法已集成到 Turbo Intruder,Burp Suite API 的 2025.10 版本也提供支持;其计算复杂度为 O(N),适合筛选大规模结果集。

    推荐理由:介绍 HTTP Anomaly Rank 的排序机制与集成方式,并说明其对大规模响应筛选、异常发现及 AI 功能开发的实际价值。

7月15日周二
  1. PortSwigger Research65

    PortSwigger Research 推出实验性 AI 扩展 Repeater Strike

    PortSwigger Research 推出实验性 Burp Suite 扩展 Repeater Strike,用 AI 分析 Repeater 流量并生成规则,辅助发现 IDOR 等漏洞。扩展会复现漏洞、变更探测值与响应正则,再扫描代理历史;目前对大型响应、输出稳定性和跨站点泛化仍存在挑战,且仅适用于 Early Adopter 渠道。

    推荐理由:展示了如何将漏洞复现、探测值与响应正则生成规则并回扫代理历史,适合评估 AI 辅助安全测试的可行性与当前限制。

4月23日周三
  1. PortSwigger Research64

    PortSwigger 开源 Burp 扩展 Document My Pentest,用 AI 生成渗透测试记录

    PortSwigger Research 推出开源 Burp 扩展 Document My Pentest,可在渗透测试期间实时观察请求并自动生成结构化记录。测试者可从 Repeater 或 Proxy History 调用扩展生成 AI 笔记,也可将多个请求与响应合并记录并手动修正。

    推荐理由:将渗透测试过程转为结构化记录,并公开误判成因与安装用法,对安全测试者建立可审阅记录和优化提示词有直接参考价值。

2月20日周四
  1. PortSwigger Research64

    PortSwigger发布Shadow Repeater,以AI增强Burp Suite手动测试

    PortSwigger发布Shadow Repeater,通过监控Burp Repeater请求、生成参数变体并比较响应,自动发现可能遗漏的漏洞。该扩展无需改变常规手动测试流程,可从BApp Store获取,源码已在GitHub提供,目前面向Burp Suite Professional Early Adopter发布渠道。

    推荐理由:将AI变体生成与响应差异分析接入Repeater,可帮助安全测试人员发现因语法、编码或路径细微偏差遗漏的漏洞,并支持源码审查与扩展开发。

2月18日周二
  1. Elastic Blog40

    IT领导者分享AI采用旅程中的七项经验

    三位早期采用AI的IT高管分享了组织推进AI应用的七项经验,包括从高价值问题切入、鼓励试验、使用高质量专有数据、量化成效,并通过架构审查避免AI sprawl和技术债务。Comcast、Adobe和Elastic的高管还强调,应持续监测AI系统的业务影响、用户满意度与输出准确性。

10月16日周三
  1. Mozilla Hacks65

    Llamafile v0.8.14 发布:新界面、性能提升及更多支持

    Mozilla Builders 项目 Llamafile 发布 0.8.14,默认启用新的终端聊天界面,并继续推进更快的 OpenAI 兼容 API 服务 Llamafiler。

    推荐理由:新版本同时更新默认聊天界面、推进兼容 API 服务并显著改善多类硬件上的提示评估速度,还扩展模型与语音转文字支持,便于评估本地 AI 工具更新。

9月4日周三
  1. Elastic Blog59

    Elastic 发布 Support Assistant 智能客服助手

    Elastic 宣布 Support Assistant 已在 Support Hub 正式推出,面向所有拥有支持账户的客户和试用用户。该助手采用生成式 AI 与检索增强架构,依据 Elastic 博客、产品文档、知识库等回答问题;不访问部署健康信息或用户数据,但官方提醒核验回答准确性并谨慎处理敏感信息。

8月9日周五
6月25日周二
6月1日周六
  1. Mozilla Hacks73

    Mozilla 在 Firefox Nightly 试验本地生成图片替代文本

    Mozilla 正在 Firefox Nightly 内置 PDF 编辑器中试验用完全本地的端侧 AI 模型自动生成图片替代文本,推理引擎已作为新的 ml 组件合入。

    推荐理由:文章披露Firefox本地图像转文本实验的模型、推理架构、缓存与训练代码,并明确当前范围和后续计划,对无障碍技术研究与浏览器端侧AI实现有参考价值。

4月25日周四
  1. Mozilla Hacks76

    llamafile 发布 v0.8,强化本地大模型运行性能

    Mozilla 发布 llamafile v0.8,支持更多开放模型,并通过 tinyBLAS 为 NVIDIA 和 AMD GPU 加速本地推理。该版本新增 84 个矩阵乘法内核,使提示词评估性能较此前提升 10 倍;项目还优化了 Raspberry Pi 5,并支持单条命令生成 llamafile。

    推荐理由:v0.8 聚焦本地模型运行体验,tinyBLAS 简化 NVIDIA 与 AMD GPU 加速,84 个矩阵乘法内核将提示词评估性能提升 10 倍,并同步支持新模型。

6月29日周四
  1. Elastic Blog30

    Elastic Security 如何为组织创造价值

    Elastic Security被超过50%的《财富》500强公司使用,并通过检测、调查与响应能力提升安全团队效率、降低TCO。Elastic CISO Mandy Andress称,团队用一款产品和一份许可在3个月内部署完成,而此前重建SOC耗费3款工具、24个月及数百万美元许可与服务费用;目前每日处理200 TB数据,并借助跨集群搜索在近30秒内检索多PB数据。