联网汽车被指成为持续监控平台
东北大学与Consumer Reports的调查显示,现代联网汽车会将数据发送给外部公司,涉及保险、贷款、数据经纪商、车载联网产品商及地方政府机构。研究者发现,几乎所有汽车制造商都曾向外部公司发送数据,近四分之一车载应用传出姓名、VIN和精确地理位置等可识别信息,相关画像还可能流入银行、保险公司、制药公司、贷款机构和零售商。
东北大学与Consumer Reports的调查显示,现代联网汽车会将数据发送给外部公司,涉及保险、贷款、数据经纪商、车载联网产品商及地方政府机构。研究者发现,几乎所有汽车制造商都曾向外部公司发送数据,近四分之一车载应用传出姓名、VIN和精确地理位置等可识别信息,相关画像还可能流入银行、保险公司、制药公司、贷款机构和零售商。
研究团队与同事 Csilla Zsigri、Adrienn Lawson 在 OpenSearch 五周年之际审视全球数据基础设施,探讨这一开源项目的发展及其与企业人工智能快速普及的关系。团队还与 Bianca Lewis 和 OpenSearch Software Foundation 领导团队合作,以回应社区的关键战略问题。
光污染正在显著提高夜空亮度:一项报告显示,2011年至2022年平均夜空亮度每年增加9.6%,约每八年翻倍。另一项研究指出,五分之四的人口生活在受光污染影响的天空下;地面照明限制措施无法解决卫星反光造成的空间光污染。
美国第三巡回上诉法院裁定,Ross Intelligence 使用 Thomson Reuters 的 Westlaw headnotes 训练与 Westlaw 竞争的法律研究系统,不构成合理使用。法院认定这些编辑摘要具备最低限度独创性,且 Ross 的商业用途与 Westlaw 高度相近,可能损害其服务价值及摘要授权市场;该裁决并非适用于所有 AI 训练争议的普遍规则。
Truffle Security 在扫描2.24亿个仓库和超过580亿个文件后确认,公开 GitHub 仓库中有543,699个重复出现且在分析时仍有效的独特凭据。
英国网络安全行业自我认定为女性的工作人员占比降至16%,为2021年以来最低;具有6年以上经验的高层女性占比仅12%。政府访谈显示,结构性排斥及对女性生育和技能的偏见仍阻碍其晋升,禁用残障人士占全部岗位9%、高层岗位5%。
Ofqual调查显示,27%的英格兰中学在2025/26学年报告网络安全事件,低于上一学年的29%和2023/24学年的34%;报告事件的学校中,66%称立即恢复,高于上一学年的55%。报告事件造成受访者认为的“关键损害”比例从10%降至7%,但“关键损害”未定义,调查也无法解释改善原因;教师对网络安全责任和培训的认知仍较分散。
Elastic委托Forrester Consulting开展Total Economic Impact™研究,基于企业访谈构建年收入100亿美元、服务2500万客户的复合企业。研究显示,采用Elastic Observability后,第三年系统停机时间最多减少75%,SRE监控与事件解决时间减少95%,可观测性基础设施成本降低70%。
Workera 2026年调查显示,67.8%的员工每周至少几天使用ChatGPT之外的AI工具,高于上年的39.9%。但56.4%的员工没有工作时间用于技能提升,42.5%缺少相关学习材料;调查还指出,持续技能测量可能帮助组织推进AI培训。
Cisco Talos调查称,2026年1月至7月日本有90家组织受到勒索软件影响,较上年同期增加约4.7%,The Gentlemen活动最频繁。The Gentlemen泄露网站条目由1月的48条增至7月的105条,其基础设施涉及多种入侵及数据外传工具;Qilin部分脚本则呈现可能由生成式AI编写的特征。
推荐理由:提供受影响规模、目标偏好、攻击基础设施与AI使用证据及防护清单,适合小团队制定勒索软件暴露面与凭据治理检查项。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线强化学习生成与集合属性对齐的查询扩展,并将其蒸馏到 53.9M 参数的扩散检索器中。框架在实验中让检索器单次并行生成目标集合,相对自回归方法实现 12 至 20 倍推理加速。
Google发布AI & Economy ATLAS新的交互式开放数据体验,并公布与Google DeepMind、MIT FutureTech合作开展的科学研究。
推荐理由:新增交互式开放数据体验,便于按职业、地区和家庭场景探索ATLAS数据;研究还量化科学家使用AI的频率、模型类型与时间收益,为评估生产率影响和流程瓶颈提供依据。
Google Research在ACL 2026提出ToolGrad,通过API Proposer、API Executors、API Selector和LLM Updater迭代生成工具调用链、用户查询与AI回复。
推荐理由:提出先生成工具调用链、再反推用户提示的答案优先方法,并用多模块迭代降低数据生成成本,对构建训练数字代理的高质量工具使用数据具有直接参考价值。
一项研究评估将 UK Biobank 欧洲人群 GWAS 数据迁移到 Biobank Japan 日本人群、用于八种临床性状 PRS 预测的效果。研究发现,BBJ 样本量低于15,000时合并欧洲数据可提升预测,但样本量增加后外部数据可能降低准确性;PRS-CSx 需要更大目标人群样本,而跨群体 meta-analysis 对 HDL、LDL 等性状更有帮助。
推荐理由:文章通过系统性样本量消融和多种PRS方法比较,揭示跨群体训练数据并非越多越好,并指出样本规模、性状遗传相关性和方法选择之间的关系,为日本等 underrepresented populations 的基因组风险预测建模提供实证参考。
Google Research、HHMI Janelia及剑桥大学等地合作者完成了雄性果蝇脑与中枢神经系统的完整连接图,包含超过166,000个神经元和1.25亿个突触连接。该图已通过人工专家标注与校验,可通过开源工具Neuroglancer查看、探索和下载,研究团队称其为迄今按神经元数量计最大的脑图谱。
推荐理由:完整雄性果蝇脑与中枢神经连接组具有重要科研价值,公开数据与验证流程可为神经科学研究提供可复用的基础资源。
Google Research 构建了 GlucoFM,一种分离较慢血糖趋势与短期波动的双流自监督基础模型。该模型使用 109,066 小时无标签 CGM 数据预训练,并在四个队列、七项临床预测任务及餐后血糖反应预测中进行了评估。
Home Assistant 宣布首份用户调查的匿名结果现已免费公开。组织于2024年12月启动调查,希望直接听取社区反馈,使项目更包容、易于使用;原文称数据不包含可识别信息,并计划用于改进相关工作。
Google Research介绍多代理系统 Biomarker Discovery Framework,用于在人工监督下优先筛选可穿戴传感器数据中的候选生物标志物。该框架结合假设生成、统计分析、模型训练、对抗验证和文献推理,在三个队列共9,279次参与者观察中识别出心理健康和代谢领域的候选关联,但研究明确这些结果不等同于临床验证或因果结论。
推荐理由:该框架将统计计算、生成式推理与对抗验证结合,覆盖数据泄漏、过拟合和混杂因素等问题;其多队列结果与专家盲评为可穿戴生物标志物研究提供了可复用的工作流参考。
Google Research提出Mobility-Embedded POIs(ME-POIs),将文本描述与公共基准数据中的聚合、匿名化移动模式结合,用于表示地点随时间变化的活跃节奏。该框架在洛杉矶和休斯敦的未见地点测试中,访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。研究强调其面向地点和商业聚合理解,不用于个人用户分析或个性化。
推荐理由:ME-POIs把匿名化、聚合的移动模式引入地点表示,报告了未见地点预测任务的量化提升,适合关注时空表示学习与地点属性预测的团队参考。
Google Research提出知识画像框架与WikiProfile基准,用2,150条Wikipedia事实分析13个LLM的编码、召回和识别能力。实验显示,Gemini-3-Pro和GPT-5虽有95–98%的事实完成编码,却仍无法直接召回26–34%的已编码事实;思考可恢复约40–65%的此类事实。研究认为,事实性瓶颈正从知识获取转向知识利用。
推荐理由:文章用知识画像区分事实的编码、召回与识别,并以13个LLM的大规模实验说明前沿模型的瓶颈更多在知识调用,适合评估改进方向。
Google Research 与 Google DeepMind 开展了包含 13,917 名参与者的随机研究,比较五种 Gemini Flash 2.0 SymptomAI 对话代理的鉴别诊断表现。
推荐理由:大规模随机研究与临床专家标注结合可穿戴设备信号,展示了对话式症状评估的研究价值,同时明确其为研究用途,不能替代正式临床诊断。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音系统在真实交互中识别、生成和回应声学信息的能力。基准评估超过40个专有及开源语音模型,覆盖15个以上维度、60多个指标,并基于超过100万次人工评分开发;当前包含785,000次 TTS 评分和48,000次 STS 评分。
Google Research 提出 SensorFM,以超过一万亿分钟、来自500万名参与者的多模态传感器数据进行预训练,学习可跨多类健康任务复用的生理表征。
推荐理由:该研究给出大规模无标签传感器预训练、缺失数据处理及跨健康任务评估的完整结果,对可穿戴健康模型的统一表征与低成本适配具有参考价值。
Google Research在《Nature Cities》发表研究,利用导航平台协调少量出行路线,在10个美国城市改善交通状况。研究采用为期六个月的全市交叉实验;目标路段的驾驶速度中位数提高约2%,燃油消耗率中位数下降0.5%至1.0%,受影响路段整体速度中位数提高约0.35%。
推荐理由:研究以10个美国城市开展真实世界对照实验,展示了少量导航改道如何改善全市交通,具备交通治理和方法验证价值。
Google Research提出Regularized f-Divergence Kernel Tests,用于通过相对分布距离审计机器遗忘和差分隐私。该框架在AISTATS 2026展示,实验称其能以更少样本捕捉细微隐私违规,并避免传统双样本检验将安全重训模型误判为遗忘失败。
推荐理由:提出面向机器遗忘与差分隐私审计的相对分布检验框架,并用理论与实验说明其在降低误报、捕捉细微隐私违规和适配不同数据偏移方面的价值。
Google DeepMind公布Sierra Leone预注册试验结果:使用Guided Learning的学生数学成绩较对照组提高0.258个标准差,113,000多次互动中91.4%用于建立概念理解。教师主导课程、目标12小时时增益更高,团队还发布教师培训指南和RCT方法手册,并计划在其他国家开展试验。
推荐理由:预注册试验提供了AI辅助数学学习的效果与互动数据,并强调教师主导设计,有助于小团队评估课堂应用价值;同时指出收益分布不均和跨国证据仍需验证。
Stanford 团队测试了 Co-Scientist 提出的三种药物及研究人员自选两种药物,用于寻找可治疗肝纤维化的现有药物。在活人肝细胞实验模型中,Co-Scientist 提出的 vorinostat 阻断了 91% 的损伤响应,另有两种候选物也阻止纤维化并促进肝细胞再生。
这份分析梳理了用户体验投资回报率的十大数据支撑事实,说明设计、研究与分析如何影响业务表现。数据显示,设计阶段修复问题的成本最高可低至上线后修复的1/100;页面加载增加1秒,转化率和满意度可能分别下降20%和16%;合理运用留白可使内容理解力最高提升20%。
Google Research介绍ERA在流行病预测、宇宙学、CO₂监测和神经回路研究中的四类应用。团队将其用于每周提交流感、COVID-19和RSV住院预测,结合Gemini Deep Think推导宇宙弦辐射相关公式,并基于GOES East观测估算CO₂。ERA还根据simZFish结构信息提出可通过新视觉刺激测试的神经回路方案。
推荐理由:四个跨领域案例展示了ERA从基准研究走向实际任务的过程,并提供预测、数学推导、卫星观测建模与神经机制发现等方法的参考价值。
Google Research 推出推理优先、无需种子数据的合成数据集框架 Simula,通过全局多样化、局部分化、复杂化和双批评质量检查控制生成过程。Simula 在五个领域生成的最多 512K 条数据实验中,完整系统持续优于较简单的基线,但高复杂度数据仅在 GSM8k 数学推理中带来 10% 的准确率提升,在法律推理任务 LEXam 中反而降低表现,说明数据配置需适配使用模型的能力。
推荐理由:将合成数据生成拆解为可控机制,并提供跨领域实验结果,有助于团队评估数据质量、复杂度与模型适配之间的关系。
Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。
推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。
Google Research提出TurboQuant向量量化压缩方法,并介绍其使用的PolarQuant与QJL,分别处理极坐标量化和1比特残差误差。文中称,该方法无需训练或微调即可将KV cache量化至3比特,在长上下文测试中保持模型准确性,并减少至少6倍的键值内存。
推荐理由:文章给出算法机制、理论依据和多类基准结果,并明确量化精度、内存与速度指标,适合评估长上下文和向量搜索压缩方案。
Google Research开发了S2Vec,一种通过S2 Geometry划分和要素栅格化学习建成环境通用嵌入的自监督框架。模型使用掩码自编码,在美国人口密度和收入等社会经济指标的零样本地理适应任务中通常表现最佳,但单独处理树冠覆盖和高程等环境任务仍需改进;与卫星图像嵌入融合通常可提升效果。
Google Research与多家NHS机构开展AIMS研究,评估AI乳腺癌检测系统在单次阅片及双人阅片仲裁流程中的表现。研究显示,AI单独阅片的癌症检出率由每千人7.54例升至9.33例,并发现原流程漏检的25%间期癌;AI辅助工作流在敏感度和特异度上不劣于传统流程,但研究仍需进一步验证前瞻性临床有效性。
推荐理由:提供NHS真实工作流中的研究数据与部署观察,能帮助医疗团队评估AI阅片系统的检测表现、流程可行性及数据漂移问题。
Google Research与Cornell University评估六种LLM回答高温超导专家问题的能力,NotebookLM和基于同一资料库构建的自定义RAG系统总体表现最佳。研究测试访问于2024年12月,使用67个问题、1,726份实验论文和综述文章,发现依赖开放网络资料的模型更容易混淆成熟理论与推测,并暴露出时间、上下文及图像理解方面的不足。
推荐理由:该研究以高温超导问题比较六种LLM,并用专家盲评检验准确性、全面性与证据支持,为科学领域构建可信AI工具提供方法和评估参考。
Google Research与Beth Israel Deaconess Medical Center开展AMIE对话式诊断AI单中心前瞻性可行性研究,100名成人患者完成诊前交互,98人按预约就诊。
推荐理由:这项单中心前瞻性可行性研究提供了真实基层医疗流程中的安全、诊断表现和医患体验证据,同时明确指出缺乏对照比较等限制,适合用于判断后续临床验证的研究设计。