编码代理的六个核心组件
Sebastian Raschka 介绍编码代理及编码 harness 的整体设计,涵盖实时仓库上下文、提示词缓存复用、结构化工具、上下文压缩、会话记忆和受限子代理六类组件。文章以纯 Python 从头实现的 Mini Coding Agent 提供代码示例,说明模型、代理循环与运行时支持如何协作,并讨论 Claude Code、Codex CLI 与 OpenClaw 的定位差异。
Sebastian Raschka 介绍编码代理及编码 harness 的整体设计,涵盖实时仓库上下文、提示词缓存复用、结构化工具、上下文压缩、会话记忆和受限子代理六类组件。文章以纯 Python 从头实现的 Mini Coding Agent 提供代码示例,说明模型、代理循环与运行时支持如何协作,并讨论 Claude Code、Codex CLI 与 OpenClaw 的定位差异。
Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。
推荐理由:提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。
Google Research研究了在固定预算下,评测条目数量与每个条目评分者数量如何影响AI评测的可复现性。研究发现,常用的每条1、3或5名评分者往往不足,可靠理解人类细微差异通常需要每条超过10名评分者;具体取舍取决于目标是多数投票还是完整意见分布。按指标优化后,约1,000次总标注可获得较高可复现性,但配置不当即使增加预算也可能导致不可靠结论;相关模拟器已在GitHub开源。
推荐理由:研究以真实主观任务数据集和模拟器检验条目数、每条评分人数及评价指标的关系,为预算有限的小团队设计更可复现的AI评测方案提供依据。
Google发布白皮书,更新了未来量子计算机破解保护加密货币的256位椭圆曲线离散对数问题(ECDLP-256)所需资源估算,称其可能在少于1,200个逻辑量子比特和9,000万次Toffoli门,或少于1,450个逻辑量子比特和7,000万次Toffoli门的电路上实现。Google建议区块链逐步迁移至抗量子攻击的后量子密码学(PQC),并采用零知识证明验证漏洞估算,以避免公开敏感攻击细节。
推荐理由:白皮书给出了可验证的量子资源估算,并用零知识证明支持负责任披露;其迁移至后量子密码学的建议可为区块链安全规划提供决策依据。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与网页端 XR Blocks 框架结合,可将自然语言直接生成具备物理感知的 Android XR 应用,生成时间低于 60 秒。
推荐理由:将自然语言直接生成具备物理感知的 Android XR 应用,并公开早期评测与开源框架,便于开发者评估快速原型的可靠性和适用边界。
Google Research提出TurboQuant向量量化压缩方法,并介绍其使用的PolarQuant与QJL,分别处理极坐标量化和1比特残差误差。文中称,该方法无需训练或微调即可将KV cache量化至3比特,在长上下文测试中保持模型准确性,并减少至少6倍的键值内存。
推荐理由:文章给出算法机制、理论依据和多类基准结果,并明确量化精度、内存与速度指标,适合评估长上下文和向量搜索压缩方案。
Google Research开发了S2Vec,一种通过S2 Geometry划分和要素栅格化学习建成环境通用嵌入的自监督框架。模型使用掩码自编码,在美国人口密度和收入等社会经济指标的零样本地理适应任务中通常表现最佳,但单独处理树冠覆盖和高程等环境任务仍需改进;与卫星图像嵌入融合通常可提升效果。
Sebastian Raschka 以图解和开源权重模型实例,系统比较 MHA、GQA、MLA、SWA、DSA、门控注意力与混合注意力。文章重点分析各方案对 KV 缓存、长上下文计算、检索能力和实现复杂度的不同影响,并梳理 Qwen3-Next、Kimi Linear、Ling 2.5 与 Nemotron 等架构的组合方式。文中同时整理了包含 45 个条目的 LLM 架构图库,并提供海报版本。
Google Research 在 The Check Up 活动概述其医疗 AI 研究,覆盖个性化健康、临床协作、开发者生态、公共卫生和生物医学研究。文中称,乳腺癌检测系统识别出 25% 此前漏诊的 interval cancers,HAI-DEF 则提供免费开放权重模型 MedGemma;MedGemma Impact Challenge 已收到 850 多份投稿。
推荐理由:集中梳理医疗多模态模型、临床筛查、开发者工具与公共卫生研究,便于了解各项目的当前结果、测试阶段及合作方向。
Google Research与多家NHS机构开展AIMS研究,评估AI乳腺癌检测系统在单次阅片及双人阅片仲裁流程中的表现。研究显示,AI单独阅片的癌症检出率由每千人7.54例升至9.33例,并发现原流程漏检的25%间期癌;AI辅助工作流在敏感度和特异度上不劣于传统流程,但研究仍需进一步验证前瞻性临床有效性。
推荐理由:提供NHS真实工作流中的研究数据与部署观察,能帮助医疗团队评估AI阅片系统的检测表现、流程可行性及数据漂移问题。
Google Research与Cornell University评估六种LLM回答高温超导专家问题的能力,NotebookLM和基于同一资料库构建的自定义RAG系统总体表现最佳。研究测试访问于2024年12月,使用67个问题、1,726份实验论文和综述文章,发现依赖开放网络资料的模型更容易混淆成熟理论与推测,并暴露出时间、上下文及图像理解方面的不足。
推荐理由:该研究以高温超导问题比较六种LLM,并用专家盲评检验准确性、全面性与证据支持,为科学领域构建可信AI工具提供方法和评估参考。
Google Research 宣布在 Flood Hub 推出 Urban Flash Flood forecasts,利用 Groundsource、AI 模型和实时天气预报,预测城市山洪未来24小时的风险。
推荐理由:文章披露模型的数据构建、时空分辨率、适用范围与评估方法,并说明部分非洲地区仍缺少地面真值,便于判断试点成果及其验证局限。
Google Research发布Groundsource,利用Gemini从非结构化全球新闻中提取山洪事件的时间、地点和影响信息。团队公开了覆盖150多个国家、包含260万条历史记录的数据集;人工审核显示,82%的提取事件足以用于实际分析。基于该数据集,Google已能在Google Flood Hub推出近全球城市山洪提前24小时预报。
推荐理由:Groundsource将全球新闻转化为结构化历史灾害数据,并公开提供260万条山洪记录;其时空精度、覆盖率与Google Flood Hub预测部署,为灾害建模和预警研究提供了可评估的数据基础。
Google Research与Beth Israel Deaconess Medical Center开展AMIE对话式诊断AI单中心前瞻性可行性研究,100名成人患者完成诊前交互,98人按预约就诊。
推荐理由:这项单中心前瞻性可行性研究提供了真实基层医疗流程中的安全、诊断表现和医患体验证据,同时明确指出缺乏对照比较等限制,适合用于判断后续临床验证的研究设计。
Sebastian Raschka 梳理了 2026 年 1—2 月发布的十款开放权重 LLM,重点比较其架构相似性与差异。
Elastic{ON} London 将于2026年2月26日在伦敦 Convenes Sancroft 举行,聚焦从被动式 AI 转向可自主执行任务的 agentic AI,并探讨其在搜索、可观测性和安全中的应用。
Go 1.26 发布了完全重写的 go fix 子命令,可通过分析器识别并应用更现代的 Go 语言和库写法。文章介绍运行 go fix、预览差异、选择分析器、跨平台构建配置、重复运行至固定点,以及 Go analysis framework 和 self-service 现代化的基础设施。
推荐理由:文章系统讲解 Go 1.26 重写后的 go fix 用法、modernizer、冲突处理与分析框架,并展示如何借助 go fix 批量现代化 Go 代码。
Sebastian Raschka 将推理时扩展方法归为 Chain-of-Thought Prompting、Self-Consistency、Best-of-N Ranking、带验证器的拒绝采样和路径搜索等类别,并讨论它们的组合。该文聚焦不改变模型权重的推理阶段计算;作者表示,相关实验将基础模型准确率从约 15% 提升至约 52%。
Python 3.15.0a5 是 Python 3.15 的第五个 alpha 预览版本,因 3.15.0a4 误用旧版 main 构建而额外发布,并正确基于 2026-01-14 的 main 构建。当前变更包括 PEP 799 采样分析器、PEP 686 默认 UTF-8、PEP 782 PyBytesWriter C API,以及 JIT 和错误消息改进;官方不建议将其用于生产环境。
推荐理由:明确说明 alpha 5 的修正原因与测试定位,并列出 PEP、性能变化及后续时间表,便于开发者评估预览版本和迁移风险。
Sebastian Raschka 回顾了 2025 年大语言模型在推理模型、RLVR 与 GRPO、架构效率、工具使用和评测方面的发展,并指出基准测试难以充分代表真实能力。文章还分析了这些技术对编码、技术写作、研究和个人生产力的影响。作者据此预测未来将进一步扩展 RLVR、推理时扩展和本地工具使用,但这些内容属于趋势判断。
Sebastian Raschka整理了2025年7月至12月期间收集并分类的LLM研究论文清单,涵盖推理模型、强化学习、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态及数据集等主题。他表示主要浏览了论文摘要,仅阅读了其中很小一部分,并将清单与同日发布的《State of LLMs 2025》分开整理。
DeepSeek V3.2 延续 V3.2-Exp 的架构,通过 DeepSeek Sparse Attention 引入非标准稀疏注意力,以降低长上下文场景中的训练与推理开销。模型还引入 DeepSeekMath V2 的自验证与自我改进机制,并更新 GRPO 及奖励设计,在可验证任务中采用 RLVR,在通用任务中使用生成式奖励模型。
PortSwigger 发布 HTTP Anomaly Rank,可按响应属性稳定性和独特性计算异常分数,并自动将最异常的结果排在 Turbo Intruder 结果表顶部。该算法已集成到 Turbo Intruder,Burp Suite API 的 2025.10 版本也提供支持;其计算复杂度为 O(N),适合筛选大规模结果集。
推荐理由:介绍 HTTP Anomaly Rank 的排序机制与集成方式,并说明其对大规模响应筛选、异常发现及 AI 功能开发的实际价值。
Sebastian Raschka 对标准自回归 Transformer 之外的 LLM 架构进行概览,涵盖线性注意力混合模型、文本扩散模型、代码世界模型和小型递归 Transformer。文中比较了它们在长上下文效率、并行生成、代码状态建模和结构化推理方面的特点,同时指出准确率、工具调用、训练复杂度与适用范围等取舍。
Sebastian Raschka系统介绍了LLM评估的四种主要方法:多项选择、验证器、排行榜和LLM评委,并提供从零实现的代码示例。文章涵盖MMLU评分、Elo排行榜以及使用Ollama调用gpt-oss:20b进行评分的方法,同时分析各方案在成本、可复现性、正确性和实际效用方面的取舍。
Sebastian Raschka 使用纯 PyTorch 讲解并实现 Qwen3 的 Dense 与 Mixture-of-Experts 架构,帮助读者理解模型内部构建模块并将其改用于实验或项目。文章还介绍了 Qwen3 的模型规模、Apache License v2.0 许可及不同变体,其中 1T 参数“max”变体在文中注明当时为闭源。
OpenAI本周发布gpt-oss-20b和gpt-oss-120b,这是其自GPT-2以来首次共享大型开放权重模型,架构分析涵盖MoE、GQA、滑动窗口注意力、RMSNorm和注意力偏置等变化。文章还比较了gpt-oss与Qwen3在模型深度、宽度、专家数量及MXFP4量化部署方面的差异,并指出gpt-oss-20b可借助MXFP4在支持该格式的消费级GPU上运行。
PortSwigger Research 推出实验性 Burp Suite 扩展 Repeater Strike,用 AI 分析 Repeater 流量并生成规则,辅助发现 IDOR 等漏洞。扩展会复现漏洞、变更探测值与响应正则,再扫描代理历史;目前对大型响应、输出稳定性和跨站点泛化仍存在挑战,且仅适用于 Early Adopter 渠道。
推荐理由:展示了如何将漏洞复现、探测值与响应正则生成规则并回扫代理历史,适合评估 AI 辅助安全测试的可行性与当前限制。
PortSwigger Research 推出开源 Burp 扩展 Document My Pentest,可在渗透测试期间实时观察请求并自动生成结构化记录。测试者可从 Repeater 或 Proxy History 调用扩展生成 AI 笔记,也可将多个请求与响应合并记录并手动修正。
推荐理由:将渗透测试过程转为结构化记录,并公开误判成因与安装用法,对安全测试者建立可审阅记录和优化提示词有直接参考价值。
PortSwigger发布Shadow Repeater,通过监控Burp Repeater请求、生成参数变体并比较响应,自动发现可能遗漏的漏洞。该扩展无需改变常规手动测试流程,可从BApp Store获取,源码已在GitHub提供,目前面向Burp Suite Professional Early Adopter发布渠道。
推荐理由:将AI变体生成与响应差异分析接入Repeater,可帮助安全测试人员发现因语法、编码或路径细微偏差遗漏的漏洞,并支持源码审查与扩展开发。
三位早期采用AI的IT高管分享了组织推进AI应用的七项经验,包括从高价值问题切入、鼓励试验、使用高质量专有数据、量化成效,并通过架构审查避免AI sprawl和技术债务。Comcast、Adobe和Elastic的高管还强调,应持续监测AI系统的业务影响、用户满意度与输出准确性。
Mozilla Builders 项目 Llamafile 发布 0.8.14,默认启用新的终端聊天界面,并继续推进更快的 OpenAI 兼容 API 服务 Llamafiler。
推荐理由:新版本同时更新默认聊天界面、推进兼容 API 服务并显著改善多类硬件上的提示评估速度,还扩展模型与语音转文字支持,便于评估本地 AI 工具更新。
Elastic 宣布 Support Assistant 已在 Support Hub 正式推出,面向所有拥有支持账户的客户和试用用户。该助手采用生成式 AI 与检索增强架构,依据 Elastic 博客、产品文档、知识库等回答问题;不访问部署健康信息或用户数据,但官方提醒核验回答准确性并谨慎处理敏感信息。
0Din是一项面向GenAI系统的漏洞赏金计划,参与者可提交安全缺陷报告,团队将审核漏洞并按严重程度和影响发放奖励。覆盖范围包括绕过安全措施的越狱、Prompt Injection和训练数据泄露,政策要求私下报告且不得利用漏洞。
Mozilla Builders 将 sqlite-vec 纳入项目并支持其开发,该项目由独立开发者 Alex Garcia 主导,旨在为 SQLite 嵌入式数据库加入向量搜索功能。此举面向本地运行的 AI 应用,可支持检索增强生成(RAG)和语义搜索等用途,并减少数据离开设备的需求。
Mozilla 正在 Firefox Nightly 内置 PDF 编辑器中试验用完全本地的端侧 AI 模型自动生成图片替代文本,推理引擎已作为新的 ml 组件合入。
推荐理由:文章披露Firefox本地图像转文本实验的模型、推理架构、缓存与训练代码,并明确当前范围和后续计划,对无障碍技术研究与浏览器端侧AI实现有参考价值。
Mozilla 发布 llamafile v0.8,支持更多开放模型,并通过 tinyBLAS 为 NVIDIA 和 AMD GPU 加速本地推理。该版本新增 84 个矩阵乘法内核,使提示词评估性能较此前提升 10 倍;项目还优化了 Raspberry Pi 5,并支持单条命令生成 llamafile。
推荐理由:v0.8 聚焦本地模型运行体验,tinyBLAS 简化 NVIDIA 与 AMD GPU 加速,84 个矩阵乘法内核将提示词评估性能提升 10 倍,并同步支持新模型。
Elastic Security被超过50%的《财富》500强公司使用,并通过检测、调查与响应能力提升安全团队效率、降低TCO。Elastic CISO Mandy Andress称,团队用一款产品和一份许可在3个月内部署完成,而此前重建SOC耗费3款工具、24个月及数百万美元许可与服务费用;目前每日处理200 TB数据,并借助跨集群搜索在近30秒内检索多PB数据。