跳到正文

#评测与选型

今日 2 条
今天10月3日周六
9月25日周五
9月21日周一
  1. Microsoft 开发者博客68

    知识截止日期难以代表模型的产品能力

    Waldek Mastykarz 通过 GPT-5.6 Luna、GitHub Copilot SDK 和 Vally 测试 Dev Proxy 与 SharePoint Framework,发现模型能否解决产品任务与知识截止日期之间没有清晰对应关系。

    推荐理由:文章以受控实验说明知识截止日期无法代表模型对具体产品的实际能力,并提出用真实工作负载评估模型,再验证文档或代理扩展的效果。

7月16日周四
  1. Hugging Face Blog43

    DharmaOCR:新模型涌现,巴西葡萄牙语OCR专门化优势仍存

    DharmaOCR在巴西葡萄牙语OCR基准测试中取得0.925分,高于Mistral OCR4的0.798分和Unlimited-OCR的0.7587分,显示出专门化带来的显著优势。其训练先通过监督微调适配葡萄牙语词汇、语法和文档结构,再以Direct Preference Optimization抑制重复或不连贯输出,降低推理时间和成本并提升生产环境稳定性。

7月1日周三
  1. Hugging Face Blog73

    ScarfBench:评测企业Java框架迁移AI智能体

    IBM Research推出开源基准ScarfBench,用于评测AI智能体在Enterprise Java跨框架迁移中的构建、部署和行为保持能力。基准包含34个应用、102个框架实现和204项迁移任务;测试显示当前最强智能体的行为成功率低于10%,且智能体自报成功不能替代独立构建与测试验证。

    推荐理由:ScarfBench将企业Java跨框架迁移从代码生成推进到构建、部署和行为验证,揭示智能体成功率、过度自信及依赖管理之间的差距,对评估现代化方案具有直接参考价值。

5月16日周六
  1. Sebastian Raschka74

    近期LLM架构发展:KV共享、mHC与压缩注意力

    近期开源权重LLM架构普遍通过KV共享、逐层注意力预算、压缩注意力和残差流优化来降低长上下文成本。文章分析Gemma 4的跨层KV共享与逐层嵌入、Laguna XS.2的逐层注意力头预算、ZAYA1-8B的压缩卷积注意力,以及DeepSeek V4的mHC与CSA/HCA,并指出这些设计会增加实现复杂度。

2月25日周三
12月30日周二
  1. Sebastian Raschka65

    Sebastian Raschka 回顾 2025 年大语言模型进展、问题与趋势

    Sebastian Raschka 回顾了 2025 年大语言模型在推理模型、RLVR 与 GRPO、架构效率、工具使用和评测方面的发展,并指出基准测试难以充分代表真实能力。文章还分析了这些技术对编码、技术写作、研究和个人生产力的影响。作者据此预测未来将进一步扩展 RLVR、推理时扩展和本地工具使用,但这些内容属于趋势判断。