跳到正文

#评测与选型

今日 0 条
10月2日周五
10月1日周四
9月28日周一
9月22日周二
9月21日周一
  1. Microsoft 开发者博客68

    知识截止日期难以代表模型的产品能力

    Waldek Mastykarz 通过 GPT-5.6 Luna、GitHub Copilot SDK 和 Vally 测试 Dev Proxy 与 SharePoint Framework,发现模型能否解决产品任务与知识截止日期之间没有清晰对应关系。

    推荐理由:文章以受控实验说明知识截止日期无法代表模型对具体产品的实际能力,并提出用真实工作负载评估模型,再验证文档或代理扩展的效果。

9月17日周四
9月16日周三
  1. GitLab Blog39

    SAST 与 LLM 安全扫描器应如何配合使用

    SAST 适合作为每次提交的基线扫描,可固定、可复现地检测注入、硬编码密钥等问题;LLM 安全扫描器则适合在合并请求级别结合上下文分析业务逻辑,并通过生成测试验证漏洞。企业若让 LLM 扫描每次提交,成本更高且结果更难预测,GitLab Advanced SAST 与 Security Review Flow 可在同一流水线中协同运行。

9月12日周六
  1. Tailscale Blog55

    路由器与 NAS 内置 VPN 的可靠性、性能和安全管理分析

    Tailscale 分析了路由器和 NAS 内置 VPN 在可靠性、性能、安全与易用性方面的限制,指出其可能受 NAT、设备性能、上传带宽和维护支持周期影响。文章介绍 Tailscale 通过客户端、SSO 登录、点对点连接和集中权限管理,替代传统自托管 VPN;其 Personal plan 支持最多六个用户账户和无限设备。

7月16日周四
  1. Hugging Face Blog43

    DharmaOCR:新模型涌现,巴西葡萄牙语OCR专门化优势仍存

    DharmaOCR在巴西葡萄牙语OCR基准测试中取得0.925分,高于Mistral OCR4的0.798分和Unlimited-OCR的0.7587分,显示出专门化带来的显著优势。其训练先通过监督微调适配葡萄牙语词汇、语法和文档结构,再以Direct Preference Optimization抑制重复或不连贯输出,降低推理时间和成本并提升生产环境稳定性。

7月1日周三
  1. Hugging Face Blog73

    ScarfBench:评测企业Java框架迁移AI智能体

    IBM Research推出开源基准ScarfBench,用于评测AI智能体在Enterprise Java跨框架迁移中的构建、部署和行为保持能力。基准包含34个应用、102个框架实现和204项迁移任务;测试显示当前最强智能体的行为成功率低于10%,且智能体自报成功不能替代独立构建与测试验证。

    推荐理由:ScarfBench将企业Java跨框架迁移从代码生成推进到构建、部署和行为验证,揭示智能体成功率、过度自信及依赖管理之间的差距,对评估现代化方案具有直接参考价值。