Mercor研究:AI在结构化记账任务中速度与准确率更高,但仍需监督才能结账
Mercor研究发现,AI模型在简化记账任务上比12名持证CPA更快、更准确且成本更低,当前模型已几乎无误完成同类任务。完整APEX Accounting Benchmark中,Claude Opus 5.5以61.8%的评分标准达标率领先,但没有模型完全解决近60%的任务。研究未涵盖客户沟通、同事协作和长期积累的业务背景,因此尚不能说明AI可在无人监督下完成结账。
Mercor研究发现,AI模型在简化记账任务上比12名持证CPA更快、更准确且成本更低,当前模型已几乎无误完成同类任务。完整APEX Accounting Benchmark中,Claude Opus 5.5以61.8%的评分标准达标率领先,但没有模型完全解决近60%的任务。研究未涵盖客户沟通、同事协作和长期积累的业务背景,因此尚不能说明AI可在无人监督下完成结账。
独立股票分析师MBI表示,体验Meta的Muse约10天后,因认为该AI智能体可能绕过Airbnb直接完成预订,清仓Airbnb并加仓Meta。Muse可搜索并比价,还曾找到直接向房东预订便宜约60%的农舍体验,但浏览器式操作较慢,比价5家酒店耗时14分钟。
iOS 27 的 Siri 被评价为不会伪装成人类,而是明确以工具身份回应用户。作者表示,自首个 iOS 27 beta 发布以来使用 Siri AI 近四个月,认为它比前代更强大,但在最先进能力方面,ChatGPT、Claude 和 Google Gemini 可能更合适。
OpenAI与Meta以卡通化个人AI代理降低用户戒心,但连接邮箱、消息、文件和健康数据等账户仍会扩大隐私与误操作风险。作者结合Muse案例指出,“allow always”设置可能让代理在用户未再次确认时分享地址,消息同步也可能造成用户未预期的访问。
OpenAI 的 Dots 于本周亮相,被定位为面向商业任务的代理式助理,最低每月 100 美元。The Vergecast 讨论了 Dots、Muse 在任务执行中的表现与带来的不适感,并涉及 AI 信任、AI 自律协议、Kindle、HomePad 和 Cybercab 等话题。
OpenAI本周早些时候推出的代理平台Dot更像能操作软件的工作代理,而非个人购物助手,优先向每月100美元的最高档账户开放。作者让Dot处理个人网站改版、视频合并和网站部署时较为顺利,但它多次受安全验证、登录和支付环节阻碍;尽管对启动业务等工作可能有用,作者认为这并不值得其每月100美元的订阅费。
作者数周实测发现,Gemini Spark 可作为全天候个人代理,后台处理网页浏览、邮件筛选与批量退订,并在 Google Drive、Sheets 和 Slides 中整理文件。当前该软件仍处于 beta,餐厅预订的最后一步仍需人工确认。
Google 发布视频编辑平台 Google Vids,用户可在电脑上免费使用其 AI 视频生成器,但没有移动端应用。作者实际测试发现,该工具采用易上手的线性编辑界面,支持从 Google Docs 文件生成视频、创建 AI 虚拟主持人以及用 Omni 直接编辑。
iOS 27 启用 Siri AI 后,iPhone 和 iPad 从屏幕顶部中央下拉将调用 Siri AI,通知中心改由左上角下拉打开。通知中心区域被移至左上角,iPadOS 27 beta 1 后的手势区域也有调整;目前没有关闭顶部中央下拉调用 Siri AI 的选项。
Windows 11 Narrator 在普通电脑上的图像描述结果令人费解。该功能面向 Copilot+ PC,普通 Windows 11 PC 使用时会很快出现混乱。
UGREEN HomeAgent HA100、HA100 Pro 和 MasterAgent MA100 面向不同预算与应用场景。选购时可结合个人家庭需求和下一个 AI 项目,判断各型号从何处开始更合适。
作者在 RTX 4070 Ti 上通过 OptiScaler 等工具运行 Multi Frame Generation、DLSS 5,并尝试 Reflex 2 相关功能。其测试显示,软件能让部分 RTX 50 系列功能出现在较旧的 RTX 40 系列显卡上,但性能和兼容性仍受硬件限制。文章据此认为,GPU 代际边界正受到软件生态的软化。
Pebble Index 01 通过按钮录入语音,由手机端 Pebble 应用和本地 LLM 创建笔记、提醒、日历、闹钟或短信。作者称其约三秒完成操作,无需充电并支持离线处理,已替代其手机上的待办和笔记应用。
Meta Muse 将自身定位为不同于传统对话工具的自主个人助手,可在后台管理任务。相较 Gemini Spark 等主要依托生态系统的智能体功能,Meta 为 Muse 提供了更深的系统与应用控制权,以及全天候自主后台执行能力。
社交俱乐部 The Den 借助 ChatGPT Work 每周节省 10 至 15 小时,以支持新地点的业务增长。资助申请准备时间从 3 天缩短至 2 小时,酒类许可证材料准备时间从 4 天缩短至 3 小时。
ChatGPT、Gemini、Claude 和 Copilot 的免费版均无需订阅,但会分别涉及广告、聊天记录用作训练数据或模型较小等取舍。各方案的默认设置并不完全相同,下一次对话前应检查聊天记录、模型及广告等相关选项。
白宫 AI 聊天机器人 America.gov 上线后被曝存在热狗彩蛋,提示“hotdog”会生成没有配菜的热狗,按回车键时还可能出现更多热狗。该网站原计划作为美国民众查询和办理事务的入口,并接入 Google 的 Gemini 与 SpaceXAI 的 Groq,但目前还包含多项渲染错误和未完成功能。
Android Police 作者认为,Google Maps、Gemini、通知交互、第三方应用支持和超速提醒等 Android Auto 功能改变了日常通勤体验,并在多个方面优于 CarPlay。
Googlebooks 被视为 Google Android 平台面向大屏的下一阶段,拟以桌面形态取代 ChromeOS,并成为近年来首个全新的桌面操作系统。文章作者以 Chromebook 长期用户身份表达了对这一计划的期待,同时指出其成功前景仍存在疑虑。
作者认为,DLSS并非GPU的未来;NVIDIA为专用AI加速硬件在GPU中让出空间的决定,却体现了前瞻性。DLSS旨在解决高分辨率平面显示器带来的缩放画质问题,避免用户只能针对任意面板分辨率进行渲染。
Google 转向 AI 生态系统后,Google Lens 的一些核心功能体验变差,新增的 AI 功能也未如预期减轻操作负担。文章认为,AI 导向的功能堆叠使 Google Lens 更加臃肿、杂乱和复杂,削弱了原本强大的工具体验。
作者测试了 3 种利用 AI 构建 Excel 仪表板的方法,比较提供详细指示、展开多轮对话与保持简单三种思路,结果最简单的方案胜出。测试重点是让 AI 承担仪表板构建中的繁重工作,正文未进一步说明所用工具、具体操作或结果差异。
PCWorld的Windows 11 26H2半年成绩单认为,Microsoft的Windows重置取得进展,搜索获A-,Copilot收敛获B,但开始菜单仍为C。功能更新可在Patch Tuesday中按月增量交付,26H2正陆续推出;Copilot图标已从Notepad、Photos和Windows Snipping Tool移除,8GB电脑性能仍待改善。
Anthbot N8是一款可收集草屑和落叶的机器人割草机,实测中草屑与落叶收集干净,自动倾倒过程稳定。 该机型支持割草、覆盖、收集和清叶,但集草模式下噪音接近68分贝,工作速度较慢,转弯时需要额外空间,边缘仍可能留下未修剪区域。评测时价格为1,699美元,测试固件版本为0.3.90。
Geekbench 7 结果显示,OpenAI 的自主代理 dots 似乎运行在配备约 9.73GB 内存的九核 AMD EPYC 9V74 虚拟机上。dots 上市后的公开运行成绩为单核 1,512–1,614、多核 8,135–8,991;Tom’s Hardware 独立测试 Meta Muse 的成绩为单核 1,000、多核 1,433。
The Call Center Doctors 租用配备四块 Nvidia H200 的服务器运行 DeepSeek V4.1 Flash,测试其相较 Claude 的实际成本与性能。
美国卫生部长小罗伯特·F·肯尼迪称,AI可让美国人自行核查医疗建议,摆脱医生和健康专家的“医疗统治”。Ars Technica测试发现,Google Gemini和ChatGPT均肯定口罩及社交距离有助于减少传染病传播,未支持其关于疫苗的质疑。
Signal65 测试显示,高通 18 核骁龙 X2 Elite(X2E-88-100)在 CPU、AI 和多数续航项目领先英特尔酷睿 Ultra X7 358H。其 Geekbench 7 多核得分领先 31%,本地视频和 Chrome 浏览续航也更长,但办公续航由英特尔领先。
Signal65研究显示,搭载Qualcomm Snapdragon X2 Elite X2E-88-100的Lenovo Slim 7x在多项CPU、AI、生产力和电池测试中领先Intel Core Ultra X7 358H,并低于Dell XPS 14的价格。
F5在由其赞助的实验室参观中展示BIG-IP Next for Kubernetes(BNK)运行于NVIDIA BlueField-3 DPU的方案,用于GPU基础设施边缘的LLM路由、token治理及L4至L7安全。
JetBrains 对比 RustRover 与 VS Code + rust-analyzer 在 Rust 代码分析、Cargo、测试、调试、重构和 AI 代理支持上的差异。
Code发布的案例称,编码代理在三周内重构了30万行C代码,消耗约4,000美元的 token,并由逐帧回放工具验证。代理还形成了针对该代码库的 recipe playbook,但实践者质疑案例范围、指标及结果对验证框架的依赖程度。
ColorOS 17 评测聚焦焕新凝光视效、系统动效、后台管理、小布 AI、小布 Next 及无障碍功能。文章认为新设计提升了第一方应用的一致性,AI 功能和离线多模态能力有所扩展,但部分动效、锁屏通知与亮暗场景表现仍有问题,小布 Next 仍处于共创阶段。
你看到的内容可能由第三方 AI 基于小众软件文章提炼总结而成,可能与原文真实意图存在偏差。不代表小众软件观点和立场。请 点击链接阅读原文 细致比对和校验。IvyCraft 是一款 AI 内容生成平台,可将 PDF、论文、Word、网页和视频等资料生成 PPT、信息图、播客、视频、漫画、绘本及社交媒体内容。
Basis 使用 GPT-6 Astra 处理一个包含 50 个标签页的税务工作簿,耗时仅为 GPT-5.6 Sol 的一半。GPT-6 Astra 对用户意图更强的理解能力,也增强了 Basis 对其在实际场景中使用的信心。
Tool Calling 适合单次、时效性强且需要模型直接查看结果的操作,Code Execution 则可让模型编写脚本处理并行查询、过滤与聚合,减少中间结果进入上下文。
Skills Manager 是一款开源免费的桌面应用,可集中管理 AI Agent 与编程工具的 Skills,并通过软链接或复制方式同步。文章介绍其预设分组、Agent 授权管理、skills.sh 市场搜索及 Git 备份功能,同时指出备份可选,超过 100 MB 的 Skill 不纳入备份。
GPT‑6 Astra 使 Parallel 的 agents 能够用一半时间、一半成本完成劳动市场数据的研究与综合,相较此前模型效果显著。研究结果基于 GPT‑6 Astra 与既有模型在时间和成本上的对比。
Richard Stallman 与 Jacob Bachmeyer 撰文批评 GitHub 的许可证指导、非自由 JavaScript、Copilot SaaSS 和集中化工作流可能损害软件自由。GNU Project 建议开发者避免将代码仓库托管在 GitHub,文章还讨论了 GitHub Actions、身份显示、通信方式及 fork 与 pull request 设计。
网易叭哥说是网易有道推出的 AI 原生语音 Agent,提供 Windows 和 macOS 桌面端,可整理口语表达、处理改口并输出文本。文章称其支持去口头禅、专属词库、124 个语种实时语音互译和本地输入历史,但目前采用非流式输出,且 AI 润色可能改变个人语气。