共 1 篇文章
2026年4月,arXiv刊出ClawBench基准:首次将153个日常在线任务放到144个真实生产网站上评测AI智能体,结果最强模型Claude Sonnet 4.6的真实任务成功率仅33.3%,GPT-5.4低至6.5%,68个任务无一模型完成。本文据此剖析实验室高分与生产可用之间的落差、只读与写入任务的断层、金融类任务的相对优势与绝对短板,并结合关联基准DataClawBench的假设生成瓶颈,为金融业智能体建设提出加速探索、审慎部署与多层安全兜底的建议。