共 2 篇文章
2026年4月,arXiv刊出ClawBench基准:首次将153个日常在线任务放到144个真实生产网站上评测AI智能体,结果最强模型Claude Sonnet 4.6的真实任务成功率仅33.3%,GPT-5.4低至6.5%,68个任务无一模型完成。本文据此剖析实验室高分与生产可用之间的落差、只读与写入任务的断层、金融类任务的相对优势与绝对短板,并结合关联基准DataClawBench的假设生成瓶颈,为金融业智能体建设提出加速探索、审慎部署与多层安全兜底的建议。
2025年是中国量化投资的AI落地元年,大模型正全面重构因子挖掘、组合构建、交易风控与合规运维全链路。本文梳理端到端深度学习范式跃迁、AI Agent从代码补全到自主工程师的演进、大语言模型对非结构化数据的信号化改造,并结合策略同质化、过拟合、数据合规与监管收紧等风险,提出AI量化竞争正从因子竞争走向智能体系统竞争的判断。