资产保全智能体该用多大参数的基座?——把一条社交媒体技术帖,翻译成一套可执行的微调选型规则
核心摘要
- "小模型微调后可胜过 100 倍大的模型",是一条社交媒体技术帖的作者主张,不是行业定论,更不是可推广的普遍规律
- 该帖真正有价值的部分不是那个倍数,而是它给出的方法链路:SFT 之后接 RFT(GRPO),用 RULER 免写奖励函数、免标注数据
- 该帖的示例是在窄工具使用任务上训练一个 3B 模型;资产保全的场景宽得多,规模问题不能照搬它的结论
- 规模的第一决定因素不是榜单名次,而是错误来源:格式与口径靠小模型加 SFT,多步工具与流程靠 RFT,知识缺失靠检索,经验判断交回人工
"小模型微调后可胜过 100 倍大的模型",是一条社交媒体技术帖的作者主张,不是行业定论,更不是可推广的普遍规律
该帖真正有价值的部分不是那个倍数,而是它给出的方法链路:SFT 之后接 RFT(GRPO),用 RULER 免写奖励函数、免标注数据
该帖的示例是在窄工具使用任务上训练一个 3B 模型;资产保全的场景宽得多,规模问题不能照搬它的结论
规模的第一决定因素不是榜单名次,而是错误来源:格式与口径靠小模型加 SFT,多步工具与流程靠 RFT,知识缺失靠检索,经验判断交回人工
因此选型次序是:先任务分型与错误归因,再定能力下限,最后才落到参数规模与显存档位
素材说明:事实来源仅 6 份已归档文本。来源 1 为 X 平台个人技术长文《How to Fine-Tune LLMs in 2026》(作者 @akshay_pachaar,2026-03-04)——个人在社交媒体发表的技术文章,非同行评议、非机构发布,其判断与主张均属作者观点或其示例条件下的结论,浏览量 904.4K(抓取文本中唯一被明确标注字段的互动数字)为抓取时点快照;同一抓取文本中另有若干未标注字段的互动数字(31/304/1.8K/3.8K),本文不臆断其分别对应回复、转推、点赞或收藏,故不引用。来源 3 为第三方「AI 原生全景图」的 ART 条目,二手;来源 2 为 GitHub API 的
OpenPipe/ART仓库元数据,客观元数据,同为时点快照。来源 4(QLoRA 摘要)与来源 5(arXiv:2604.17187 摘要)为一手学术文本,数据可作事实引用,但均为论文自身报告、未经独立复现。来源 6 为商业网站 GPU 指南,二手且含营销与推销性质:只提取其通用档位关系并注明出处性质,其具体型号推荐不作为本文结论。文中全部框架、档位建议、判据与决策规则均为本文分析/推论;任何具体参数规模数字均为本文推论,不属任何来源的规定。
一、该帖讲了什么(据该帖,忠实转述)
触发点:该帖称,写好 system prompt、加上 few-shot、调好温度之后,agent 仍有 30–40% 的概率出错,且永远不会从错误中学习;用 GPT 或 Claude 则与他人同质。核心主张(记为该作者主张):"取一个小开源模型、在你的具体任务上微调,它可以胜过比它大 100 倍的模型,而成本与延迟只是零头。" 本文必须点破:这是作者在其示例条件下的结论,非行业定论、非普遍规律——方向可借鉴,倍数不可引用。
SFT 与 RFT:该帖称 SFT 教模型"说什么",不教它"如何成功";对需要检索、调用 API、多步推理的 agent,模仿不够,RFT 则给奖励信号、让它自己发现策略——SFT = 读教科书,RL = 在职训练。
GRPO(据该帖):当下最流行的 RFT 算法,也是驱动 DeepSeek-R1 推理能力的同一个算法(此表述出自该帖,本文不另作印证)。四步为采样 N 条补全 → 逐条打分 → 组内归一化算相对优势 → 强化高于均值、压制低于均值;关键性质是只需相对排名、不需绝对分数——只有次序驱动学习。
ART 架构(据该帖):把 GRPO 带给任意 Python 应用的开源框架,动机是多数 RL 框架为单轮问答而造,真实 agent 要检索文档、调用 API、跨多步推理。分 Client 与 Backend:Client 放 agent 代码,把每次动作记入一条 Trajectory(一次运行的完整历史);Backend 用 vLLM 推理、用 Unsloth 驱动的 GRPO 训练,每一步训练后新的 LoRA checkpoint 自动加载进推理服务。训练环即推理请求 → 生成 → 环境动作 → 返回奖励 → GRPO 更新 → 新 checkpoint 载入 → 循环;集成 LangGraph、CrewAI、ADK。
RULER(据该帖):Relative Universal LLM-Elicited Rewards(相对通用 LLM 诱导奖励)——彻底免掉手工奖励函数,用 LLM-as-judge 比较多条轨迹并排名,不需任何标注数据。依据两个洞见:让 LLM 打 0–10 分结果不一致;问它"这 4 次里哪一次最好地达成了目标"可靠得多;而GRPO 本就只需相对分数。三步为生成 N 条轨迹 → 评判器各打 0 到 1 分 → 用作 GRPO 奖励。
示例规模:该帖做了一个 notebook,训练一个 3B 模型掌握任意 MCP 服务器——给一个服务器 URL,它就查询其工具 → 生成会用到这些工具的任务 → 用自动 RULER 评估训练。这就是该帖给出的全部规模信息:3B,窄工具使用任务。
⚠️ 同名概念必须区分:该帖的 RULER = Relative Universal LLM-Elicited Rewards,是 ART 训练流程中的奖励构造机制。学界另有同名但完全不同的论文 《RULER: Instance-aware Rubric Rewards for SVG Generation》,讨论 SVG 生成任务的实例化评分量规奖励,与本文对象毫无关系。本文只讨论前者;且该缩写并非唯一,检索时须连同英文全称或 ART/OpenPipe 关键词,否则极易混淆。
二、可信度分层(本文分析)
| 该帖内容 | 证据强度 | 依据 |
|---|---|---|
| ART 的 Client/Backend 架构、vLLM 推理 + Unsloth GRPO 训练、训练后自动加载新 LoRA checkpoint | 有独立印证 | 来源 3 载明 ART 为 OpenPipe 开源强化学习框架、训练服务器与客户端解耦、训练产出以 LoRA 检查点形式加载到推理服务、兼容 vLLM 与 Unsloth;来源 2 描述为 "train multi-step agents for real-world tasks using GRPO",topics 含 grpo/lora/agent |
| RULER 免手工奖励函数、用 LLM 评判器自动打分 | 有独立印证 | 来源 3 单列"零样本奖励(RULER):使用 LLM 作为评判器自动打分,免去手工设计奖励函数" |
| GRPO 的存在与用途 | 可支撑 | 来源 2、3 均以 GRPO 为核心机制 |
| QLoRA 类的内存收益 | 有论文支撑 | 来源 4 报告 4-bit NF4 + 双量化 + 分页优化器可在单张 48GB GPU 微调 65B |
| "胜过 100 倍模型,成本与延迟只是零头" | 仅属作者主张 | 无第三方或论文印证;示例条件为 3B 模型学习调用 MCP 工具(窄工具使用任务) |
本文推论:它不是被证明的规律,而是"错误恰好集中在多步工具使用与流程上"这一条件下的经验观察;用得对的前提,是错误来源恰好落在它的适用面上。
三、把选型问题翻译成六项约束(本文分析)
| # | 约束 | 对参数规模的直接影响(本文推论) |
|---|---|---|
| ① | 任务复杂度 | 单步抽取与多步工具调用(查台账→核时效→生成材料→留痕)需求不同。步骤越多、动作空间越大,规模下限越高 |
| ② | 上下文长度需求 | 案件卷宗、合同、财报、抵押物资料冗长且需并读。长上下文同时抬高训练与推理显存,同卡下越长可选规模越小 |
| ③ | 领域语言 | 本行文书口径、法律与押品术语、中文。主要靠数据与 SFT 解决,不是靠堆参数;但中文与法律语域的基座适配度影响下限 |
| ④ | 延迟与并发 | 一线人员实际使用。参数越小、延迟越低、单卡并发越高——这是该帖"成本与延迟只是零头"唯一可稳妥接受的部分 |
| ⑤ | 部署与显存约束 | 私有化、行内 GPU 有限。必须以"训练所需显存"而非"推理所需显存"为准——两者差 4 到 8 倍 |
| ⑥ | 治理与可审计 | 微调产物是模型制品,血缘(基座版本、数据、超参、评测)须可留存、可披露、可回退 |
三条要点:其一,②④⑤互相拉扯——上下文长、延迟低、显存省不可能同时最优,规模是这三者的解。其二,③⑥与规模几乎无关,不应成为抬高规模的借口。其三,①是唯一真正决定规模下限的约束。
与上一篇的衔接:在《资产保全智能体:该微调基座还是只做 Harness 工程?》中,本文作者已把资产保全任务分为流程/工具型、文书/口径型、窄分类型、经验判断型四类,并论证微调与 harness 是叠加而非替代、harness 变更可回退而微调产物无法"未训练"回去。本文是该篇续篇:上一篇回答"要不要微调",本文回答"若微调,基座选多大",故第一步接用那篇分型。
四、规模与显存的实证档位(据来源 4、6,标注性质)
QLoRA 一手档位:据 arXiv:2305.14314(NeurIPS 2023,一手;论文自身报告、未经独立复现),该工作把显存降到足以在单张 48GB GPU 上微调 65B 模型,同时保持完整的 16-bit 微调任务性能;做法是让梯度穿过冻结的 4-bit 量化模型反向传播进 Low Rank Adapters,三项创新为 (a) 4-bit NormalFloat(NF4);(b) 双量化;(c) 分页优化器。结果:最佳模型族 Guanaco 在 Vicuna 基准上超过此前所有公开释放模型,达到 ChatGPT 性能的 99.3%,微调只需单张 GPU 的 24 小时;团队用 QLoRA 微调了 1000 多个模型,覆盖 8 个指令数据集、LLaMA 与 T5、以及常规微调不可行的 33B 与 65B。
商业指南档位(来源 6,二手,含推销性质;型号推荐不作为本文结论):
| 方法档位 | 该指南给出的档位 | 本文提取的通用关系 |
|---|---|---|
| QLoRA,7B–13B | 桌面单卡(该指南举 4090/5090 一类) | 最小可行档:桌面级即可起步 |
| QLoRA,34B–70B | 96GB 级单卡或 A100 80GB | 中等档:需 80–96GB 级单卡 |
| 全参微调 | H100/H200 加 NVLink,通常租用 | 高档:进入多卡机房范畴 |
| 100B+ 预训练 | B200 集群 | 不在本文讨论范围 |
该指南另给出每十亿参数 QLoRA 约 0.5GB、全参微调约 16GB的经验值(据此它称 7B 的 QLoRA 约 12GB、全参约 112GB;70B 的 QLoRA 约 48GB、全参超 700GB)。均为该商业网站口径,未独立验证。
该指南最该记住的一句:「训练不是推理」。 跑模型时 GPU 只装权重;训练要同时装权重、梯度(每权重一个)、优化器状态(Adam 每权重再两个)、前向激活,该指南给的倍数是内存需求被推高到推理的 4 到 8 倍。它举的例子是:某团队买 4090 微调 70B,第一步没跑完就爆了显存——而同一张卡跑同一模型的推理毫无问题(据该商业网站指南,二手;本文只引用此通用关系,不引用其型号推荐)。
本文推论:若按"推理能跑多大"规划微调,必然在第一步撞墙;正确口径是训练态显存。QLoRA 之所以把可达规模推高,正因它把权重压到 4-bit、并把梯度与优化器状态限制在很小的适配器上。
五、不要按榜单选规模(据来源 5)
据 arXiv:2604.17187 摘要(预印本,一手;论文自身报告、未经独立复现):该文在 NVIDIA GH200 576GB 上,就一个多文件 React Native 应用生成任务评测五个开放权重编码模型——Kimi-K2.5(Q3 与 Q4)、GLM-5.1、Qwen3-Coder-480B、DeepSeek-V3.2,任务规定身份认证、按用户按日计数、Web 兼容性,标准是能否开箱即用与功能正确。核心发现是 "SWE-Bench rankings do not predict task performance":采用激进 3-bit 量化的 Kimi-K2.5(UD-Q3_K_XL,480GB)产出最完整、最符合规格的输出,排名超过 SWE-Bench Pro 分数高得多的模型。该文另记录三条部署发现(temperature=0 在推理模型架构上造成采样挂起;思考痕迹可经工具的文件路径解析器泄漏;移动 API 的 Web 适配是所测全部模型共同的训练数据缺口),并称效率流派(10–15B 活跃参数)以约七分之一硬件成本取得与规模流派(32–40B 活跃参数)相当的结果。
本文推论:榜单测的是它自己的题,不是你的题;"更大规模"与"更低量化精度"之间并无当然胜负;选规模的依据应是"本行任务上的实测",而非公开榜单——唯一可信判据是自建评测集上的分数。
六、决策规则(本文分析,核心章节)
本节全部为本文分析/推论,不是任何来源的规定。
① 先做任务分型。 接用上一篇四类:流程/工具型、文书/口径型、窄分类型、经验判断型——分型决定该任务是否值得微调,也预示规模问题的形态。
② 判断错误来源,据此选手段。这是本文的核心判据——不要先问"选多大",先问"错误出在哪里":
| 错误集中在 | 应选手段 | 对规模的含义(本文推论) |
|---|---|---|
| 格式/口径 | 小模型 + SFT/Skills 即可 | 不必加参数;靠数据与约束收口,加参数是浪费 |
| 多步工具使用与流程 | RFT(GRPO)在小模型上收益最大 | 这正是该帖的适用面;规模只要足以"可靠产出结构化动作"即可 |
| 知识缺失 | 先补检索(RAG/知识库),不是加参数 | 规模与知识量无关;把条文与制度塞进权重是错误路径 |
| 经验判断(该不该诉、能否和解) | 不该交给微调,人工保留 | 无规模可谈:不可回退、不可归因 |
本文推论:该帖那套方法的适用面恰好只是第二行。若错误主要落在第一、三行,先做的不是选规模,而是补数据与补检索;落在第四行的,任何规模都不该接手。
③ 定能力下限。 先确认"可靠的多步工具调用"是否必需。若必需(如同时查台账、核时效、调押品信息、生成材料并留痕),规模不能过小——多步任务的复合成功率是各步的乘积,单步 95% 的可靠性,五步之后只剩约 77%(本文算术推论,非来源数据);若只是单步抽取或分类,下限可以很低。
④ 定起点并留出升级路径。以下区间均为本文基于第四、五节档位关系所作的推论,不是任何来源的规定值,也不是行业标准。
| 本文推论的起点 | 依据与限定 |
|---|---|
| 先取"具备可靠多步工具调用能力的最小开放权重档"作起点,并把它当下限而非目标 | 该帖示例为 3B 窄工具使用任务(作者主张下的条件);资产保全流程更宽,故 3B 不能直接移植为起点建议 |
| 在 7B–13B 这一档内起步试探 | 依据来源 6 通用档位:QLoRA 7B–13B 可在桌面单卡完成——显存门槛最低、迭代最快(二手,含推销性质) |
| 只在多步工具调用的实测成功率不足时才逐级上移 | 依据来源 5:规模应由本行任务实测决定,而非由榜单或直觉决定 |
并且必须先做一件事:用免微调基线测一遍再决定——把提示词、few-shot、工具接口与检索知识库全部接好,在自建评测集上跑出分错误类型的基线分数;只有当错误被证实集中在"多步工具使用与流程"上时,微调才有理由。没有基线分数,就没有选规模的依据。
⑤ 显存与部署对齐。 口径是训练态而非推理态:7B–13B 走 QLoRA、桌面单卡级;34B–70B 走 QLoRA、80–96GB 级单卡(与来源 4 的"65B/48GB"方向一致);超过 70B 需多卡加 NVLink、通常租用。本文推论:长上下文是最易被低估的变量——它等价于把可选规模往下压一档。
⑥ 治理对齐。 其一,微调产物是模型制品,须登记基座版本、数据、超参、评测与部署范围;其二,harness 变更可回滚,微调产物无法"未训练"回去,故每次规模上移都须留下一版可回退的制品;其三,评测集与错误分型口径要沉淀为可重复资产。(治理定性均为本文推论,不构成监管要求或合规意见。)
FAQ
Q1:那个帖说"小模型微调后能胜过 100 倍大的模型",能照此定规模吗?
A1:不能。 该说法是个人社交媒体技术文章中的作者主张,非行业定论、非普遍规律;其示例条件是把 3B 模型训练到会调用某个 MCP 服务器,属窄工具使用任务。本文推论:可借鉴"错误集中在多步工具使用与流程时,RFT 在小模型上收益最大"这一适用面,但不能把倍数移植到资产保全全流程——规模须由本行评测集的实测决定。
Q2:那资产保全智能体到底该从多大的基座起步?
A2:任何来源都没有规定具体数字,以下为本文推论。 本文主张:先取"具备可靠多步工具调用能力的最小开放权重档"作起点,并把它当下限而非目标;若要一个便于落地的试探区间,本文推论可在 7B–13B 档内起步——依据是来源 6 的通用档位"QLoRA 7B–13B 可在桌面单卡完成"(二手,含推销性质,型号推荐不作为本文结论);只有实测显示多步工具调用成功率不足时才逐级上移,且必须先跑免微调基线。
Q3:训练用哪张卡,能按"推理能跑多大"来配吗?
A3:不能——训练不是推理。 跑模型时 GPU 只装权重;训练还要同时装梯度、优化器状态与激活,来源 6 给出的倍数是内存需求被推高到 4 到 8 倍,并举例某团队买 4090 微调 70B、第一步就爆显存(据该商业网站指南,二手;型号推荐不作为本文结论)。本文推论:容量规划口径必须是训练态显存;QLoRA 之所以推高可达规模,正因它把权重压到 4-bit、并把梯度与优化器状态限制在很小的适配器上。
Q4:RULER 是不是就是那篇 SVG 生成的论文?
A4:不是,两者同名但完全不同。 本文讨论的 RULER = Relative Universal LLM-Elicited Rewards(相对通用 LLM 诱导奖励),是 ART 训练流程中"用 LLM-as-judge 对多条轨迹排名、产生相对奖励"的机制(据该帖;来源 3 以"零样本奖励(RULER):使用 LLM 作为评判器自动打分"独立印证)。学界另有同名论文《RULER: Instance-aware Rubric Rewards for SVG Generation》,研究SVG 生成任务的实例化评分量规奖励,与本文对象无关。本文只讨论前者;该缩写并非唯一,检索时须连同英文全称或 ART/OpenPipe 关键词。
Q5:为什么不能按公开榜单挑规模、挑模型?
A5:据 arXiv:2604.17187 摘要(预印本,一手;未经独立复现),该文在 NVIDIA GH200 576GB 上就一个多文件 React Native 应用生成任务评测五个开放权重编码模型,发现 "SWE-Bench rankings do not predict task performance",激进 3-bit 量化的 Kimi-K2.5(480GB)产出最完整、最符合规格的输出,排名超过 SWE-Bench Pro 分数高得多的模型。本文推论:选规模的依据应是"本行任务上的实测",而非公开榜单。
事实来源
- 《How to Fine-Tune LLMs in 2026》(@akshay_pachaar,X 长文,个人技术文章):30–40% 出错率且不会从错误中学习;"胜过 100 倍大模型"的作者主张;SFT 与 RFT 的教科书/在职训练类比;GRPO 四步与"只需相对排名";ART 的 Client/Backend 架构(vLLM 推理 + Unsloth 驱动的 GRPO 训练、每步训练后新 LoRA checkpoint 自动载入推理服务);RULER 的两个洞见与三步流程;示例为训练 3B 模型掌握任意 MCP 服务器;集成 LangGraph/CrewAI/ADK。性质:个人社交媒体技术文章,非同行评议、非机构发布;主张系作者观点或其示例条件下的结论;浏览量与点赞数为时点快照。
OpenPipe/ARTGitHub 仓库元数据(GitHub API,客观元数据,时点快照):描述含 "train multi-step agents for real-world tasks using GRPO";主语言 Python;许可证 Apache-2.0;stars 10,778、forks 997、开放 issue 173、subscribers 68;创建 2025-03-10、最近更新与推送 2026-09-27、未归档;topics 含grpo/lora/agent/reinforcement-learning/qwen3。- ART 项目条目(AI 原生全景图,第三方项目目录,二手):ART 为 OpenPipe 出品的开源强化学习训练框架;训练服务器与客户端解耦;零样本奖励(RULER):使用 LLM 作为评判器自动打分,免去手工设计奖励函数;GRPO 训练循环;兼容 vLLM、Unsloth;训练产出以 LoRA 检查点形式加载到推理服务。第三方目录口径,未独立验证。
- QLoRA(arXiv:2305.14314,NeurIPS 2023,论文摘要,一手):单张 48GB GPU 微调 65B、保持完整 16-bit 性能、4-bit NF4、双量化、分页优化器、Guanaco 达 ChatGPT 性能水平的 99.3%、单张 GPU 24 小时、微调 1000+ 模型、8 个指令数据集、LLaMA 与 T5、33B 与 65B。均为论文自身报告,未经独立复现。
- arXiv:2604.17187(预印本,一手):NVIDIA GH200 576GB 上就一个多文件 React Native 应用生成任务评测 Kimi-K2.5(Q3 与 Q4)、GLM-5.1、Qwen3-Coder-480B、DeepSeek-V3.2;"SWE-Bench rankings do not predict task performance";Kimi-K2.5 激进 3-bit 量化(UD-Q3_K_XL,480GB)产出最完整、最符合规格;三条部署发现;效率流派(10–15B 活跃参数)以约七分之一硬件成本取得与规模流派(32–40B 活跃参数)相当的结果。均为论文自身报告,未独立复现。
- 《Best GPUs for AI Training & Fine-Tuning (2026 Guide)》(商业网站指南,二手,含营销与推销性质):"Training is not inference" 与 4 到 8 倍内存倍数;买 4090 微调 70B 第一步爆显存的举例;QLoRA 7B–13B → 桌面单卡、34B–70B → 96GB 单卡或 A100 80GB、全参微调 → H100/H200(通常租用)、100B+ → B200 集群;每十亿参数 QLoRA 约 0.5GB/全参约 16GB。该指南自称信息性内容、非投资建议;其型号推荐不作为本文结论,本文只提取通用档位关系。
本文推论部分(非来源表述):第二节分层判断;第三节六项约束、三条要点与衔接定位;第四节档位归并与训练态口径;第五节"选规模依据应是本行实测";第六节全部决策规则与一切具体规模数字;第七节三种反对;第八节清单;FAQ 中标注为本文分析的部分。本文不构成监管要求、合规意见或法律意见。
(内容由AI生成,仅供参考)
参考文献
- How to Fine-Tune LLMs in 2026(@akshay_pachaar,X 长文,2026-03-04,个人技术文章) [X(个人技术文章)]
- OpenPipe/ART — Agent Reinforcement Trainer(GitHub 仓库元数据) [GitHub]
- ART(Agent Reinforcement Trainer)项目条目(AI 原生全景图,第三方目录) [第三方目录]
- QLoRA: Efficient Finetuning of Quantized LLMs(arXiv:2305.14314,NeurIPS 2023) [arXiv / NeurIPS]
- arXiv:2604.17187(开放权重模型与目标硬件档位) [arXiv]
- Best GPUs for AI Training & Fine-Tuning (2026 Guide)(商业网站指南,二手) [商业网站(二手)]