---
title: "资产保全智能体该用多大参数的基座？——把一条社交媒体技术帖，翻译成一套可执行的微调选型规则"
date: "2026-09-27"
description: "以 6 份已归档材料为唯一来源：先忠实转述一份 X 个人技术长文中 SFT 与 RFT 之路、GRPO、ART 架构与 RULER 机制，并把'小模型微调可胜过百倍大模型'标注为作者主张而非行业定论；再把资产保全的选型问题拆成六项约束，据 QLoRA 与显存档位推出规模区间与六步决策规则，并反对一上来买大卡、按榜单选规模、从全参微调起步。"
tags: ["金融科技", "AI治理", "大模型", "智能体", "资产保全", "不良资产", "模型微调", "参数规模选型", "强化学习", "银行AI", "信息科技风险", "模型风险管理"]
schema_type: "Article"
references:
  - title: "How to Fine-Tune LLMs in 2026（@akshay_pachaar，X 长文，2026-03-04，个人技术文章）"
    url: "https://x.com/akshay_pachaar/status/2029212227438518406"
    source: "X（个人技术文章）"
  - title: "OpenPipe/ART — Agent Reinforcement Trainer（GitHub 仓库元数据）"
    url: "https://github.com/OpenPipe/ART"
    source: "GitHub"
  - title: "ART（Agent Reinforcement Trainer）项目条目（AI 原生全景图，第三方目录）"
    url: "https://landscape.jimmysong.io/projects/openpipe-art/"
    source: "第三方目录"
  - title: "QLoRA: Efficient Finetuning of Quantized LLMs（arXiv:2305.14314，NeurIPS 2023）"
    url: "https://arxiv.org/abs/2305.14314"
    source: "arXiv / NeurIPS"
  - title: "arXiv:2604.17187（开放权重模型与目标硬件档位）"
    url: "https://arxiv.org/abs/2604.17187"
    source: "arXiv"
  - title: "Best GPUs for AI Training & Fine-Tuning (2026 Guide)（商业网站指南，二手）"
    url: "https://millionminer.com/news/best-gpu-for-ai-training"
    source: "商业网站（二手）"
# 注：本文件未写入 AIGC 隐式标识块。按现行标识要求，AIGC 元数据需包含 Label、ContentProducer、
#     ProduceID、PropagateID、ReservedCode1、ReservedCode2 等字段，其中 ProduceID / ReservedCode
#     须由标识服务平台逐篇签发，不能由作者或生成工具自行推定或编造。因此本文件暂留空位，须由作者
#     在取得平台签发的标识值后补充完整，方可发布。
---

**"小模型微调后可胜过 100 倍大的模型"，是一条社交媒体技术帖的作者主张，不是行业定论，更不是可推广的普遍规律**

**该帖真正有价值的部分不是那个倍数，而是它给出的方法链路：SFT 之后接 RFT（GRPO），用 RULER 免写奖励函数、免标注数据**

**该帖的示例是在窄工具使用任务上训练一个 3B 模型；资产保全的场景宽得多，规模问题不能照搬它的结论**

**规模的第一决定因素不是榜单名次，而是错误来源：格式与口径靠小模型加 SFT，多步工具与流程靠 RFT，知识缺失靠检索，经验判断交回人工**

**因此选型次序是：先任务分型与错误归因，再定能力下限，最后才落到参数规模与显存档位**

---

> **素材说明**：事实来源仅 6 份已归档文本。**来源 1** 为 **X 平台个人技术长文**《How to Fine-Tune LLMs in 2026》（作者 **@akshay_pachaar**，**2026-03-04**）——**个人在社交媒体发表的技术文章，非同行评议、非机构发布**，其判断与主张**均属作者观点或其示例条件下的结论**，**浏览量 904.4K**（抓取文本中唯一被明确标注字段的互动数字）为**抓取时点快照**；同一抓取文本中另有若干**未标注字段**的互动数字（31／304／1.8K／3.8K），**本文不臆断其分别对应回复、转推、点赞或收藏**，故不引用。**来源 3** 为第三方「AI 原生全景图」的 ART 条目，**二手**；**来源 2** 为 **GitHub API 的 `OpenPipe/ART` 仓库元数据**，**客观元数据**，同为时点快照。**来源 4**（QLoRA 摘要）与**来源 5**（arXiv:2604.17187 摘要）为**一手学术文本**，数据可作事实引用，但**均为论文自身报告、未经独立复现**。**来源 6** 为**商业网站** GPU 指南，**二手且含营销与推销性质**：只提取其**通用档位关系**并注明出处性质，其**具体型号推荐不作为本文结论**。**文中全部框架、档位建议、判据与决策规则均为本文分析／推论；任何具体参数规模数字均为本文推论，不属任何来源的规定。**

## 一、该帖讲了什么（据该帖，忠实转述）

**触发点**：该帖称，写好 system prompt、加上 few-shot、调好温度之后，**agent 仍有 30–40% 的概率出错，且永远不会从错误中学习**；用 GPT 或 Claude 则与他人同质。**核心主张**（**记为该作者主张**）：**"取一个小开源模型、在你的具体任务上微调，它可以胜过比它大 100 倍的模型，而成本与延迟只是零头。"** **本文必须点破**：这是**作者在其示例条件下的结论**，**非行业定论、非普遍规律**——**方向可借鉴，倍数不可引用**。

**SFT 与 RFT**：该帖称 **SFT 教模型"说什么"，不教它"如何成功"**；对需要检索、调用 API、多步推理的 agent，模仿不够，**RFT** 则给奖励信号、让它自己发现策略——**SFT = 读教科书，RL = 在职训练**。

**GRPO**（据该帖）：**当下最流行的 RFT 算法**，也是**驱动 DeepSeek-R1 推理能力的同一个算法**（**此表述出自该帖，本文不另作印证**）。四步为**采样 N 条补全 → 逐条打分 → 组内归一化算相对优势 → 强化高于均值、压制低于均值**；关键性质是**只需相对排名、不需绝对分数——只有次序驱动学习**。

**ART 架构**（据该帖）：**把 GRPO 带给任意 Python 应用的开源框架**，动机是**多数 RL 框架为单轮问答而造，真实 agent 要检索文档、调用 API、跨多步推理**。分 **Client 与 Backend**：**Client 放 agent 代码，把每次动作记入一条 Trajectory（一次运行的完整历史）**；**Backend 用 vLLM 推理、用 Unsloth 驱动的 GRPO 训练，每一步训练后新的 LoRA checkpoint 自动加载进推理服务**。训练环即**推理请求 → 生成 → 环境动作 → 返回奖励 → GRPO 更新 → 新 checkpoint 载入 → 循环**；集成 **LangGraph、CrewAI、ADK**。

**RULER**（据该帖）：**Relative Universal LLM-Elicited Rewards（相对通用 LLM 诱导奖励）**——**彻底免掉手工奖励函数**，**用 LLM-as-judge 比较多条轨迹并排名，不需任何标注数据**。依据**两个洞见**：**让 LLM 打 0–10 分结果不一致；问它"这 4 次里哪一次最好地达成了目标"可靠得多**；而**GRPO 本就只需相对分数**。三步为**生成 N 条轨迹 → 评判器各打 0 到 1 分 → 用作 GRPO 奖励**。

**示例规模**：该帖做了一个 notebook，**训练一个 3B 模型掌握任意 MCP 服务器**——给一个服务器 URL，它就**查询其工具 → 生成会用到这些工具的任务 → 用自动 RULER 评估训练**。**这就是该帖给出的全部规模信息：3B，窄工具使用任务。**

> **⚠️ 同名概念必须区分**：该帖的 **RULER = Relative Universal LLM-Elicited Rewards**，是 ART 训练流程中的**奖励构造机制**。学界另有**同名但完全不同**的论文 **《RULER: Instance-aware Rubric Rewards for SVG Generation》**，讨论 SVG 生成任务的实例化评分量规奖励，**与本文对象毫无关系**。**本文只讨论前者**；且**该缩写并非唯一**，检索时须**连同英文全称或 ART／OpenPipe 关键词**，否则极易混淆。

## 二、可信度分层（本文分析）

| 该帖内容 | 证据强度 | 依据 |
|---|---|---|
| ART 的 **Client／Backend 架构**、**vLLM 推理 + Unsloth GRPO 训练**、**训练后自动加载新 LoRA checkpoint** | **有独立印证** | 来源 3 载明 ART 为 OpenPipe 开源强化学习框架、**训练服务器与客户端解耦**、**训练产出以 LoRA 检查点形式加载到推理服务**、兼容 vLLM 与 Unsloth；来源 2 描述为 **"train multi-step agents for real-world tasks using GRPO"**，topics 含 `grpo`／`lora`／`agent` |
| **RULER 免手工奖励函数、用 LLM 评判器自动打分** | **有独立印证** | 来源 3 单列"**零样本奖励（RULER）：使用 LLM 作为评判器自动打分，免去手工设计奖励函数**" |
| **GRPO 的存在与用途** | **可支撑** | 来源 2、3 均以 GRPO 为核心机制 |
| **QLoRA 类的内存收益** | **有论文支撑** | 来源 4 报告 4-bit NF4 + 双量化 + 分页优化器可在**单张 48GB GPU 微调 65B** |
| **"胜过 100 倍模型，成本与延迟只是零头"** | **仅属作者主张** | 无第三方或论文印证；**示例条件为 3B 模型学习调用 MCP 工具（窄工具使用任务）** |

**本文推论**：它不是被证明的规律，而是**"错误恰好集中在多步工具使用与流程上"这一条件下的经验观察**；**用得对的前提，是错误来源恰好落在它的适用面上。**

## 三、把选型问题翻译成六项约束（本文分析）

| # | 约束 | 对参数规模的直接影响（本文推论） |
|---|---|---|
| ① | **任务复杂度** | 单步抽取与多步工具调用（查台账→核时效→生成材料→留痕）需求不同。**步骤越多、动作空间越大，规模下限越高** |
| ② | **上下文长度需求** | 案件卷宗、合同、财报、抵押物资料**冗长且需并读**。**长上下文同时抬高训练与推理显存**，同卡下**越长可选规模越小** |
| ③ | **领域语言** | 本行文书口径、法律与押品术语、中文。**主要靠数据与 SFT 解决，不是靠堆参数**；但**中文与法律语域的基座适配度**影响下限 |
| ④ | **延迟与并发** | 一线人员实际使用。**参数越小、延迟越低、单卡并发越高**——这是该帖"成本与延迟只是零头"唯一可稳妥接受的部分 |
| ⑤ | **部署与显存约束** | 私有化、行内 GPU 有限。**必须以"训练所需显存"而非"推理所需显存"为准**——两者差 4 到 8 倍 |
| ⑥ | **治理与可审计** | **微调产物是模型制品**，血缘（基座版本、数据、超参、评测）须可留存、可披露、可回退 |

**三条要点**：**其一**，②④⑤互相拉扯——**上下文长、延迟低、显存省不可能同时最优，规模是这三者的解**。**其二**，③⑥与规模几乎无关，**不应成为抬高规模的借口**。**其三**，①是唯一真正决定规模下限的约束。

**与上一篇的衔接**：在《资产保全智能体：该微调基座还是只做 Harness 工程？》中，本文作者已把资产保全任务分为**流程／工具型、文书／口径型、窄分类型、经验判断型**四类，并论证**微调与 harness 是叠加而非替代**、**harness 变更可回退而微调产物无法"未训练"回去**。**本文是该篇续篇**：上一篇回答**"要不要微调"**，本文回答**"若微调，基座选多大"**，故第一步接用那篇分型。

## 四、规模与显存的实证档位（据来源 4、6，标注性质）

**QLoRA 一手档位**：据 **arXiv:2305.14314（NeurIPS 2023，一手；论文自身报告、未经独立复现）**，该工作**把显存降到足以在单张 48GB GPU 上微调 65B 模型，同时保持完整的 16-bit 微调任务性能**；做法是**让梯度穿过冻结的 4-bit 量化模型反向传播进 Low Rank Adapters**，三项创新为 **(a) 4-bit NormalFloat（NF4）；(b) 双量化；(c) 分页优化器**。结果：**最佳模型族 Guanaco 在 Vicuna 基准上超过此前所有公开释放模型，达到 ChatGPT 性能的 99.3%**，**微调只需单张 GPU 的 24 小时**；团队**用 QLoRA 微调了 1000 多个模型**，覆盖 8 个指令数据集、LLaMA 与 T5、以及**常规微调不可行的 33B 与 65B**。

**商业指南档位**（**来源 6，二手，含推销性质；型号推荐不作为本文结论**）：

| 方法档位 | 该指南给出的档位 | 本文提取的通用关系 |
|---|---|---|
| **QLoRA，7B–13B** | **桌面单卡**（该指南举 4090／5090 一类） | **最小可行档**：桌面级即可起步 |
| **QLoRA，34B–70B** | **96GB 级单卡或 A100 80GB** | **中等档**：需 80–96GB 级单卡 |
| **全参微调** | H100／H200 加 NVLink，**通常租用** | **高档**：进入多卡机房范畴 |
| **100B+ 预训练** | B200 集群 | 不在本文讨论范围 |

该指南另给出**每十亿参数 QLoRA 约 0.5GB、全参微调约 16GB**的经验值（据此它称 7B 的 QLoRA 约 12GB、全参约 112GB；70B 的 QLoRA 约 48GB、全参超 700GB）。**均为该商业网站口径，未独立验证。**

**该指南最该记住的一句：「训练不是推理」。** 跑模型时 GPU 只装**权重**；训练要同时装**权重、梯度（每权重一个）、优化器状态（Adam 每权重再两个）、前向激活**，该指南给的倍数是**内存需求被推高到推理的 4 到 8 倍**。它举的例子是：**某团队买 4090 微调 70B，第一步没跑完就爆了显存**——而**同一张卡跑同一模型的推理毫无问题**（**据该商业网站指南，二手；本文只引用此通用关系，不引用其型号推荐**）。

**本文推论**：若按"推理能跑多大"规划微调，**必然在第一步撞墙**；正确口径是训练态显存。**QLoRA 之所以把可达规模推高，正因它把权重压到 4-bit、并把梯度与优化器状态限制在很小的适配器上。**

## 五、不要按榜单选规模（据来源 5）

据 **arXiv:2604.17187 摘要（预印本，一手；论文自身报告、未经独立复现）**：该文在 **NVIDIA GH200 576GB** 上，就**一个多文件 React Native 应用生成任务**评测五个开放权重编码模型——**Kimi-K2.5（Q3 与 Q4）、GLM-5.1、Qwen3-Coder-480B、DeepSeek-V3.2**，任务规定**身份认证、按用户按日计数、Web 兼容性**，标准是**能否开箱即用与功能正确**。核心发现是 **"SWE-Bench rankings do not predict task performance"**：**采用激进 3-bit 量化的 Kimi-K2.5（UD-Q3_K_XL，480GB）产出最完整、最符合规格的输出，排名超过 SWE-Bench Pro 分数高得多的模型**。该文另记录三条部署发现（**`temperature=0` 在推理模型架构上造成采样挂起；思考痕迹可经工具的文件路径解析器泄漏；移动 API 的 Web 适配是所测全部模型共同的训练数据缺口**），并称**效率流派（10–15B 活跃参数）以约七分之一硬件成本取得与规模流派（32–40B 活跃参数）相当的结果**。

**本文推论**：**榜单测的是它自己的题，不是你的题**；**"更大规模"与"更低量化精度"之间并无当然胜负**；**选规模的依据应是"本行任务上的实测"，而非公开榜单**——唯一可信判据是自建评测集上的分数。

## 六、决策规则（本文分析，核心章节）

**本节全部为本文分析／推论，不是任何来源的规定。**

**① 先做任务分型。** 接用上一篇四类：**流程／工具型、文书／口径型、窄分类型、经验判断型**——分型决定该任务是否值得微调，也预示规模问题的形态。

**② 判断错误来源，据此选手段。这是本文的核心判据**——不要先问"选多大"，先问"**错误出在哪里**"：

| 错误集中在 | 应选手段 | 对规模的含义（本文推论） |
|---|---|---|
| **格式／口径** | **小模型 + SFT／Skills 即可** | **不必加参数**；靠数据与约束收口，加参数是浪费 |
| **多步工具使用与流程** | **RFT（GRPO）在小模型上收益最大** | **这正是该帖的适用面**；规模只要足以"可靠产出结构化动作"即可 |
| **知识缺失** | **先补检索（RAG／知识库），不是加参数** | **规模与知识量无关**；把条文与制度塞进权重是错误路径 |
| **经验判断**（该不该诉、能否和解） | **不该交给微调，人工保留** | **无规模可谈**：不可回退、不可归因 |

**本文推论**：该帖那套方法的适用面**恰好只是第二行**。若错误主要落在第一、三行，**先做的不是选规模，而是补数据与补检索**；落在第四行的，**任何规模都不该接手**。

**③ 定能力下限。** 先确认"**可靠的多步工具调用**"是否必需。若必需（如同时查台账、核时效、调押品信息、生成材料并留痕），**规模不能过小**——多步任务的复合成功率是各步的乘积，**单步 95% 的可靠性，五步之后只剩约 77%**（**本文算术推论，非来源数据**）；若只是单步抽取或分类，下限可以很低。

**④ 定起点并留出升级路径。以下区间均为本文基于第四、五节档位关系所作的推论，不是任何来源的规定值，也不是行业标准。**

| 本文推论的起点 | 依据与限定 |
|---|---|
| **先取"具备可靠多步工具调用能力的最小开放权重档"作起点，并把它当下限而非目标** | 该帖示例为 **3B 窄工具使用任务**（**作者主张下的条件**）；资产保全流程更宽，**故 3B 不能直接移植为起点建议** |
| **在 7B–13B 这一档内起步试探** | 依据来源 6 通用档位：**QLoRA 7B–13B 可在桌面单卡完成**——显存门槛最低、迭代最快（**二手，含推销性质**） |
| **只在多步工具调用的实测成功率不足时才逐级上移** | 依据来源 5：**规模应由本行任务实测决定**，而非由榜单或直觉决定 |

**并且必须先做一件事**：**用免微调基线测一遍再决定**——把提示词、few-shot、工具接口与检索知识库全部接好，在自建评测集上跑出**分错误类型的基线分数**；**只有当错误被证实集中在"多步工具使用与流程"上时，微调才有理由**。**没有基线分数，就没有选规模的依据。**

**⑤ 显存与部署对齐。** 口径是**训练态而非推理态**：**7B–13B 走 QLoRA、桌面单卡级**；**34B–70B 走 QLoRA、80–96GB 级单卡**（与来源 4 的"**65B／48GB**"方向一致）；**超过 70B 需多卡加 NVLink、通常租用**。**本文推论**：**长上下文是最易被低估的变量**——它等价于**把可选规模往下压一档**。

**⑥ 治理对齐。** **其一**，微调产物是**模型制品**，须登记基座版本、数据、超参、评测与部署范围；**其二**，**harness 变更可回滚，微调产物无法"未训练"回去**，故**每次规模上移都须留下一版可回退的制品**；**其三**，评测集与错误分型口径要沉淀为**可重复资产**。（**治理定性均为本文推论，不构成监管要求或合规意见。**）

## FAQ

**Q1：那个帖说"小模型微调后能胜过 100 倍大的模型"，能照此定规模吗？**

A1：**不能。** 该说法是**个人社交媒体技术文章中的作者主张**，**非行业定论、非普遍规律**；其**示例条件是把 3B 模型训练到会调用某个 MCP 服务器**，属**窄工具使用任务**。**本文推论**：可借鉴"**错误集中在多步工具使用与流程时，RFT 在小模型上收益最大**"这一适用面，但**不能把倍数移植到资产保全全流程**——**规模须由本行评测集的实测决定**。

**Q2：那资产保全智能体到底该从多大的基座起步？**

A2：**任何来源都没有规定具体数字，以下为本文推论。** 本文主张：**先取"具备可靠多步工具调用能力的最小开放权重档"作起点，并把它当下限而非目标**；若要一个便于落地的试探区间，**本文推论可在 7B–13B 档内起步**——依据是来源 6 的通用档位"**QLoRA 7B–13B 可在桌面单卡完成**"（**二手，含推销性质，型号推荐不作为本文结论**）；**只有实测显示多步工具调用成功率不足时才逐级上移**，**且必须先跑免微调基线**。

**Q3：训练用哪张卡，能按"推理能跑多大"来配吗？**

A3：**不能——训练不是推理。** 跑模型时 GPU 只装权重；训练还要同时装**梯度、优化器状态与激活**，来源 6 给出的倍数是**内存需求被推高到 4 到 8 倍**，并举例**某团队买 4090 微调 70B、第一步就爆显存**（**据该商业网站指南，二手；型号推荐不作为本文结论**）。**本文推论**：容量规划口径必须是**训练态显存**；QLoRA 之所以推高可达规模，**正因它把权重压到 4-bit、并把梯度与优化器状态限制在很小的适配器上**。

**Q4：RULER 是不是就是那篇 SVG 生成的论文？**

A4：**不是，两者同名但完全不同。** 本文讨论的 **RULER = Relative Universal LLM-Elicited Rewards（相对通用 LLM 诱导奖励）**，是 **ART 训练流程中"用 LLM-as-judge 对多条轨迹排名、产生相对奖励"的机制**（**据该帖；来源 3 以"零样本奖励（RULER）：使用 LLM 作为评判器自动打分"独立印证**）。学界另有**同名论文《RULER: Instance-aware Rubric Rewards for SVG Generation》**，研究**SVG 生成任务的实例化评分量规奖励，与本文对象无关**。**本文只讨论前者**；**该缩写并非唯一**，检索时须**连同英文全称或 ART／OpenPipe 关键词**。

**Q5：为什么不能按公开榜单挑规模、挑模型？**

A5：据 **arXiv:2604.17187 摘要（预印本，一手；未经独立复现）**，该文在 **NVIDIA GH200 576GB** 上就一个多文件 React Native 应用生成任务评测五个开放权重编码模型，发现 **"SWE-Bench rankings do not predict task performance"**，**激进 3-bit 量化的 Kimi-K2.5（480GB）产出最完整、最符合规格的输出，排名超过 SWE-Bench Pro 分数高得多的模型**。**本文推论**：**选规模的依据应是"本行任务上的实测"，而非公开榜单。**

## 事实来源

1. **《How to Fine-Tune LLMs in 2026》（@akshay_pachaar，X 长文，个人技术文章）**：30–40% 出错率且不会从错误中学习；"胜过 **100 倍**大模型"的**作者主张**；SFT 与 RFT 的教科书／在职训练类比；GRPO 四步与"只需相对排名"；ART 的 Client／Backend 架构（**vLLM 推理 + Unsloth 驱动的 GRPO 训练**、**每步训练后新 LoRA checkpoint 自动载入推理服务**）；**RULER** 的两个洞见与三步流程；示例为**训练 3B 模型掌握任意 MCP 服务器**；集成 **LangGraph／CrewAI／ADK**。**性质：个人社交媒体技术文章，非同行评议、非机构发布；主张系作者观点或其示例条件下的结论；浏览量与点赞数为时点快照。**
2. **`OpenPipe/ART` GitHub 仓库元数据（GitHub API，客观元数据，时点快照）**：描述含 **"train multi-step agents for real-world tasks using GRPO"**；主语言 **Python**；许可证 **Apache-2.0**；**stars 10,778、forks 997、开放 issue 173、subscribers 68**；创建 **2025-03-10**、最近更新与推送 **2026-09-27**、未归档；topics 含 `grpo`／`lora`／`agent`／`reinforcement-learning`／`qwen3`。
3. **ART 项目条目（AI 原生全景图，第三方项目目录，二手）**：ART 为 **OpenPipe 出品的开源强化学习训练框架**；**训练服务器与客户端解耦**；**零样本奖励（RULER）：使用 LLM 作为评判器自动打分，免去手工设计奖励函数**；**GRPO 训练循环**；兼容 **vLLM、Unsloth**；**训练产出以 LoRA 检查点形式加载到推理服务**。**第三方目录口径，未独立验证。**
4. **QLoRA（arXiv:2305.14314，NeurIPS 2023，论文摘要，一手）**：**单张 48GB GPU 微调 65B**、**保持完整 16-bit 性能**、**4-bit NF4**、**双量化**、**分页优化器**、**Guanaco 达 ChatGPT 性能水平的 99.3%**、**单张 GPU 24 小时**、**微调 1000+ 模型**、8 个指令数据集、LLaMA 与 T5、33B 与 65B。**均为论文自身报告，未经独立复现。**
5. **arXiv:2604.17187（预印本，一手）**：**NVIDIA GH200 576GB** 上就一个多文件 React Native 应用生成任务评测 **Kimi-K2.5（Q3 与 Q4）、GLM-5.1、Qwen3-Coder-480B、DeepSeek-V3.2**；**"SWE-Bench rankings do not predict task performance"**；**Kimi-K2.5 激进 3-bit 量化（UD-Q3_K_XL，480GB）产出最完整、最符合规格**；三条部署发现；**效率流派（10–15B 活跃参数）以约七分之一硬件成本取得与规模流派（32–40B 活跃参数）相当的结果**。**均为论文自身报告，未独立复现。**
6. **《Best GPUs for AI Training & Fine-Tuning (2026 Guide)》（商业网站指南，二手，含营销与推销性质）**：**"Training is not inference"** 与 **4 到 8 倍**内存倍数；**买 4090 微调 70B 第一步爆显存**的举例；**QLoRA 7B–13B → 桌面单卡**、**34B–70B → 96GB 单卡或 A100 80GB**、**全参微调 → H100／H200（通常租用）**、**100B+ → B200 集群**；每十亿参数 **QLoRA 约 0.5GB／全参约 16GB**。**该指南自称信息性内容、非投资建议；其型号推荐不作为本文结论，本文只提取通用档位关系。**

**本文推论部分（非来源表述）**：第二节分层判断；第三节六项约束、三条要点与衔接定位；第四节档位归并与训练态口径；第五节"选规模依据应是本行实测"；**第六节全部决策规则与一切具体规模数字**；第七节三种反对；第八节清单；FAQ 中标注为本文分析的部分。**本文不构成监管要求、合规意见或法律意见。**

*（内容由AI生成，仅供参考）*
