模型arxiv cs.CL · 4d ago重要

Learning When to Reason for Text-to-SQL via SFT and DPO

分类释义:新模型发布或升级

TL;DR

AutoThinkSQL 通过 SFT+DPO 训练,让 Qwen3-Coder-30B-A3B 能动态判断何时跳过 CoT 推理,Spider 和 BIRD 基准上保持精度同时将输出 token 减少 18-25%、延迟降低 11-17%。

关键要点

  • 01AutoThinkSQL 通过 SFT+DPO 训练
  • 02让 Qwen3-Coder-30B-A3B 能动态判断何时跳过 CoT 推理
  • 03Spider 和 BIRD 基准上保持精度同时将输出 token 减少 18-25%、延迟降低 11-17%
为什么值得关注

这个框架把「何时深度推理」的决策内化到模型权重,而非靠规则/分类器过滤。工程师可以借鉴 SFT+DPO 自适应推理的 pipeline,复用到代码生成、数学推导、Agent 多步任务等 CoT 成本高的场景,直接降低线上推理费用。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将自适应推理框架纳入技术选型,重点关注 SFT+DPO pipeline 对团队 AI 能力建设的长期价值
应用工程师在代码生成或 Agent 任务中尝试复现「自适应跳过 CoT」逻辑,观察实际 token 节省效果
运维 / 平台测算 CoT 推理成本占比,若高于 30% 则值得引入类似的自适应推理机制降低线上推理费用
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5