研究计划

Semantic ID 上的 Reasoning

71 篇 2025–2026 论文:区分显式 CoT、潜计算、自适应路由、过程信用、grounded 检索和 verifier 引导的 SID 解码 · 71 篇 · English ↗
范围规则。只有当中间计算、外部证据、奖励或搜索真正改变 item-token 决策时,才算 reasoning。普通 DPO、listwise alignment、模型平均和测试时参数适配已被删除。少量不输出 SID 的潜推理工作仍作为边界对照,因为它们能隔离可由 SID 系统检验的推理机制。核心问题不再只是“要不要想”,而是信用接在哪里、什么时候需要额外计算,以及怎样防止推理覆盖行为证据。
0 / 71 已读
选择规则。先从最强 non-thinking 生成器开始。SID 前缀失败时加过程信用,固定编码器漏掉复杂交互时加潜步骤,样本难度变化时加自适应路由,缺少证据时调用外部工具,beam search 过早剪枝时加入 verifier。只有收益能超过同算力基线,并足以抵消延迟、额外 token 和新失败模式时,才保留 reasoning 模块。