|
|
Jev社区实现思路浅尝-候选词 Logits 掩码投影(masked logit projectio... 大模型自然语言处理 · 公众号 · 大模型 · 21 小时前 · |
|
|
揭开在线策略蒸馏(OPD)的面纱:何处奏效、何处受损、原因为何 大模型自然语言处理 · 公众号 · 大模型 · 昨天 · |
|
|
并非所有分歧都可学:在线策略蒸馏中的 Token 可教性 大模型自然语言处理 · 公众号 · 大模型 · 2 天前 · |
|
|
当「Teacher更强」反而不灵:重新审视 LLM 的 On-Policy Distillation 大模型自然语言处理 · 公众号 · 大模型 · 2 周前 · |
|
|
On-policy Distillation with Verifiable Reward:用可验证... 大模型自然语言处理 · 公众号 · 大模型 · 2 周前 · |
|
|
企业知识库建设白皮书重磅发布!从文档解析到RAG落地的关键方法(附下载链接,手慢无) 大模型自然语言处理 · 公众号 · 大模型 · 3 周前 · |
|
|
Self-OPD:去掉教师机的流匹配模型 On-Policy 蒸馏 大模型自然语言处理 · 公众号 · 大模型 · 3 周前 · |
|
|
OPDSearch+:用冻结现成教师做在线策略蒸馏,再接 RL 精修检索增强推理 大模型自然语言处理 · 公众号 · 大模型 · 3 周前 · |
|
|
Open Rubric System:把奖励信号从「黑盒打分」拆成「可编辑的评分标准」 大模型自然语言处理 · 公众号 · 大模型 · 3 周前 · |
|
|
Qwen3.8-27B-DFlash2开源后面的加速技术-DFlash:用块扩散模型做「并行草稿」的... 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
Agentic-RL篇:WebThinker:让大推理模型在思考过程中自主联网深搜并即时写报告 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
Agentic-RL篇:R1-Searcher++:用强化学习激励 LLM 的动态知识获取 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
Agentic-RL篇:R1-Searcher:用强化学习把“检索”能力内化进大模型的推理过程 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
Agentic-RL篇:Search-R1:用强化学习训练 LLM 在推理中自主调用搜索引擎 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
把整个多Agent系统塞进一个模型:Chain-of-Agents 与 Agent Foundati... 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
多模态 OPD-VAD:用「证据存在 vs 移除」的反事实对比,给多模态蒸馏做「视觉归因」 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
NVIDIA Lightning OPD 2.0:当蒸馏老师 ≠ 数据生成器,如何干净地剥离文风、只... 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
· 公众号 · 大模型 · 1 月前 · |
|
|
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术思路概述 大模型自然语言处理 · 公众号 · 大模型 · 1 月前 · |
|
|
· 公众号 · 大模型 · 1 月前 · |