|
|
高德最新开源 ABot-M0.5: 统一移动操作的世界-动作模型 青稞AI · 公众号 · AI · 1 月前 · |
|
|
OPD 的 token 加权真的合理吗?也许早期 token 才是关键,均匀加权全错了! 青稞AI · 公众号 · AI · 1 月前 · |
|
|
当异步 Agentic RL 遇到“旧策略失忆”:重新理解 Off-Policy Correctio... 青稞AI · 公众号 · AI · 1 月前 · |
|
|
从 nnScaler 到大规模训练:谈一谈对分布式训练系统边界的一些理解 青稞AI · 公众号 · AI · 1 月前 · |
|
|
直播预告!从问题构建到工程落地,聊聊如何设计一个好的自回归 VLA 青稞AI · 公众号 · AI · 1 月前 · |
|
|
ICML 2026|让 Agent 真正协同作战:GoS 为多智能体推理构建共享信念状态 青稞AI · 公众号 · AI · 1 月前 · |
|
|
ICML 2026 | 一段视频,同时听懂四道命令!OmniShow 把多模态可控视频生成整合成统一... 青稞AI · 公众号 · AI · 2 月前 · |
|
|
从 GLM/Qwen 看: Agentic RL 最新进展 青稞AI · 公众号 · AI · 2 月前 · |
|
|
On-Policy Self-Distillation:LLM利用隐式用户反馈定向纠错与持续学习 青稞AI · 公众号 · AI · 2 月前 · |
|
|
直播预告!聊聊 DPA & LLaVA-HUD v4:多模态大模型的深度预对齐与高效视觉编码优化 青稞AI · 公众号 · AI · 2 月前 · |
|
|
大模型真的会模拟人类用户吗?中科院软件所、快手推出首个真实世界全链路用户行为模拟基准 OmniBeh... 青稞AI · 公众号 · AI · 2 月前 · |
|
|
就从来没人质疑过 OPD 的 reward 设计吗?我们发现了 log 本身就是问题,也许就不该用! 青稞AI · 公众号 · AI · 2 月前 · |
|
|
Lilian Weng 最新硬核长文:万字拆解 Scaling Laws,大模型训练的“黄金法则” 青稞AI · 公众号 · AI · 2 月前 · |
|
|
【征稿通知】ECCV 2026 Workshop | 多模态大语言模型统一理解与生成(MUCG) 青稞AI · 公众号 · AI · 2 月前 · |
|
|
强化学习与流模型:Offline RL 与策略提取:多模态分布与条件均值 青稞AI · 公众号 · AI · 2 月前 · |
|
|
大模型后训练:从轨迹分布到 Fisher 约束 青稞AI · 公众号 · AI · 2 月前 · |
|
|
直播预告!大模型后训练,如何实现百万级 LoRA 策略的训练与推理? 青稞AI · 公众号 · AI · 2 月前 · |
|
|
为什么 Pretrain Loss相同,但下游任务表现却天差地别? 青稞AI · 公众号 · AI · 2 月前 · |
|
|
深入理解 Agentic RL 中的行为崩塌现象 青稞AI · 公众号 · AI · 2 月前 · |
|
|
xOPD 演进|梳理近期 OPD 的改进工作:哪些是同一个问题换说法、哪些是动了不同的模块 青稞AI · 公众号 · AI · 2 月前 · |