你是否想过,给AI的“私教”偷看标准答案,究竟是作弊还是神操作?为什么机器人模仿完美师傅反而会碰壁,甚至有时需要“闭着眼睛”走路?本期节目,我们将从几篇最新论文出发,揭示AI如何从模仿走向探索,以及强大的模型是如何在你的手机里实现性能飞跃的。让我们一起探寻这些AI“反常识”行为背后的智慧吧!
00:00:29 AI界的“陪练”与“私教”
00:06:33 机器人学艺,师傅领进门,修行靠自己
00:11:55 机器人为什么要“闭着眼睛”走路?
00:18:01 你的手机,为什么能越来越“聪明”?
00:22:35 高手与笨蛋的分界线,在于如何面对复杂
本期介绍的几篇论文:
[LG] Le Critique: Privileged Value Functions for LLM Reinforcement Learning
[Mistral AI]
https://arxiv.org/abs/2608.16739
---
[RO] FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
[University of California, Los Angeles & Allen Institute for AI]
https://arxiv.org/abs/2608.17027
---
[RO] Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies
[MIT & UC Berkeley]
https://arxiv.org/abs/2608.15938
---
[LG] FlashAttention for Scalable Vector Architectures
[Chalmers University of Technology & University of Glasgow]
https://arxiv.org/abs/2608.18656
---
[CV] Falcon Perception-HD: High Density Perception via Reinforcement Learning
[Technology Innovation Institute]
https://arxiv.org/abs/2608.18881