从现实出发
先听专家怎么说,再去看原始数据,尤其是那些最难解释的例外。例外往往最诚实。
一个大模型研究员重读阿伦特,思考当 AI 把“怎么做”变得越来越便宜以后,自由还需要什么。
我是 Kaiyu。我研究机器如何变得更聪明,也对一些更古老的问题抱有长久的兴趣:人如何感知、创造与思考,生命又为何如此复杂。
我主要构建多模态智能体,也探索 AI 如何帮助我们理解生命。历史、科学与哲学是我长期关注的领域。我喜欢和不同背景的人交流——许多想法正是在这样的对话中逐渐成形。

卷一 · 思考方式
先听专家怎么说,再去看原始数据,尤其是那些最难解释的例外。例外往往最诚实。
许多问题仅凭思考是难以看清的。真正动手之后,理论中含糊的地方会自然显现。
新的证据,或来自另一个学科的视角,都可能让我重新理解一个问题。改变想法并不可怕,固守错误才更麻烦。
卷二 · 长期关注
它们不是一份固定的研究计划,而是一些我长期愿意追问、也值得与不同领域的人共同思考的问题。
它能否拥有自己的品味,审视并改进创作,最终做出既出人意料又自洽的作品?
它能否把生物的结构、功能与演化联系起来,同时不把复杂的生命系统过度简化?
什么样的证据能让我们相信它真正理解了?一个哲学观念需要满足什么条件,才算真正原创?
卷三 · 近期工作
这里选了我近期的两项工作,仅介绍已经公开的信息。
2025 · 多模态预训练
我的工作重点是多模态 STEM 推理和视觉定位,涉及数据构建、模型评测与训练方法研究。
Meta 发布 Muse Spark 时,将其描述为原生多模态模型,并展示了它在推理、工具使用和视觉思维链方面的能力。
2026 · 计算机操作 × 视觉叙事
我的工作重点是多模态智能体的后训练与评测,研究它们如何理解不断变化的视觉信息、操作软件工具,并在长流程任务中保持前后一致的操作与创作。
公开资料展示了系统在计算机操作、跨应用工作流和长流程任务上的能力。Mark Zuckerberg 和 Alexandr Wang 也介绍了它如何分派任务、编写脚本并直接操作界面。
这些工作离不开团队协作。特别感谢 Xia Fei、Tao Yu、Zhiqing Sun 和 Jiahui Yu,在我刚入行时给予我许多指导;感谢我的经理 Guan Pang,以及所有一起工作的同事。你们的判断、严谨与慷慨,让这些工作成为可能。
卷四 · 博士研究
在华盛顿大学读博期间,我与放射科医生合作,从真实的临床问题出发,把专家经验转化为工具和数据,再用机器学习发现脑血管结构与功能的新线索,并由此提出下一轮问题。这个过程像一个不断滚动的闭环,每一步都引出下一步。
卷五 · 书与随笔
从书、电影与技术出发,记录那些尚没有定论、却值得反复追问的问题。第一篇,从阿伦特关于劳动与自由的区分开始。