Kaiyu Zhang

新作读书随笔 · 《人的境况》

书籍15 分钟阅读

当劳动消失以后,我们会自由吗?

一个大模型研究员重读阿伦特,思考当 AI 把“怎么做”变得越来越便宜以后,自由还需要什么。

阅读全文

我是 Kaiyu。我研究机器如何变得更聪明,也对一些更古老的问题抱有长久的兴趣:人如何感知、创造与思考,生命又为何如此复杂。

我主要构建多模态智能体,也探索 AI 如何帮助我们理解生命。历史、科学与哲学是我长期关注的领域。我喜欢和不同背景的人交流——许多想法正是在这样的对话中逐渐成形。

Kaiyu Zhang 的肖像
图一 Kaiyu Zhang · 西雅图 / 湾区
  • 历史
  • 创造力
  • 生命
  • 哲学

卷一 · 思考方式

我的思考方式

从现实出发

先听专家怎么说,再去看原始数据,尤其是那些最难解释的例外。例外往往最诚实。

动手做,才能真正想明白

许多问题仅凭思考是难以看清的。真正动手之后,理论中含糊的地方会自然显现。

随时准备修正想法

新的证据,或来自另一个学科的视角,都可能让我重新理解一个问题。改变想法并不可怕,固守错误才更麻烦。

卷二 · 长期关注

我反复思考的几个问题

它们不是一份固定的研究计划,而是一些我长期愿意追问、也值得与不同领域的人共同思考的问题。

AI 能学会创造,而不只是模仿吗?

它能否拥有自己的品味,审视并改进创作,最终做出既出人意料又自洽的作品?

AI 能帮我们更快地理解生命吗?

它能否把生物的结构、功能与演化联系起来,同时不把复杂的生命系统过度简化?

AI 能理解哲学,甚至提出新的哲学思想吗?

什么样的证据能让我们相信它真正理解了?一个哲学观念需要满足什么条件,才算真正原创?

卷三 · 近期工作

构建多模态智能体

这里选了我近期的两项工作,仅介绍已经公开的信息。

2025 · 多模态预训练

Muse Spark 1.0

我的工作重点是多模态 STEM 推理和视觉定位,涉及数据构建、模型评测与训练方法研究。

Meta 发布 Muse Spark 时,将其描述为原生多模态模型,并展示了它在推理、工具使用和视觉思维链方面的能力。

2026 · 计算机操作 × 视觉叙事

Muse Spark 1.1 & 1.2

我的工作重点是多模态智能体的后训练与评测,研究它们如何理解不断变化的视觉信息、操作软件工具,并在长流程任务中保持前后一致的操作与创作。

公开资料展示了系统在计算机操作、跨应用工作流和长流程任务上的能力。Mark Zuckerberg 和 Alexandr Wang 也介绍了它如何分派任务、编写脚本并直接操作界面。

这些工作离不开团队协作。特别感谢 Xia Fei、Tao Yu、Zhiqing Sun 和 Jiahui Yu,在我刚入行时给予我许多指导;感谢我的经理 Guan Pang,以及所有一起工作的同事。你们的判断、严谨与慷慨,让这些工作成为可能。

卷四 · 博士研究

从临床问题到生物学发现

在华盛顿大学读博期间,我与放射科医生合作,从真实的临床问题出发,把专家经验转化为工具和数据,再用机器学习发现脑血管结构与功能的新线索,并由此提出下一轮问题。这个过程像一个不断滚动的闭环,每一步都引出下一步。

  1. 01临床问题
  2. 02临床专家工具
  3. 03结构化数据
  4. 04模型
  5. 05生物学发现
  6. 06下一轮问题

卷五 · 书与随笔

最近写下的

从书、电影与技术出发,记录那些尚没有定论、却值得反复追问的问题。第一篇,从阿伦特关于劳动与自由的区分开始。

篇幅更长的内容会放在各自的房间里,让主页始终是一张地图,而不是一座堆满文字的档案馆。