Andrej Karpathy

安德烈·卡帕西(Andrej Karpathy),当今人工智能、计算机视觉与大语言模型领域的顶尖科学家、技术先驱与极客教育家。

履历与成就

  • 学术背景与师承:
    • 本科 (2005–2009):就读于多伦多大学,双主修计算机科学与物理,辅修数学。最初对量子计算感兴趣,但在选修了杰弗里·辛顿(Geoffrey Hinton,“AI 教父”)的神经网络课程后,被深度学习深深吸引,转向这一小众领域。
    • 硕士 (2009–2011):不列颠哥伦比亚大学(UBC),师从 Michiel van de Panne,研究用于物理模拟人物的机器学习(模拟器中的敏捷机器人学)。
    • 博士 (2011–2015):斯坦福大学,师从李飞飞(Fei-Fei Li),专注于卷积/循环神经网络、计算机视觉与自然语言处理的交叉领域。在此期间,他设计并讲授了斯坦福大学第一门深度学习课程(CS231n),产生了巨大的学术和社会影响力。
    • 企业实习:博士期间曾在 Google(开展大规模视频特征学习)和 DeepMind(开展深度强化学习)进行研究实习。
  • OpenAI 联合创始人:两度出入 OpenAI 并担任核心科学家,深度参与了 GPT-4 等前沿大模型的研发。
  • 特斯拉前 AI 总监:领导 Tesla Autopilot 与 FSD 视觉团队,奠定了特斯拉“纯视觉(Vision-Only)”的端到端自动驾驶演进技术路线。
  • 极客教育先驱:发起“从零构建(from scratch)”系列课程,制作了 nanoGPT、llm.c(纯C语言手写GPT模型)等现象级教程,被誉为“AI 时代的首席教师”。
  • Eureka Labs 创始人:2024 年从 OpenAI 离职后创办 AI-Native 教育初创公司 Eureka Labs,致力于重塑人类与 AI 协作学习的模式。

核心心智模型与架构贡献

1. LLM Wiki 知识复利范式 (LLM Wiki Pattern)

Karpathy 是个人知识库自动化(Second Brain)的核心倡导者。他提出了 LLM Wiki Pattern:

  • 核心观点:不要耗费精力去手工分类整理笔记,这反人性且不可持续。最合理的做法是将所有碎片想法、文章、聊天记录一脑股倾倒入原始文件夹(Dump sources),由后台的大模型(LLM)充当图书管理员进行阅读、打标签、建立交叉双链并分类。知识库会通过自动建立的双链产生“利息”,形成复利增长。
  • 本 2ndBrain 库的摄取(Ingest)管道即是该模式的物理实践。
  • 关联:obsidian-second-brain

2. 机器学习初学者定律 (How Much You Do > What to Do)

针对 ML 和工程初学者的困惑,他指出 ML 是一个需要累积 10000 小时的硬核实战过程:

  • 行动高于规划:ML 初学者最容易把精力浪费在纠结“该看什么书、选什么课、用什么框架”上。
  • 能动性驱动:唯一正确的路径是选择一个你个人极其在乎的、有强能动性驱动的具体项目(无论多难),直接动手敲代码,把时间大量花在调试和数据上,长期的深耕终将形成认知突变。
  • 关联:learning-methods

3. 内嵌工作流范式 (Claude Inline Paradigm)

他敏锐地指出,以 Claude Code 为代表的终端 AI Agent 正在建立一种全新的 Inline Paradigm:

  • 核心观点:AI 不应只是孤立的外部 Chat 聊天框,而应当深度内嵌在开发者的日常工作流中(IDE、Terminal)。这需要大量的工程细节沉淀(上下文管理、工具调用链、运行自愈),但一旦达到”Just works”的临界点,AI 将无缝融入日常工作,消除使用 AI 的切换感。
  • 关联:Claude-Code

Source: 2026-06-17-x-x-com-av1dlive-status-2065747876005937416-s-61(来源未公开) · 2026-06-25-x-x-com-karpathy-status-2069547676849557725-s-46(来源未公开) · 2026-06-28-xiaohongshu-xhslink-com-o-5zbC1GhDFOw(来源未公开)

4. Software 3.0 与 Agentic Engineering(2026 Sequoia AI Ascent)

Karpathy 在 2026 年 Sequoia AI Ascent 演讲中系统阐述了软件范式的演变:

Software 1.0 / 2.0 / 3.0

  • Software 1.0:人工编写代码,对计算机显式编程
  • Software 2.0:通过数据集和目标函数训练神经网络,编程变为排列数据与定义架构
  • Software 3.0:提示即编程(Prompting = Programming),context window 是杠杆,LLM 是可编程解释器

两个具体案例:

  • Open Claw 安装脚本不再是 Shell 脚本,而是一段copy-paste给agent的指令段落,由agent解析环境自行完成安装——更强大,无需写所有细节
  • MenuGen 案例:Karpathy 自己写了完整的餐厅菜单图像生成 App,但发现 Software 3.0 版本只需”把照片给 Gemini 加一句话用 Nana Banana 叠加效果”——App 本身变得多余

Source: 2026-07-06-youtube-youtu-be-96jN2OCOfLs-si--p6--F-hghVosCS(来源未公开)

Vibe Coding vs. Agentic Engineering

  • Vibe Coding:提升所有人能做的事情的底线(floor),让非专业人员也能构建软件
  • Agentic Engineering:在 Vibe Coding 基础上维持专业软件的质量标准(quality bar)——不允许引入漏洞,仍然对软件负责,但同时提速

Agentic Engineering 是一门真正的工程学科:协调”尖锐、随机但极其强大”的 AI agent,在不牺牲质量标准的前提下加速交付。人类仍需掌握:品味(Taste)、判断(Judgment)、规格(Spec)设计与顶层监督。

详见:agentic-engineering

当代程序员与代码的三种交互方式

在被问及 AI 编程时代程序员的分化时,Karpathy 将当前开发者与代码的关系归纳为三大类:

  1. 完全拒绝 LLM:从零手写一切代码,不使用任何模型辅助——一部分人出于习惯或信任问题,仍完整地自己完成从设计到实现的每一步。
  2. 中间派(Karpathy 自称所在的类别):仍然自己手写大量代码,但会使用当前模型提供的自动补全(autocomplete)能力加速;关键是自己仍然是所写内容的”架构师(architect)“,对每一行代码的设计决策保持主导权。
  3. Vibe Coding / Agent 派:直接向模型下达”请实现这个或那个”的指令,让模型全权完成,自己只做审阅与方向把控。

核心判断标准是”学会工具的能力边界”:这三类都是可用的工具,用户必须清楚每种模式擅长什么、不擅长什么。Agent 模式在特定场景下(如样板代码/copy-paste 式重复劳动,或互联网训练语料中出现频率极高的常见任务)效果拔群,因为这类任务在模型训练集中有大量同类样本可供模仿;但在需要深度架构判断或训练数据稀疏的新颖问题上,Agent 模式的可靠性会显著下降,这也是”中间派”策略仍然有其存在合理性的原因。

Source: 2026-07-19-xiaohongshu-xhslink-com-o-1FheclqlQCA(来源未公开)

LLMs as Ghosts(非动物)

  • LLM 不是动物智能,而是统计概率实体(“鬼魂”):被召唤出来,由数据和奖励函数塑造,没有内在动机、好奇心或情感驱动
  • 这意味着:骂它们/鼓励它们不会让它们工作得更好或更差,要像使用工具一样理性对待
  • Jagged Intelligence(锯齿智能):能力极度不均,由 verifiability(可验证性)决定——RL 环境越充分的领域越强(如数学、代码),相反则弱(如空间常识:“50米外去洗车,该走路还是开车?“最先进模型依然会回答走路)

详见:agentic-engineering

”你可以外包思考,但不能外包理解”

Karpathy 引用了一条令他深思的推文:“You can outsource your thinking but you can’t outsource your understanding”——理解仍然是人类的瓶颈,agent 做的越多,理解就越成为稀缺资源,也越成为整个系统的导向与指挥核心。

Agent-Native World

  • 文档应该是给agent的指令段落,而非给人读的教程
  • 世界应该以”传感器(Sensors)+ 执行器(Actuators)“的方式重写,而非沿用为人类设计的界面
  • 雇佣考核范式也应重构:不再是给谜题,而是给一个大型项目(如:部署一个Twitter clone,用10个codex实例尝试攻破它)

5. Karpathy 学习方法论(Zero to Hero 哲学)

Project-First(先做再学)

核心哲学:“先做,做到卡住,再学刚好需要的东西”,而不是泛泛地系统学习。遇到瓶颈时才针对性地看论文/视频,避免”教育性娱乐”的陷阱。

Depth-First(深度优先)

不要 breadthwise,要 depthwise——不要同时学很多概念,而是把一个点彻底打通(能给别人讲清楚),再切换到下一个主题。

Zero-to-Hero From-Scratch 编码

著名课程 Neural Networks: Zero to Hero 的核心哲学:

  1. 手写 micrograd(几十行的微分引擎)
  2. 手写 makemore(字符级语言模型)
  3. 手写完整 Transformer / GPT

一遍从零手写,比十遍看视频有效得多。

学习应该像”在健身房认真训练”

Karpathy 明确指出:学习不应该是”fun”,应该有”effort”的感觉——像在健身房认真训练,而不是看10分钟Tik Tok教程。很多YouTube/TikTok的”教育内容”只是娱乐,“距离追剧没有本质区别”(epsilon away from The Bachelorette)。

用AI辅助但关键步骤自己做

  • 让AI解释概念、生成练习题、对比理解
  • 推导、实现、调试必须自己完成

6个月具体路线

  • Month 1-2:基础(micrograd/makemore,自写 forward + backward)
  • Month 3-4:Transformer/GPT(手写完整结构,理解每个模块)
  • Month 5-6:实战项目(训练小语言模型或RAG系统,有完整仓库+文档)

Source: 2026-07-06-youtube-www-youtube-com-watch-v-S5Jr8-f_GAM(来源未公开)

6. AI Agent 需要十年

Karpathy 在 OpenAI 时期曾将 RL agents 从游戏(Montezuma’s Revenge)转向使用真实工具(键盘、鼠标),项目名称”Rolled of Bits”,但当时技术尚未成熟。他指出:真正可用的 AI Agent 需要十年积累,不是炒作的 2-3 年时间表——就像自动驾驶一样,demo 容易、产品难。

他也提到:当时正确的做法反而是”暂时忘掉AI agents,先构建语言模型”——5年后语言模型成熟,再回来做Agent,工具已经完全不同了。

Source: 2026-07-06-xiaohongshu-xhslink-com-o-5kwUYCW7Jp9(来源未公开)

7. 大模型入门导论与 LLM OS (2023 Intro to Large Language Models)

Source: 2026-07-09-youtube-youtu-be-zjkBMFhNj_g-si-HS85kcLlHQ9XCq__(来源未公开)

在 2023 年发布的 1 小时经典大众科普视频中,Karpathy 奠定了后来的两阶段训练(预训练 vs 微调)和以自然语言为纽带的系统化工具调用的框架基石:

  • 两阶段奠基科普:通俗直观地定义了大模型在物理磁盘上其实就只有参数权重和运行代码两个文件(以 Llama 2 70B 为例,即 140GB float16 权重参数与 500 行无依赖 C 语言运行代码),并系统科普了预训练(有损压缩、文档生成器、网页梦境)与微调(ALIGN/助理化、引导梦境)的根本差异。
  • LLM OS 隐喻 the 提出:首次系统化提出“不要将大模型仅当作 Chatbot,而是新兴操作系统的内核进程 (Kernel Process)”的观点。上下文窗口对应 CPU 缓存/RAM,外接文件与网络搜索对应 Disk,而计算器、网页浏览器与 Python 运行环境则是外设和协处理器。详见:llm-os。
  • LLM 安全攻防概括:首次在科普层面总结了新兴 LLM 计算栈所面临的安全威胁:越狱攻击(角色扮演、Base64 转码、数学对抗后缀)、提示注入(网页隐藏白字劫持数据外流)以及数据投毒/后门。详见:llm-security。

8. Deep Dive into LLMs 完整大课 (2025)

Source: 2026-07-07-youtube-youtu-be-7xTGNNLPyMI-si-ZPGPZ7stiJFSTiNJ(来源未公开)

3.5小时的完整 LLM 技术讲解(面向大众),覆盖完整训练栈与”心理学”心智模型。核心观点摘要:

  • 模型需要 token 来思考:LLM 没有独立于 token 流的内部工作内存。允许 CoT = 给它空间推理。
  • Tokenization(BPE):文本→字节对编码→token ID 序列,GPT-4 词汇表~10万token。“strawberry”字母计数错误的根本原因。
  • 锯齿状智能(Jagged Intelligence):模型能力像瑞士奶酪,孔的位置不可预测。9.11 vs 9.9 的神经元激活被圣经章节模式干扰。
  • 幻觉根本原因:模型被训练为”续写得合理”而非”说真话”。真实性是后续阶段的任务。
  • 模型需要 Token 来思考:每个 token = 一次前向传播 = 固定计算量。复杂任务需要 Chain of Thought 分布到多个 token。
  • 自我认知的缺失:Base model 没有关于自身的可靠知识,每次对话都是全新启动,没有持续的自我。
  • 推理模型 vs SFT 模型:SFT 模仿专家解答,RL 让模型自己通过试错发现策略,产生可见的”思考轨迹”(DeepSeek-R1、o1)。

推荐工具(视频中演示):Tiktokenizer、bbycroft LLM 3D 可视化、Hyperbolic(Base Model)、LM Arena、LM Studio(本地推理)、AI News Newsletter

详细流水线见:llm-training-pipeline

9. 模型思考与强化学习第一性原理 (2025 Deep Dive into LLMs)

Source: 2026-07-07-youtube-youtu-be-7xTGNNLPyMI-si-ZPGPZ7stiJFSTiNJ(来源未公开)

在 2025 年的 3.5 小时 LLM 深潜大课中,Karpathy 针对推理时计算(Test-Time Compute)和强化学习本质发表了第一性原理的深刻见解:

1. 模型需要 Token 来思考 (Models need tokens to think)

  • 前向传播计算量的物理局限:在 Transformer 中,模型每输出一个 Token,所经历的前向传播层数和 FLOPs 计算量是完全固定且恒定不变的。
  • 荒谬的单次直答:强迫模型在一眨眼的单次前向传播中解决不同难度的数学或编程题,就像强迫人类在 0.1 秒内脱口而出世界难题的答案,这必然导致高概率的逻辑崩溃与胡言乱语(Hallucinations)。
  • 以空间换时间:模型必须在输出最终答案前产生大量中间思考 Token(CoT 过程)。生成的每个 Thinking Token 都是一次向神经网络注入新 FLOPs 计算量的时间片。模型正是通过拉长 Token 序列,在空间上换取了实际运行复杂逻辑所需的“时间”。

2. 为什么说 RLHF 算不上真正的强化学习 (RL)?

Karpathy 认为,目前的 RLHF 在算法本质和物理机制上,实际上只是一种取巧的**“间接套利与风格对齐游戏 (Cheat/Indirection)”**,无法通往真正的逻辑进化:

  • 模拟人类偏好的“作弊”:在“不可验证领域”(如写诗、总结、写笑话),如果要在每一轮 rollout 里直接让人类对 joke 打分,累积 10 亿次评估是不可能的。因此我们训练了一个神经网络来当做人类偏好模拟器(Reward Model, RM),然后让模型针对这个模拟器去跑 RL。
  • 致命的奖励劫持 (Reward Hacking):因为 RM 本身是个存在漏洞的神经网络,Policy 模型会本能地通过写出极度冗长、满嘴官腔、辞藻华丽但空洞无物的 Token 序列来获取 RM 高评分,发生严重的 Reward Hacking。这并非在探索物理世界的客观逻辑,只是模型在自我封闭空间里“欺骗 RM”。
  • 优化天花板与崩坏:没有客观物理校验器的强约束,RLHF 运行 PPO 只要超过几十至几百步,模型参数就会崩坏。因此它只适合调整模型的表达风格(vibe),不能用于培养推理智商。

3. 真正的强化学习 (True RL: AlphaGo & DeepSeek-R1)

  • 运行于可验证领域 (Verifiable Domains):在数学(有黄金标准真值)和编程(有编译器和 Test Cases)中,环境提供钢性的物理校验。模型无法通过取悦或欺骗编译器来作弊。
  • 不受人类表现约束 (Not constrained by Human Limits):类似于 AlphaGo 通过自我博弈探索胜率,DeepSeek-R1 通过纯 RL 自主演进,模型可以跑成千上万步强化更新,直到彻底摸索出正确的推理路径,从而自主涌现出长序列思考轨迹和“Aha Moment(自动纠错)”,这才是真正 RL 的技术终局。

10. Karpathy 的实用日常系统 (Practical Systems)

Source: 2026-07-07-article-karpathy-bearblog-dev-the-append-and-review-note(来源未公开) · 2026-07-07-note-Karpathy-s-practical-systems-for-project-management--time-ma(来源未公开)

安德烈·卡帕西极其崇尚极简主义与降低认知开销(Cognitive Overhead),他多年来总结并使用了一套切实有效的个人效率系统:

1. 追加与审阅笔记 (Append-and-Review Note)

他唯一的笔记系统,拒绝多层级分类和文件夹,仅在 Apple Notes 中维护一个名为 notes 的单文本文件:

  • 顶部追加:任何 TODO、灵感、临时数据、待看书单全部无摩擦地追加在最顶部,实现即时大脑内存卸载(Wipe working memory)。
  • 重力下沉:不重要的信息像在重力作用下一位向底部沉淀,自然淡出视野中心,但可通过 CTRL+F 随时调出。
  • 向上打捞:定期向下滚动审阅(Skimming),将依然有价值的旧想法或待办事项通过复制粘贴重新打捞到最顶部,顺手合并相同题材。
  • 详见:append-and-review-approach

2. 记忆与防忘机制 (Retention & Active Recall)

  • 主动重构 > 被动阅读:阅读不等于掌握。合上书本,尝试自己去推导公式、手写证明或者从零手写代码(费曼学习法)。
  • 多晚睡眠巩固:倾向于提前几天拆开学习,利用多晚的充足睡眠让大脑在睡眠阶段自发整理神经连接,拒绝熬夜突击。
  • 用项目实施记忆:在解决实际项目的 Bug 过程中巩固理解,通过教别人或写技术博客来产生好感受复利。

3. 时间量化与深潜 (Time Management & Deep Work)

  • 量化自我的按键记录:曾自研 ulogme 软件追踪自己的击键次数和活跃窗口,从而发现:在超高强度编程的一天中,真正高浓度的深度代码工作(Deep Work)通常只有 5-6 小时;高效的一天必然伴随着编辑器里密集的击键事件。
  • 深潜如同力量训练:真正的学习和思考必须感到费力(Effortful),就像在健身房进行大重量硬拉。警惕只有 10 分钟的消遣性“浅层知识消费”。

4. 敏捷项目管理 (Project Management Style)

  • 与数据合二为一:做神经网络开发或复杂系统时,第一步不是构思宏大模型,而是先肉身去读几百条数据,感受细节(Become one with the data first)。
  • 拒绝过度规划 (No Over-Planning):不要花几周去搜寻所谓完美的路线图。挑选一个可以跑通的极简版先做起来,遇到真实的阻碍再在解决问题中按需学习。
  • 小 scope,高所有权:选择可以快速交付、自己完全掌控的小项目,快速产出反馈以建立冲劲。

Section 9: Practical LLM Workflows (How I Use LLMs)

Source: 2026-07-08-youtube-youtu-be-EWvNQjAaOHw-si-oLcPJqb7pNhotAty(来源未公开)

Andrej Karpathy 在 2025 年的视频《How I use LLMs》中,从极其务实且第一性原理的角度,系统地分享了他个人在日常工作与学习中如何高效与大语言模型协作。他将这套方法论抽象为一系列实用的 LLM 工作流规范与心智模型:

1. 上下文窗口作为“工作记忆” (Working Memory)

  • 工作记忆的本质:上下文窗口(Context Window)在交互中等同于 LLM 的工作记忆。我们与 LLM 的每一次对话,都是在不断往一个一维 Token 序列中追加内容。
  • 计算磨损与心智分散危害:在同一个对话中堆积过多不相关的 Token 会带来两大弊端:
    1. 注意力分心:LLM 每次计算下一个 Token 都是在对整个上下文进行注意力计算。过多的多余 Token(尤其是切换主题时的历史记录)会显著干扰模型的聚焦能力,导致其在新任务上的准确率下降,极易发生“分心”。
    2. 计算磨损与开销:随着上下文膨胀,模型前向传播生成 Token 的计算开销增大,不仅会拖慢响应速度,还会徒增计算成本。
  • “New Chat”的必要性:Andrej 强烈建议,一旦切换讨论的主题,务必点击 “New Chat” 彻底擦除上下文窗口,将工作记忆重置为零,以保持模型的高响应速度与最高注意力集中度。

2. 思考模型 (Thinking Models) 的合理使用与冗余性

  • 高难任务的推理优势:经过强化学习(RL)微调的思考模型(如 OpenAI 的 o1/o3 家族、DeepSeek-R1、Claude 3.7 Sonnet 思考模式等)在数学、高级编程(如复杂的 bug 排查)等“可验证领域”(Verifiable Domains)优势巨大。它们会通过生成长序列的“思考 Token”来拉长推理链(类似人类的内部独白,包括回溯、假设重构等),在空间上换取所需的 FLOPs 推理计算量,从而显著提升解答准确率。
  • 简单任务的冗余性:对于闲聊、写 Haiku、查阅常见常识、或者做简单的旅行规划等任务,思考模型是完全冗余的。它不仅不会带来明显的质量提升,反而会让你不得不白白等待长达几分钟的思考链生成,耗费时间和算力。
  • 最佳实践:默认使用普通且响应迅速的 SFT 基础模型,当发现其回答不够理想,或者面临数学、编程算法、复杂逻辑推理等难题时,再主动切换为思考模型。

3. 联网搜索 (Tool Use) 的时效性与原理

  • 工作原理:LLM 本质上是一个被压缩了的、有知识截止日期(Knowledge Cutoff)的概率性静态“zip 压缩包”。为了解决实时性问题,可以通过特定的工具调用 (Tool Use) 机制——当 LLM 评估问题需要近期数据或小众常识时,它会输出一个特殊的 “Search Token”,此时应用系统(如 Perplexity 或 ChatGPT 客户端)会暂停模型解码,去搜索引擎抓取相关网页,将抓取出的网页 raw text 直接拼入 (stuff into) 当前的 context window 转换成工作记忆,最后由 LLM 基于这些新鲜载入的信息给出回答。
  • 使用场景与工具表现:
    • 适用于时效性强(如最新发布会信息、体育赛事日程)、小众冷门(如特定领域的冷门产品评测)或易变的信息。
    • 工具表现:
      • Perplexity:Andrej 针对搜索类查询的首选工具,长期的专业搜索集成使其体验最为连贯。
      • Gemini 2.0 Flash:对搜索支持良好,能够附带清晰的 sources 和 related content。
      • Claude:部分型号(如当时的 Claude 3.5 Sonnet)可能在网页端缺乏直接默认的联网搜索,需要注意 Knowledge Cutoff。

4. 深度搜索机制 (Deep Research)

  • 自主研究的定义:Deep Research 是将互联网搜索与强化学习推理深度结合的长时间运行机制。
  • 工作流:它不再只执行一次简单的 Google 搜索并总结,而是自主发起多轮检索、访问数十个网页及论文文档,在内部进行长考与事实校验,最终输出一篇带有完整引用的定制化详尽研究报告(Custom Research Report)。
  • 应用案例与局限:
    • 场景:适用于复杂的对比分析(如 Brave 与 Arc 浏览器的隐私对比)、多维表格汇总(如美国 AI 实验室估值与资金表,虽然数据需要人工校验防止微小错误)以及长期的科学调研。
    • 局限:依然存在幻觉(Hallucinations)的可能,生成的表格数据可能存在偏差或遗漏(例如遗漏了 xAI 等关键实体)。应当将其视作“初稿”和“文献索引”,绝不可盲信,必须通过附带的引用(Citations)亲自校验数据源。

5. 编程中的 Composer 与 Artifacts 角色

  • Cursor Composer 的 Vibe Coding 范式:
    • Karpathy 极少去网页端复制粘贴代码片段,而是使用本地 IDE(如 Cursor、Windsurf)的 Composer(或 Agent 代理)功能。
    • 原理:Composer 拥有本地项目的全部文件上下文(Code context),能够直接跨文件修改代码、安装依赖、调用终端命令甚至自我调试。
    • Vibe Coding(氛围编程 / 躺平编程):在这一新范式下,开发者扮演“产品经理/监督者”的角色,通过高层次自然语言指令让 AI 负责具体的底层实现,只有在遇到致命死锁时才人工介入代码微调。这极大地解放了开发者的底层劳动力,让实现效率从“写代码”升维到“审阅代码”与“架构把控”,也奠定了智能体工程 (Agentic Engineering)的雏形。
  • Claude Artifacts 的角色:
    • 即时交互式 App:可以在网页端迅速将 LLM 编写的 React/HTML/CSS 代码渲染成可交互的 Web App(例如即时生成一个测试背诵的 Flashcards 练习工具),提供免部署的轻量原型验证。
    • 概念图生成:Andrej 经常使用 Artifacts 配合 Mermaid 语法将书籍的复杂章节(如亚当·斯密的《国富论》第三章)生成概念图 (Conceptual Diagram)。这非常适合视觉思考者,通过空间树状结构一目然地解构论点逻辑。

6. RAG(检索增强生成)在大模型时代的基石作用

  • 不要单打独斗 (Don’t read books alone):大模型参数对知识的存储是模糊且概率性的(Lossy and Probabilistic)。RAG(或RAG优化相关实践)在当今时代依然是无可替代的基石。在内存(参数记忆)与检索(外部文档)之间寻求混合模式(Hybrid Mode)才是正确之选。
  • 手拉手共读:Andrej 分享了他与 LLM 共同阅读书籍或复杂 PDF 论文(如 Arc Institute 的基因语言模型 Evo 2 论文)的范式——直接将 30MB 左右的 PDF 或 Project Gutenberg 中的书籍章节拖入 Context Window。依靠强大的上下文填充,让 LLM 在工作记忆中完全拥有这篇文献,然后手拉手(hand-in-hand)进行问答、概念剖析和细节追问。这能够大幅提高读者对深奥、陌生领域文献的吸收效率与留存率(Retention)。

7. 语音交互流:Fake Audio 与 True Audio (Omni) 的本质区别

  • Fake Audio(转译预处理模式):
    • 早期或大部分网页端采用的“语音输入”其实是三阶段的拼凑:音频 -> 语音转文字(STT) -> LLM文本生成 -> 文字转语音(TTS) -> 播放。这种模式延迟高、丢失全部语气和情感细节。
    • Mac 效率流:Andrej 在 Mac 桌面端极少使用客户端自带的录音,而是使用全局热键(如 F5)触发系统级的 STT 工具(如 Super Whisper、MacWhisper 等本地轻量 Whisper 包装),直接在输入框中语音转写,免除键盘录入的物理瓶颈。
  • True Audio(Omni 原生多模态):
    • 原理:将音频声谱图(Spectrogram)在时间窗口上切片,并量化为原生的音频 Token。LLM 直接对文本 Token 和音频 Token 的混合流进行统一的 Autoregressive 下一个 Token 预测。
    • 高级语音模式 (Advanced Voice Mode):因为直接预测音频 Token,模型能实时听到并输出情绪、语调、甚至模仿特定的口吻(如 Yoda 尤达大师、Pirate 海盗语气)。
    • Refusal(拒绝)边界:在实操中,原生语音模型仍有极强的人造安全护栏(Refusal)。Andrej 测试使其模仿牛叫成功,但让其模仿狐狸叫(Fox Yip)时,模型在音频层面强行 Refuse,表明当前 Omni 语音模型在动物/环境音拟真上有严格的安全和版权限制。

8. 图像/视频多模态:OCR 双步验证与视频流点播

  • 图像 Tokenization 原理:将图像划分为矩形网格(Grid patches),每个 Patch 编码为对应的图像 Token。模型并不区分 Token 的物理含义(文本/音频/图像),只是在统一的 Transformer 架构中建模统计规律。
  • OCR 验证工作流(OCR-first Table Verification):
    • Andrej 在上传血液检测报告(Blood Panel PDF)、Colgate 牙膏或 Longevity 补给配方表等包含关键数字的图像时,坚守“双步验证原则”。
    • 第一步:命令 LLM 仅进行文字提取并排版成表格。
    • 第二步:用肉眼人工校验表格中的数字(如胆固醇数值、配方毫克数)是否与原图完全一致,排除幻觉。校验无误后,再基于该表格进行第二轮解释性追问。
    • 快捷技巧:利用 macOS 快捷键 Ctrl + Shift + Cmd + 4 截取屏幕局部,直接 Cmd + V 粘贴进 Chat 窗口,实现最低摩擦的屏幕多模态交互。
  • 视频实时点拨(Point-and-talk):手机端 Advanced Voice 支持调用摄像头,AI 能在秒级内获取画面帧并结合语音流实现多模态交互(如直接认出书架上的《成吉思汗》和费曼传记,并读出 CO2 仪器上的 PPM 数值)。

9. 提效小品:消除 HR Tone 与 Few-shot XML 结构化 GPT

  • 消除 HR Tone 的自定义指令 (Custom Instructions):
    • Andrej 极度排斥大模型泛滥的“HR / 公关腔调”(冗长、客套、免责声明)。他在全局自定义指令中写入:“Don't be like an HR business partner. Talk to me normally. Give me direct explanations and educational insights.”(不要像 HR 那样废话,用正常人的方式说话,注重教育性和直截了当的洞察)。
  • Few-shot XML 结构设计(Custom GPTs 范式):
    • 自定义 GPTs 的本质是“节省 Prompt 输入时间的常用快捷入口”。
    • Few-shot 的硬核写法:在 Instructions 中,Andrej 推荐使用 XML 标签 来规范 Few-shot 样本(少样本微调提示),防止 LLM 在解析中混淆输入与输出:
      <example_1>
      <input>原始韩语句子</input>
      <output>
      1. 整体翻译 ;
      2. 语法成分逐一拆解表格 ;
      3. Anki 导入格式 (Korean; English)
      </output>
      </example_1>
      这种结构化规范极大地提升了模型在繁琐转换任务(如语言翻译与 Anki 词卡制作)上的输出稳定性。

10. ASD-STE100 航空受控语言提示法 (2026-10)

  • 应对大模型阅读负担:人类正将越来越多的时间花费在阅读和消化大模型的复杂输出上。针对大模型泛滥的模糊修辞与冗长废话,卡帕西分享了他的实战秘诀:要求 LLM 使用航空航天维护手册的受控语言规范(ASD-STE100)进行解释。
  • 效果:利用 ASD-STE100“一词一义、杜绝隐喻、限制句长”的硬性工业标准,迫使大模型输出极度清晰、紧凑且无歧义的技术原子解释,极大解放人类阅读认知带宽。
  • 详见专题:asd-ste100-controlled-language-prompting。

Source: 2026-10-04-x-x-com-karpathy-status-2105819303471976479-s-46-d946432ff0.md(来源未公开)

2026 基础教育与第一性原理认知观 (Math, Physics, CS as 80% Core)

卡帕西在 2026 年深度访谈中指出:

  • 80% 基础教育应专注数学、物理与计算机:在 AI 能够轻易生成各类文案与代码的时代,人类最稀缺的能力是“第一性原理推导与严格符号逻辑能力”。数学训练逻辑严密性,物理训练对真实世界规律的抽象与建模,计算机科学(CS)则是将思维转化为可执行系统的终极创造工具;
  • AI 时代的品味与合成数据:未来的软件开发与研究将高度依赖对数据的“品味(Taste)”与合成数据的生成/过滤能力。理解底层基础学科,是避免被表层提示词技巧淘汰的根本护城河。

Source: 2026-08-20-xiaohongshu-xhslink-cn-o-9gE3bxh65Ky-2cd643756f.md(来源未公开)