Vibe Coding

用自然语言做一个中文猜词游戏,
再让六个 AI 来玩它

八节课,每节约 45 分钟。不手写代码,用 coding agent 把游戏做出来,再亲手做一份模型 benchmark。

第 1 节 · 课堂试玩 中文猜词试玩页 系统暗选一个词,你每猜一个词,它告诉你两个词有多接近。先玩十分钟,带着「词怎么会有距离」这个问题回家。 第 1 节 自然语言是新的编程语言 八节课,不写一行代码,做出一个中文猜词游戏;再让六个 AI 来玩它,亲手做出一份模型 benchmark(基准测试,用同一套题比不同模型的强弱与成本)。 第 2 节 开机:怎么跟它说话 今天你发出这门课的第一段 prompt(提示词,你发给模型的那段话),让 agent(能替你执行任务的 AI 程序)做出游戏的外壳:输入框、假分数、历史列表。 第 3 节 词变成数字 今天上半节,你会在纸上算出一个分数;下半节,你的游戏开始算真分 —— 每个词都是 200 个小数,分数就是这两串数字的夹角。 第 4 节 模型内部 六个词,一页一个:token、context window、attention、pretraining、post-training、RL。讲完你亲手当一次传话筒,让网页版的 AI 来玩你的游戏,跑出这门课的第一份 benchmark 数据。 第 5 节 Agent 上节课来回传话的那个人是你。今天把「你」换成一段程序 —— 它自己看分数、自己想、自己猜,跑完一整局。这就是 agent(智能体)。 第 6 节 Eval 今天接满六个模型,让它们跑同一组题,做出你自己的排行榜。eval(评测)就是用固定的题、固定的尺子给模型打分。 第 7 节 词库里有什么 你猜了六节课的词,从没把这 5 万个词当成整体看过。今天拿一个你关心的社会议题当筛子,看它知道什么、不知道什么、偏向哪边。 第 8 节 Benchmark Day + Demo Day 先用 10 分钟核对你自己跑的两张榜,再由你讲 10 分钟。最后收尾:vibe coding 为什么翻车、怎么审 AI 写的代码。

课件是固定 16:9 的幻灯片,建议用电脑打开。方向键或空格翻页,数字键跳到第几页。