用自然语言做一个中文猜词游戏,
再让六个 AI 来玩它
八节课,每节约 45 分钟。不手写代码,用 coding agent 把游戏做出来,再亲手做一份模型 benchmark。
第 1 节 · 课堂试玩
中文猜词试玩页
系统暗选一个词,你每猜一个词,它告诉你两个词有多接近。先玩十分钟,带着「词怎么会有距离」这个问题回家。
第 1 节
自然语言是新的编程语言
八节课,不写一行代码,做出一个中文猜词游戏;再让六个 AI 来玩它,亲手做出一份模型 benchmark(基准测试,用同一套题比不同模型的强弱与成本)。
第 2 节
开机:怎么跟它说话
今天你发出这门课的第一段 prompt(提示词,你发给模型的那段话),让 agent(能替你执行任务的 AI 程序)做出游戏的外壳:输入框、假分数、历史列表。
第 3 节
词变成数字
今天上半节,你会在纸上算出一个分数;下半节,你的游戏开始算真分 —— 每个词都是 200 个小数,分数就是这两串数字的夹角。
第 4 节
模型内部
六个词,一页一个:token、context window、attention、pretraining、post-training、RL。讲完你亲手当一次传话筒,让网页版的 AI 来玩你的游戏,跑出这门课的第一份 benchmark 数据。
第 5 节
Agent
上节课来回传话的那个人是你。今天把「你」换成一段程序 —— 它自己看分数、自己想、自己猜,跑完一整局。这就是 agent(智能体)。
第 6 节
Eval
今天接满六个模型,让它们跑同一组题,做出你自己的排行榜。eval(评测)就是用固定的题、固定的尺子给模型打分。
第 7 节
词库里有什么
你猜了六节课的词,从没把这 5 万个词当成整体看过。今天拿一个你关心的社会议题当筛子,看它知道什么、不知道什么、偏向哪边。
第 8 节
Benchmark Day + Demo Day
先用 10 分钟核对你自己跑的两张榜,再由你讲 10 分钟。最后收尾:vibe coding 为什么翻车、怎么审 AI 写的代码。
课件是固定 16:9 的幻灯片,建议用电脑打开。方向键或空格翻页,数字键跳到第几页。