中文猜词

猜一个词,看它离目标词有多近。

正在加载词向量……(第一次打开要几秒)
已猜 0 目标词 个字 每日一题 词表 0 词
猜过的词和提示给的词,一起按分数从高到低排列;提示行的「猜的顺序」显示「提示」
序号 分数 名次 猜的顺序

还没有猜测。随便猜一个名词开始吧,比如「味道」「声音」「颜色」。
词表收 1–4 个字的简体中文词。单个字要在常用字名单里才行 —— 「猫」「水」「书」都能猜,生僻单字不行。

分数 = 这个词与目标词的余弦相似度 × 100。词向量来自腾讯 AI Lab 中文词向量(200 维)。 进入目标词最近 3000 个词时会显示名次(名次越靠前越近:前 10 名是贴脸,几千名只是沾边)。词表收 1–4 个字的简体中文词, 单字限常用字名单(「猫」「狗」「书」都能猜);词表外的词会告诉你一声,不计次数。 目标词有几个字是公开的,开局就写在上面那条状态栏里。 「提示」给出的词不计入猜测次数,但会直接进下面这张历史表(带「提示」徽章)。

这是什么

一、这不是猜字谜。分数跟字形、笔画、拼音都没有关系 —— 「妹妹」和「姐姐」一个字都不一样,分数却有 92.94;「面条」和「面子」长得像、共用一个「面」字,分数只有 33.93。

二、你猜的是意思。每个词在电脑里是一串 200 个数字(叫 embedding,词向量),意思相近的词,这串数字的方向也相近。分数量的就是这两个方向之间的夹角。

三、这个页收 1–4 个字的简体中文词。单个字只收常用字名单里的那些 —— 「猫」「狗」「书」「水」「车」都能猜,但生僻单字(比如「兮」「昙」)和纯虚词(「的」「了」「吗」「呢」)不收,繁体字也查不到。查不到不是你猜错了,是这份词表就是这么定的。

四、第 3 节课我们会自己把这个分数算出来 —— 用同一份词向量文件,写出和这个页面同一个口径的算法(分数对得上就行,代码不必一样)。今天只要带着一个问题回家:词怎么会有距离?

五、这个页是老师做的试玩版,只有「游戏」这一半,而且为了塞进一个文件把词向量压缩过了。你要做的是完整版,第 2 节从一张白纸开始 —— 别照抄这个文件。而且这个页的词表只有 12,020 词,前 3000 名就占了四分之一,所以这里的「进前 3000 了」比完整版(5 万词,前 3000 名只占 6%)弱得多。