| 序号 | 词 | 分数 | 名次 | 猜的顺序 |
|---|
还没有猜测。随便猜一个名词开始吧,比如「味道」「声音」「颜色」。
词表收 1–4 个字的简体中文词。单个字要在常用字名单里才行 —— 「猫」「水」「书」都能猜,生僻单字不行。
分数 = 这个词与目标词的余弦相似度 × 100。词向量来自腾讯 AI Lab 中文词向量(200 维)。 进入目标词最近 3000 个词时会显示名次(名次越靠前越近:前 10 名是贴脸,几千名只是沾边)。词表收 1–4 个字的简体中文词, 单字限常用字名单(「猫」「狗」「书」都能猜);词表外的词会告诉你一声,不计次数。 目标词有几个字是公开的,开局就写在上面那条状态栏里。 「提示」给出的词不计入猜测次数,但会直接进下面这张历史表(带「提示」徽章)。
这是什么
一、这不是猜字谜。分数跟字形、笔画、拼音都没有关系 —— 「妹妹」和「姐姐」一个字都不一样,分数却有 92.94;「面条」和「面子」长得像、共用一个「面」字,分数只有 33.93。
二、你猜的是意思。每个词在电脑里是一串 200 个数字(叫 embedding,词向量),意思相近的词,这串数字的方向也相近。分数量的就是这两个方向之间的夹角。
三、这个页收 1–4 个字的简体中文词。单个字只收常用字名单里的那些 —— 「猫」「狗」「书」「水」「车」都能猜,但生僻单字(比如「兮」「昙」)和纯虚词(「的」「了」「吗」「呢」)不收,繁体字也查不到。查不到不是你猜错了,是这份词表就是这么定的。
四、第 3 节课我们会自己把这个分数算出来 —— 用同一份词向量文件,写出和这个页面同一个口径的算法(分数对得上就行,代码不必一样)。今天只要带着一个问题回家:词怎么会有距离?
五、这个页是老师做的试玩版,只有「游戏」这一半,而且为了塞进一个文件把词向量压缩过了。你要做的是完整版,第 2 节从一张白纸开始 —— 别照抄这个文件。而且这个页的词表只有 12,020 词,前 3000 名就占了四分之一,所以这里的「进前 3000 了」比完整版(5 万词,前 3000 名只占 6%)弱得多。