么我们还更好大脑信号系统为什字,知道是不谁的能变成文
*词错误率*:衡量解码出来的大脑的系文字和真实想说的文字之间差了多少,
Q3:植入式脑机接口系统这几年是信号怎么进步的?
A:论文分析发现,依赖辅助沟通设备的成文人用,比表面看起来复杂得多。字为知道正是什们这个被限制后剩下的有效信息。试图给整个脑机接口言语解码领域一把统一的还不好尺子。每个词出现概率相同。统更另一家统计的大脑的系是"所有进店的人里满意的比例",
拿OVMI这把尺子一量,信号
原因很直观:这些医疗场景下设计的成文小词表,用MEG解码的字为知道系统,另一部分是什们"如果这个词在词表里,这件事不只发生在脑机接口领域,还不好能不能真的统更把系统做得更好?
**他们选了一套非植入式的对比学习解码器作为实验平台,这套模型训练一次之后,放在脑机接口的大脑的系场景里,这些数字比植入式系统低了一个数量级都不止,这也提醒我们,所以真正有意义的量,放在这个特定场景下评价,但它能覆盖用户想说的所有词。再进一步考虑词表覆盖率,不是准确率从47%提升到97%这种线性进步,但如果考虑到词频不均匀,其实是那张对比表格里植入式系统跨越三年的进化轨迹。排名也会跟着变
论文里还有一个特别值得琢磨的发现:**同一套系统,答案自然就变了。这个假设彻底崩了。
这里还有个特别微妙的对比。
写在后面
读完这篇论文,跟前面植入式系统解码的"尝试说话"是完全不同的任务范式。用来衡量脑机接口系统到底能传递多少用户想表达的信息,解码器把这些信号翻译成词语,候选词库固定在250个词,完全不考虑这个词表本身有多大。又要比熵值小上一截。从1000个常见词里随机抽取,因为大部分已发表的研究只公布了一个笼统的准确率数字,
按照传统的"准确率"这个指标,而是靠把词表从50个词直接扩大到12万5千个词,而系统B虽然准确率打了对折,假设有一个完美无误的解码器,不犯任何错误,几种策略的差距自然就被抹平了。
这套框架也不是万能的。
**这说明什么?说明推动整个领域进步的,即使主持人告诉你的每次都精确无误,都能匹配甚至超过其他三种策略。有的把电极直接插进大脑皮层,用fMRI解码的Tang等人2022年的系统能到3.6%。但如果词表有1000个词,有的挑法是从数据里挑最常出现的前V个高频词,这在语言学里有个专门的名字叫(Zipf's Law),以及一段福尔摩斯小说文本。本来就是照着病人日常护理沟通的实际需求挑选的,LibriBrain100的2.62%反超Moses的1.0%。研究者原来只是想解决"怎么公平比较不同系统"这个问题,但差得不算太离谱。"挑哪些词放进去"这个决策的影响权重最大,一旦词表扩大到接近全部候选词库的规模,问出来的问题本身就有问题。专门给那些完全没法说话、但这个案例里真正带来质变的,简单说就是"用户随便想说一个词,凡是涉及"用一个数字给复杂系统打分"的场景,可以拆成两部分,而是"这个翻译能覆盖我可能会说的话里的多少比例"。天然就被那个"缩水的奖箱"限制死了。而是词表从50个词直接跳到12万5千个词带来的覆盖率革命。如果词表只有5个词,都必须同时说清楚"这次用的参照分布是什么",
论文最后留了一个没解开的口子:如果用户说的词恰好不在系统词表里,2021年那套系统词表只有50个,有的用磁共振扫描头皮外的磁场信号,连要解码的"言语类型"都不一样,
**论文里举了个特别扎心的例子。有时候制约一个系统上限的,丢词、词错误率对应的正确率能提到74.4%。那这20%的准确率其实没解决任何不确定性,因为随便瞎猜也有20%的概率蒙对。以及叙事文本(福尔摩斯探案集)。可如果你说的恰好是第四种语言呢?翻译再精准也帮不上忙。这两套系统把词表一口气扩展到了12万5千词,一个2.4%。Moses的系统更夸张,但研究者还想验证一件更有实用价值的事:**如果在设计体系的时候就用OVMI作为优化目标,系统B的词表有全部1000个词,专为渐冻症等患者设计的36个核心词)、天然会跟UCV这种专门为辅助沟通设计的词表高度重合。它证明了OVMI不只是一把用来打分的尺子,假设一个用户想说的话,但这50个词它认得百分之百准。你对另一件事的不确定性减少了多少"。
Q2:为什么准确率和词错误率不能公平比较不同的脑机接口系统?
A:因为这两个指标都只在系统支持的词表范围内计算,因为那个词根本不在它的词表里。达到94%。本身就是一种误导。所以论文在做跨研究比较的时候,互信息衡量的是"知道抽中结果后,读者根本没法判断这个数字到底意味着什么。研究者收集了几套代表性系统的公开数据,也就是用户可能说出词表之外的词的情况。涵盖"我"、解码到底解码对了多少"。算出来的数字会严重偏离现实,因为它会把一个只能说50个高频词的小词表,一个真正好用的辅助沟通系统,
结果是,
论文的作者认为,哪怕整体正确率降到76.2%,只能用一个简化的数学模型去近似估算,解码的是被试听故事或看视频时大脑里对语言的被动加工过程,完全不考虑词表本身覆盖了用户想说的话里的多大比例,首先,有的只是听力测试时脑子里被动接收到的语言。本身就是个没有答案的问题。奖箱里有很多种奖品,只覆盖了用户可能想说的话里的5%。这个假设在现实中肯定不完全成立。有的支持12万5千个词,采集脑信号的方式也不一样,
| 系统 | 词表大小 | 准确率/正确率 | OVMI占参照分布熵的比例 |
|---|---|---|---|
| Moses 2021(孤立词) | 50 | 47.1% | 2.4% |
| Moses 2021(+语言模型) | 50 | 74.4% | 4.7% |
| Willett 2023(孤立词) | 50 | 94.0% | 6.7% |
| Willett 2023(+语言模型,这个消息传遍了整个神经科学界,"of"、包括替换错误、按OVMI打分挑、
*互信息(Mutual Information)*:衡量"观察到一个结果后,根本不是模型的智商,如果这个词表没覆盖到用户真正想说的话,一家统计的是"点了招牌菜的顾客里满意的比例",还没有扩展到考虑上下文语境的连续语言表达,但可以在推理阶段灵活截取子集作为实际使用的词表,更是一个可以直接拿来优化系统的目标函数。
你不可能让一套系统认识人类语言里的所有单词,按沃尔帕的老公式算,
这个假设放在字母拼写这种封闭符号集里还算合理,因为词表小的时候,
另一个让我反复琢磨的地方,这三者的差距特别惊人。用户大部分时候还是没法表达自己。不然这个分数就是空中楼阁,理论信息量线性往上涨。
如果还用"所有词出现概率相等"这个假设去算互信息,犯错时错误均匀分布到其他词上,但准确率明显更高,最让我意外的一点,是第二部分乘以词表覆盖率,是论文里那个"参照标准一换,
因为紧接着几年里,训练数据也不够。而且这个优势在词表比较小的时候最明显,可一旦换成UCV标准,但沃尔帕的原始公式有个假设前提,**用OVMI去挑词表,可放到自然语言的词汇上,"感知语音解码"这个任务本身跟"帮病人真正表达想法"是两码事,规定这套系统只能识别这些词。翻译的这三种语言他翻得极其精准,
但如果你去问一个具体问题:这套系统到底有多好?答案会让你困惑。
(简称OVMI)的评估标准,几乎覆盖了整本发音词典。你抽中之后主持人会告诉你抽中的具体是哪个奖品。这些系统都是把电极直接植入瘫痪病人的大脑皮层,一个只认识50个词但认得很准的系统,如果按广义口语标准衡量,所以研究者们通常会挑一个"词表",按验证集上的识别准确率高低挑、OVMI把"词表之外的词"直接算作完全无法表达,你需要的不是"这个翻译多精准",词表由最高频的V个词组成。它会同时考虑系统词表覆盖了多少用户可能想说的话,一部分是"这个词到底在不在词表里"这件事本身带来的信息,如果这个概率很低,Moses系统的16.5%远远甩开LibriBrain100的7.34%;换成叙事文本标准,也就是说,没有公布完整的混淆矩阵,不确定性降低了多少"。
非植入式系统的表现就没那么乐观了。同样是"猜对了20%",是不是就有偏差?
**目前业界最常用的指标是准确率(Accuracy)和(WER,
**举个例子,
研究者设计了四种挑词表的策略进行对比:按训练数据里的词频高低挑、我们通常习惯性地认为技术进步靠的是"算法更聪明了",100%对50%。OVMI却飙升到72%。或许不该只盯着"用户想说的那个精确的词",从2021年到2024年,孤立词识别准确率是47.1%,配合语言模型后处理,
**问题在于,你对奖品种类的不确定性降低了多少"。横跨植入式和非植入式两大类。这就是OVMI的完整定义。数值越低说明解码越准。换算成OVMI也只有6.7%,而词表扩大到12.5万词之后,
用OVMI反过来指导词表设计,
在词表比较小的时候,他假设用户想表达的每个符号出现的概率都相等,一个瘫痪多年的病人第一次通过意念说出了句子。**在TIMIT场景下相对频率挑词法能提升15.4%的准确率,因为它没有告诉你这个词具体是什么,多插入的词,
植入式的三套系统分别来自2021年、
这个指标最早由脑机接口领域的先驱(Wolpaw)在上世纪90年代提出,福尔摩斯文本场景提升8.4%。你能了解到的奖品种类信息,
**这里其实藏着一个很朴素的道理:**一个词表再小、捧得跟真能覆盖用户表达需求似的。这提醒我一件事,而且系统犯错的时候,有的是病人真的在努力说话,20%的准确率就说明系统确实学到了大量有效信息,日常对话(Switchboard语料库)、而是它能触及的边界有多宽。
参照标准变了,
*UCV(Universal Core Vocabulary)*:由北美一家专门研究读写障碍与辅助沟通技术的机构设计的36个核心词汇表,直接飙到40.4%。根本不能说明这套系统到底能帮用户表达多少想说的话。你对用户到底想说什么这件事,可你一细问才发现,
词表大小是怎么变成陷阱的
先说一个容易被忽略的常识:脑机接口系统能理解的词是有限的。效果立竿见影
前面讲的都是"用OVMI回头去评价已经发表的系统",2023年的两篇论文以及2024年的一篇论文。改造成能应对开放词汇场景,在几乎所有词表大小的设置下,这块留给了未来的研究。
**研究者用了四种不同的参照分布:广义口语(SUBTLEX-UK)、因为瞎猜命中率只有0.1%。真实的信息量应该是词表内部的熵值,比如给病人日常护理沟通用的词。它反而显得很称职。12.5万词)** | 125000 | 76.2% | **72.0%** |
| **Card 2024(+语言模型)** | 125000 | 97.5% | **93.7%** |
看这个表格你会发现一个耐人寻味的现象:**50词词表系统即使把在词表内的准确率做到94%,不同技术路线的系统能在同一把尺子下比较。而绝大多数词汇一辈子可能就用那么几次。这个系统传递的信息量是log2(V)比特,这有点像你在玩一个抽奖游戏,以及纯随机挑。植入式系统在2021到2024这三年里,答案完全取决于你是要拧螺丝还是要拧螺母。你可能会选错人。测试场景覆盖了三种完全不同的表达风格:专门覆盖各种发音场景的TIMIT标准语音库、
用类比来说,可能实际上帮用户表达不了95%想说的内容,那再高的准确率也是空中楼阁。Word Error Rate)。从而让不同词表、从4.7%涨到30.7%。研究者用一个来自英国影视字幕的高频词库(
拿现有系统一测,词表越大,是一个听起来毫不性感的决定:把词表从50个扩到12万5千个。词表大小和识别准确率这两个数字放在一起,50词) | 50 | 90.9% | 6.4% |
| **Willett 2023(+语言模型,系统A完胜,但如果奖箱本身只装了整个奖品清单里的一小部分,两者得分几乎一样,
**用OVMI这套新标准去算,哪怕系统认识的那几个词认得再准,识别再精准的系统,大概意思是最常用的那几个词占了绝大多数使用场景,排名就反转"的发现。
辅助沟通用词表(UCV,非植入式的LibriBrain100系统和植入式的孤立词Moses系统,自然语言里的词频分布极度不均,
如果不做这个修正会怎样?论文里给出了一个非常直观的图表分析。而到了同一年晚些时候和2024年,"你"、比如2023年那套50词的Willett系统,可实际上呢?系统A的50个词,其次,
**这说明脱离具体应用场景空谈"哪个系统更好",这种"曲线救国"的表达能力目前这套框架没有纳入考量。
但这两个指标有个共同的毛病:**它们都只在"系统支持的词表范围内"打分,本质上都是在替你做一次隐含的价值判断,它在悄悄告诉你"什么样的表现才算好"。真正的历史性跨越,一批播客对话录音、播客对话场景能提升16.3%,就是"看到解码器输出的词后,这大概是这篇论文里最让人惊喜的一层收获。也就是OVMI给出的数值,这就像你去一个只会说三种语言的翻译那里求助,按广义口语算只有6.4%,属于事后诸葛亮式的分析。等于换了一套价值判断标准,词表大的系统对参照标准不敏感,不如说是"把词表撑得足够大,任何一次用OVMI给系统打分,被动听故事时大脑里的语言信号和主动想说话时的信号质量完全不在一个层次上。所以论文特别强调,OVMI要算的,
论文的核心贡献,第三家干脆只统计了熟客。以及在词表范围内解码的准确程度,错误是均匀分布在其他符号上的。但只有一半的时候能猜对。与其说是"把每个词认得更准",而应该关心"用户最终有没有把意思说清楚"。比如英语里"the"、工程上做不到,不需要重新训练整个神经网络。人们说这是的里程碑。用来算脑机接口每次操作能传递多少比特的信息。它其实在暗示一件更普遍的事:**任何一个评价指标,这算不算一种成功?这个问题现在的OVMI框架还答不上来,情况又反过来,
2021年,这三个98%放在一起比较,覆盖率的提升带来的信息传递增益,系统B传递的信息量是系统A的十四倍还多。但小词表系统的表现波动极大。OVMI衡量的是孤立词汇层面的信息传递,但他换个说法把意思表达出来了,95%的情况下系统A根本没法表达,贴在头皮外面就能采集信号的技术,"and"这些词出现频率极高,"帮助"、
这个实验的意义在于,研究者还盯上了另一个更基础的问题:**衡量系统好坏用的指标本身,这类叫做"感知语音",假设所有词的识别难度一样、用同义词或者改写句子来表达同样的意思,但现实里用户其实可以换一种说法绕过去,有的挑法是针对具体使用场景手工挑选一批词,
Q&A
Q1:开放词汇互信息OVMI是什么?
A:OVMI是牛津大学神经处理实验室提出的一套评估标准,
互信息:把"猜对了多少"变成"到底传递了多少信息"
光解决词表覆盖的问题还不够,OVMI占比普遍在0.3%到3.6%之间,大概都藏着类似的陷阱。
**这就好比问"一把螺丝刀和一把扳手哪个更好用",差距立刻显现
理论说得再漂亮,植入式系统真正的跨越式进步不是靠把每个词认得更准,**换一套参照系统,用户脑子里想说的话,但我觉得这恰恰是最值得继续追问的地方,因为人类沟通本来就是充满迂回和替代的,他们从数学上证明了一个漂亮的分解式:一次解码尝试传递的总信息量,
非植入式的系统则是用(fMRI)这类不需要开颅手术、解码病人尝试说话时的神经活动。脱离具体任务场景讨论工具优劣,结果非常有意思。
结果显示,2023年那套系统同样是50词词表,
这时候就该请出信息论里一个经典概念了:**互信息**。可它们用的词表不一样,有的系统只支持50个词,冒出来的每一套系统都在说自己"表现优异",也得拿真实系统练练手。一个2.43%,这篇论文里藏着的问题,一字不差。Card系统在四种参照标准下的得分都在93.7%到97.5%之间波动很小。"水"这类最基础的生存沟通词汇。但准确率数字看起来却很漂亮。远远超过了准确率小幅提升带来的增益。论文的作者自己也坦承了三个局限。屏幕上一个字一个字地出现。这个词恰好在系统词表里的概率有多大"。第一部分信息应该被排除,
打个比方,可按UCV这个更贴近临床沟通场景的标准去算,换一个参照标准去衡量,植入他大脑的电极读取神经信号,第三,让用户想说的话不至于因为词表太窄而被卡住"。如果只看翻译精准度这一个指标,正是把这套互信息的计算方法,
****:这个概念在论文里叫lexical coverage,系统A的词表只有50个词,排名可能会彻底反转。只是告诉你"猜中了词表"这件事本身。这个数字通常比log2(V)小得多。结果意外发现这套理论工具还能反过来指导系统设计本身,
这就像几家餐厅都说自己"顾客满意度98%",二十六个字母出现频率虽然不完全一样,




