你有没有想过,在咖啡馆敲键盘、线上会议时打字,只通过声音就能被人还原出输入的完整文字?
最新研究《Transforming Keystroke Noise to Text: Self-Supervised Acoustic Eavesdropping Attacks on Keyboards》,提出了一套完全自监督的声学窃听攻击方案。它不需要提前获取目标键盘的标注数据,不用特制专业设备,只需要一百多次按键的录音,就能把英文文本还原出99%以上的准确率。哪怕是隔墙录音、线上会议的背景音,也能实现九成左右的还原度。
这不是科幻设定,而是已经被实验验证的真实侧信道攻击。今天我们就把这项研究的技术细节和现实影响讲清楚。
键盘声音能泄露输入信息,这件事安全领域早有研究。但过去的方案始终绕不开几个现实障碍。
监督式声学攻击需要提前采集目标键盘的按键录音,对应好每个键的声音特征才能训练模型。
现实里攻击者很难拿到目标设备的标注数据,换个键盘、换个录音环境模型就会大幅失效。无监督方案不用标注数据,但要么得用麦克风阵列这类不便携的设备,要么需要上千次按键才能稳定输出结果,实际能用的场景非常有限。
除此之外还有电磁泄漏、WiFi信号、视觉识别这类窃听路径,要么要专业设备,要么要正对键盘的视线,部署门槛都很高。
而这次的研究,同时满足了三个现实攻击的核心条件:部署成本极低,不需要目标设备的标注数据,少量按键就能实现高精度还原。相当于把键盘声学窃听的门槛,降到了普通人用手机就能尝试的程度。

整套攻击流程可以分成两大阶段:
声学聚类处理和反馈式语言模型推理。简单说就是先把每个按键声音归成类,再用语言模型把类别序列翻译成真实文字,再通过自训练反复迭代优化。
第一步:精准分割每一次按键
拿到一段连续的录音,首先要定位每一次按键发生的时间点,把每个按键的声音单独切分出来。
研究人员用短时傅里叶变换 STFT计算信号能量的变化,按键按下的瞬间声音能量会出现明显峰值,通过峰值检测算法就能找到每个按键的位置,再以峰值为中心截取固定长度的声音片段。正常打字速度下,两次按键的间隔在200到 400毫秒,声音基本不会重叠,分割的可靠性很高。
第二步:提取声学特征向量
每个按键的原始声音波形不能直接用来对比,需要提取成结构化的声学特征。
核心特征是 MFCC (梅尔频率倒谱系数),这是语音识别领域最常用的音频特征,能很好地体现声音的频谱特性。除了MFCC本身的均值、方差、极值等统计量,研究人员还加入了频谱质心、频谱滚降、过零率,以及MFCC的一阶二阶差分特征,最终拼接成902维的特征向量,用来描述每一次按键的声音特性。
第三步:降维后做声学聚类
902维的特征维度太高,而攻击场景里往往只有一两百个按键样本,数据量远小于维度,直接聚类效果会很差。
这里用到了 UMAP (均匀流形近似与投影)算法,把 902维的特征压缩到 5维。UMAP的优势是既能保留数据的局部邻域结构,让声音相似的按键在低维空间里离得很近,计算效率也比传统的t-SNE更高。
降维之后,用层次聚类把所有按键分成 25个簇。虽然目标字符集有 29个符号,包括 26个小写字母、空格、逗号、句号,但少量样本下用稍少的簇数反而更稳定。聚类之后,每一次按键都会对应一个簇编号,整段录音就变成了一串簇编号序列。
第四步:先锁定空格键当锚点
空格键的尺寸、按动方式和普通字母键差异很大,声音特征也非常独特,很容易和其他按键区分开。
研究人员只需要人工挑出一个确定的空格键样本当种子,然后在UMAP的低维空间里,把和种子距离在阈值内的所有样本都判定为空格键。这些确定的空格位置,会成为后续语言模型解码的可靠锚点,大幅提升推理稳定性。
第五步:用 BERT做上下文推理
这是整套方法最核心的创新点:用字符级 BERT模型,结合上下文把不确定的簇序列还原成文字。
聚类得到的簇和字符不是一一对应的,一个簇可能对应好几个发音相似的字符,初始的映射关系是模糊的。研究人员定义了一个概率映射矩阵M,用来表示每个簇对应每个字符的概率。
他们训练了一个专门的字符级 BERT模型,词汇表就是 29个目标符号。和普通 BERT做完形填空一样,模型可以通过双向上下文,推断每个位置最可能出现的字符。
但输入不是确定的字符,而是带有歧义的簇。这里用到了歧义感知嵌入:把每个字符的嵌入向量,按照簇到字符的概率加权求和,得到这个簇的嵌入表示。相当于把这个位置可能是a也可能是 s的不确定性,编码进了输入向量里。
接下来对每个位置依次做掩码语言建模 MLM预测,用双向上下文算出每个位置最可能的字符,得到初始的预测文本。
因为 UMAP的初始化有随机性,每次聚类结果可能不一样。研究人员会重复10次降维和聚类,用 BERT模型计算每次预测结果的平均对数似然,选出最合理的一组作为初始状态,避免随机波动影响效果。
第六步:LLM补全语义合理性
BERT的预测还可能有错误,这一步用大语言模型做二次修正。
研究人员用 Gemini 2.0 Flash 接收 BERT的输出,要求它在保留空格位置的前提下,把字符错误修正成语法通顺、语义合理的英文单词。BERT主要看局部上下文,而 LLM可以理解更长的句子逻辑,补全语义层面的合理性。
第七步:自训练迭代,越跑越准
到这一步还没完,整套方法最厉害的地方是有自我迭代优化的能力。
首先从 BERT预测和 LLM纠错的结果里,找出两者一致的高置信度片段,把这些片段当成伪标签。然后用标签传播算法,基于声学特征空间的相似性,把伪标签扩散到其他未标注的按键上,得到更完整的标签序列。
用新的标签序列重新计算簇到字符的映射矩阵,再和旧矩阵按比例混合更新。之后重新跑BERT预测、LLM纠错、自训练,循环最多 50次。
每一轮迭代,声学映射和语言模型推理都会互相修正、共同提升,就像不断自我校准的闭环,最终准确率会大幅提升。这也是为什么只需要少量按键,就能达到极高的还原度。
研究人员用四款主流笔记本做了测试,分别是 Dell Latitude 7320、13英寸 MacBook Pro 2019、HP OmniBook X 14、Lenovo ThinkPad X390,覆盖了不同的键盘和机身设计。

最理想的场景下,手机放在笔记本旁边录音。只需要100次按键,大概 17个单词,还原准确率就能达到 99%。150次按键的话准确率到 99.33%。
作为对比,传统的 HMM无监督方案要达到 97%的准确率,需要 1200次按键。字典法需要 350次按键才能到 97%。跨设备测试里,只要有150次以上的按键样本,四款笔记本都能稳定达到很高的准确率,说明这套方法对不同键盘的适应性很强。

接下来操作主要是利用桌面振动传信息,接触式麦克风放在同一张桌子上,距离目标 3米远,通过桌面振动传递按键声音。
MacBook和 HP的机型 100次按键就能到 90%以上准确率,联想机型 150次按键超过 90%,戴尔机型需要200到 250次按键。不同机身的减震设计、和桌面的贴合程度,会影响振动传递的效果,但整体都能实现高准确率还原。

同时,隔壁打字也能被还原,做法是用接触式麦克风贴在墙上,隔着石膏墙窃听隔壁房间的打字声音。
墙体的衰减和环境振动会让信噪比下降,需要的按键数比同桌场景更多。MacBook 150 次按键就能到 95%以上,HP需要 150到 200次,戴尔和联想大概需要 200到 250次。哪怕隔着墙,只要有两百多次按键,就能还原出绝大部分文本内容。
研究人员测试了 Google Meet、Microsoft Teams、Zoom三款主流会议软件,在关闭降噪功能的前提下,通过会议传输的音频还原打字内容。

Google Meet 场景下,MacBook和 HP在 200次按键左右接近 90%准确率,戴尔 200次按键超过 90%,联想需要250次以上。

Microsoft Teams 里 MacBook表现最好,200次按键超过 95%,HP 250 次按键超过 90%,戴尔和联想在250次按键后快速提升到 90%以上。Zoom场景下 MacBook 150 次按键就超过 90%,戴尔200次按键到 95%以上,HP和联想 250次按键超过 90%。

也就是说,只要线上会议里没开强降噪,你打字的声音传出去,别人就有可能通过这段音频还原出你输入的内容。
自然语言有规律可循好还原,那没有语义的随机密码呢?
研究人员做了专门的实验:先录入一段自然语言文本,用前面的方法得到声学标签,再用这些标签做种子,通过标签传播推断后面输入的随机密码。
结果显示,如果有 426个自然语言按键的样本,5位长度的密码有 40%的概率直接猜中第一位,前 100个候选里能覆盖 90%的正确答案。7位密码前 100候选覆盖率 80%,10位密码前 1000候选覆盖率 60%。

虽然不能 100%直接还原密码,但已经大幅缩小了猜解的搜索空间。现实里用户输入密码前,往往都会先打一段聊天内容或者文档,刚好给攻击者提供了自然语言校准的样本。

面对这种声学窃听,并不是没有应对办法,可以从三个层面入手。
软件层面,会议软件和操作系统应该默认开启强降噪和打字音抑制功能,并且让用户清晰知道降噪是否开启。企业环境可以强制配置隐私保护的音频策略,避免按键声音泄露。
现在很多会议软件的强降噪是付费功能,这其实会让大量免费用户暴露在风险里。
行为层面,线上会议打字的时候主动静音,或者用按键说话模式。把麦克风放得离键盘远一些,用外置麦克风而不是笔记本自带麦,都能降低信号质量。输入敏感信息的时候,尽量不要在有录音条件的公共场合,也不要在通话过程中输入。
物理层面,按键振动会通过桌面和墙体传播,用软质桌垫、带减震的脚垫,都能削弱振动传递,降低接触式麦克风能获取的信号质量。
这项研究最值得警惕的地方,是它把传统侧信道攻击和大语言模型结合在了一起。过去声学信号里的模糊性、不确定性,现在可以通过语言模型的上下文推理来补全。AI的进步,正在让很多原本停留在实验室里的攻击,变成现实中随时可能发生的隐私威胁。
当然目前这套方法还有局限,比如需要按键声音不重叠,高速打字可能会影响效果,强降噪环境下也会失效。但它已经足够提醒我们,键盘声音不是无关紧要的背景音,而是实实在在可能泄露隐私的侧信道。
在麦克风无处不在的今天,对这类风险的关注和防御,可能比我们想象的更重要。
声明:本文来自黑鸟,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。