知乎今天有个问题冒上热榜:"说话也有恐怖谷效应吗?"
问得正是时候。就在上周,#AI面试恐怖谷#话题冲上微博热搜,最高排到第25位,热度值超过18万。起因是秋招里大量企业启用了AI数字人面试官:求职者点开链接,对面坐着一个会眨眼、说话带气口的"人",但眼神空洞、微表情僵硬,一副"似人非人"的塑料感。有求职者形容,系统全程用摄像头追踪瞳孔动态和面部肌肉紧张度,把你的回答延迟、语速颤抖统统换算成分数,真人HR从头到尾不露面。
脸有恐怖谷,这大家都知道。但"说话"也有吗?我把近一个月关于AI声音的报道和判决翻了一遍,结论是:不但有,而且声音的恐怖谷比脸更隐蔽,也更值得每个用AI做内容的人警惕。
声音的恐怖谷藏在哪里
恐怖谷的经典解释是:一个非人实体在外貌、声音或行为上非常接近人类、但存在细微不自然时,人的好感度会从"喜欢"骤然跌入"强烈不适"。注意,这个定义里本来就写着"声音"——它不是脸的专利。
为什么耳朵也会触发警报?因为人类对语音的挑剔程度远超想象。我们判断电话对面是不是熟人,靠的不只是音色,还有换气的节奏、停顿的位置、情绪在句尾的那一点衰减。AI语音合成这几年进步飞快,音色早就以假乱真,但"呼吸感"和"节奏感"是最难仿的部分。做得不到位,就会出现那种微妙的感觉:每个字都对,连起来就是不像活人在说话。
更麻烦的是,声音的恐怖谷没有脸那么直观。看到一张僵硬的数字人脸,你立刻知道"这是假的";但听到一段略微不自然的语音,你的第一反应往往是烦躁、走神、不信任,却说不清为什么。这种"说不出哪不对但就是不对劲",恰恰是恐怖谷最典型的体验。
已经有人为AI声音付出了代价
声音以假乱真带来的不只是不适感,还有实打实的法律后果。
9月29日,上海市第一中级人民法院终审宣判了上海首例AI合成声音侵权案。一位配音演员发现某公司的推广活动里出现了疑似自己的声音,公证取证后起诉。司法鉴定显示:案涉AI音频与她本人的声音在28个共振峰声学指标中,有24个偏离度小于10%,相似部分达到90%。法院最终判决平台运营方构成声音侵权,赔偿5万元。这个案子呼应了最高人民法院9月7日刚出台的涉人工智能纠纷案件审理意见——未经同意拿别人的声音训练AI、模仿音色牟利,法律已经明确说不行。
同一项"以假乱真"的能力,用在配音演员身上是侵权,用在骗子手里就是诈骗。近期媒体报道的AI深度伪造诈骗里,不法分子用几秒公开语音素材就能克隆音色,实时合成"家人来电求救"。技术本身没有立场,但正因为它太像真的,普通人的信任体系才开始挨打。
做AI语音内容的人,怎么避开这道谷
如果你也在用TTS给自己的视频、播客、公众号配音,这三条是我从报道和产品实践里总结的避谷思路。
第一,别追求"假装是真人",追求"好听的机器声"。恐怖谷的本质是承诺与体验的落差:你越暗示"我是真人",听众的检验就越苛刻。反过来,坦然做出一个干净、稳定、有辨识度的AI声线,听众的接受度反而高——就像导航语音,没人觉得它瘆人,因为它从不假装是坐在副驾的人。
第二,把功夫下在节奏上,而不是音色上。音色克隆已经白菜价,真正拉开差距的是停顿和语速。我们自己每天用TTS生成选题报告的语音时就发现:适当放慢语速、在段落之间手动留出呼吸感的停顿,成品自然度立刻上一个台阶;语速拉太快,再像真人的音色也会露出机械感。
第三,别碰别人的声音。想用自己音色做数字分身没问题,录一段几分钟的干净素材就能建模;但拿任何未经授权的真人声音去训练、去商用,上海那纸5万元判决已经把红线画得很清楚了。
技术的进步不会停下,AI声音迟早会平滑地越过这道谷。但在那之前,聪明的做法不是把"像人"卷到极致,而是把"舒服"和"诚实"放在前面——这恰好也是AI该有的样子:帮你从容地表达,而不是替你伪装成别人。
💬 评论