9月12日这天,我把网易、中华网、IT之家、钛媒体、凤凰网关于"DeepSeek灰度测试语音对话"的报道挨个翻了一遍。有意思的是,十几篇报道说的几乎是同一件事:被灰度测试命中的用户,App右上角会多出一个小喇叭按钮,设置页面新增"朗读音色"选项,四种音色可选——百变活泼的贝壳、明朗坚定的白浪、俏皮甜美的海星、低沉浑厚的暗潮。
新闻本身只有两句话,但这两句话背后,是DeepSeek从"会写字"到"会说话"的关键一步。
为什么是现在?先看几个数字
中研网同一天刊发的一篇产业观察给足了背景。截至2026年6月,国内AI原生应用的月活格局是:豆包3.82亿排第一,通义千问1.67亿第二,DeepSeek 1.30亿第三——三强已经成型,而语音恰恰是头部玩家的标配,DeepSeek是里面最晚"开口"的。这篇分析还提到,中国AI语音市场规模预计2026年达到120亿美元,占全球份额的28.6%;全球范围内,63%的Gemini用户已经在用语音指令直接对话,76%的消费者表示每周或每天使用语音助手类工具。
换句话说,语音交互正在从"可选功能"变成"默认方式",DeepSeek这一步不是尝鲜,是补课,也是卡位。
技术上也不意外。据这篇产业观察梳理,DeepSeek V4已支持原生语音能力,V4.1版本新增了图像和音频处理能力,能理解文本、图像、音频三种模态。模型早就"会听会说",只是产品一直没把按钮放出来。
一个容易被忽略的细节:音色全叫海里的名字
贝壳、白浪、海星、暗潮——四个名字放在一起看你就明白了:DeepSeek,深海。这不是随手起的营销名,而是一套完整的产品人格。文本时代,AI靠回答质量建立信任;语音时代,AI靠"声音是谁"建立陪伴感。选音色这个动作看似 trivial,实际上是用户在给自己挑一个"长期住在耳朵里的角色"。
这才是入口战的本质:打字时你是主动去找AI,说话时AI是随时在你身边。通勤路上、厨房里、跑步时——这些原本属于播客和音乐的场景,现在都成了AI的阵地。谁的声音先住进你的耳机,谁就拿到了你每天的碎片时间。
普通人现在能做什么
如果你已经被灰度命中(打开DeepSeek看看右上角有没有小喇叭),三个实用建议:
第一,长回答别再用眼睛啃了。 让AI解释一个概念、总结一篇文章,直接点朗读,戴上耳机边走边听。"阅读"变"收听",通勤时间就从废料变成了学习材料。
第二,音色选定就别频繁换。 四种音色各试一遍,选一个自己听着不累的固定下来。人对熟悉声音的理解效率会越来越高,换来换去等于每次重新适应。
第三,语音适合"理解",不适合"核对"。 听AI讲逻辑、听思路很顺,但涉及具体数字、代码、合同条款的内容,一定要回到屏幕上用眼睛过一遍——耳朵会放过细节,眼睛不会。
还没被命中的朋友也不用等:spark1.cn 的工具区(/tools/)里聚合了多个模型的入口,想体验"和AI说话"这件事,今天就可以开始,不必等哪家的灰度名单轮到你。
AI会说话,不是让谁被淘汰的开始,而是让忙碌的人多一双手、多一双耳朵。工具越来越顺手,人才能越来越从容。
💬 评论