文 | 惊蛰研究所,作者 | 雨谷
谁能想到,在市场格局几乎已经是铁板一块的情况下,输入法这个基本没什么存在感的 " 小众赛道 ",竟然会在 AI 时代再次掀起新的波澜。
2025 年下半年以来,豆包输入法、千问输入法相继上线,并且两款产品都把语音输入作为主打功能。有意思的是,就连 2022 年上线的微信输入法也在去年 12 月完成 3.0 大版本更新,重点升级了语音输入能力。而在海外市场,2023 年开启公测的 Wispr Flow 已经累计获得 8100 万美元融资,估值突破 20 亿美金。
大家都在关心大模型和 Agent 的快速迭代时,输入法为何突然又火了?这幅奇异的景象背后,其实是一场关于 AI 时代的 " 未来战争 "。
语音输入法,是不是噱头?
关于大厂们突然不约而同布局语音输入法的原因,业界早有共识。随着 AI 对话框取代搜索框成为新的流量入口,用户在线时长、互联网流量迎来一轮重新分配。而在大模型之外,输入法作为日常使用频率最高,并且能够跨应用、跨场景的基础性功能,同样具备 " 系统级入口 " 的潜力。由此,作为 AI 调用入口的输入法也就成为了大厂的必争之地。
不过,这个原因只解释了为什么大厂们 " 要做输入法 ",并没有解释为什么 " 要做语音输入法 "。而 " 语音 " 的一词之差,恰恰是关键。
在大部分普通用户的印象中,语音输入可能就是 " 我说你写 ",其核心原理是识别用户语音然后转录成文字。但是由于早期语音识别多基于统计模型实现,准确率受环境、口音、口语化影响特别明显,语音输入远不如键盘输入准确。因此,语音输入虽然可能会在速度上更具优势,但准确率的短板让语音输入难以真正普及。
但如今,随着大模型能力的迅速提升,准确性的问题早已解决。更重要的是,在 AI 功能的加持下,输入法已经不只是一个转录声音的工具。
例如豆包输入法就是基于豆包同款语音大模型开发,除了准确率高达 98% 以上,键盘输入还具备自动纠错功能,可以结合上下文语义分析,实现文字、符号、表情以及日期的智能联想。千问则号称支持口语净化、智能纠错、上下文理解及创作、问答、翻译等指令。
换句话说,基于 AI 大模型推出的语音输入法产品,相当于一个具备标准化语言能力的自动化文本处理器。更形象地说,语音输入法就相当于一个 " 笔替 ",用户不但可以用它回复日常工作和生活中的消息,还可以用 AI 语音输入法直接写作。这种产品功能的显著提升,让输入法实现了用户价值的突破,因为有了重新打开市场的机会。但更关键的是,AI 自身的发展也需要语音输入法。
从生成式 AI 的发展到当前 AI 办公的流行,有一个问题逐渐浮出水面。Chatbot 可以只花几分钟就给到一份旅游攻略,但用户可能需要十几分钟把出行需求的文字输入到对话框里。办公 Agent 可以只用几分钟就完成一份工作报告,但用户下需求之前,必须先花时间交代清楚项目背景、明确报告形式。
明明模型的能力越来越强大,AI 的功能越来越丰富,但人类使用 AI 的效率似乎并没有实现飞跃性的提升。产生这种矛盾的原因,其实就是 " 打字 " 的交互方式,成为了限制人类使用 AI 的效率瓶颈。
如果还原打字和语音两种输入方式的行为过程会发现,打字是一个从思考、组织语言到敲键盘的过程,而语音输入除了省略了敲键盘的环节外,在具备自动纠错、结合上下文语义分析的模型能力加持下,组织语言的环节也几乎可以省去。因此,语音比打字的输入效率更高,语音输入法通过提高 " 输入效率 ",也提升了人类使用 AI 的生产效率。
值得一提的是,正因为语音输入几乎 " 砍掉 " 了敲键盘的环节,从而变得更高效,不少热爱 Vibe Coding 的用户,还开始流行定制只保留了四个按键的语音输入键盘,这也从侧面反映出语音输入法对于使用 AI 的独特价值。
重点不是 " 输入法 ",是 " 语音 "
在运用语音输入使用 AI 的场景下,可以看到一个新的交互流程正在产生,用户通过输入法说话,输入法把语音内容转成文字,AI 再理解文字并完成任务。在这个流程中,输入法相当于人类使用 AI 的 " 操纵杆 ",所以输入法可以看作是 AI 的调用入口。但是如果把眼光放得更长远一点,AI 入口就一定是输入法吗?
7 月底,OpenAI 给出了一个非常值得关注的答案。OpenAI 宣布已对 ChatGPT 桌面应用进行更新,将 ChatGPT Voice 的语音能力进一步延伸到桌面端的 ChatGPT Work 和 Codex 等工作场景。

这意味着,用户可以直接通过语音指挥智能体干活,还可以随时用语音查看任务进度、继续提问、打断或重新向 Agent 下达指令。在这种场景功能下,语音不只是输入方式,而是开始成为电脑系统的操作方式——这或许将是 AI 时代人机交互真正的分水岭。
在 " 语音输入 " 这件事情上,国内 AI 大厂和 OpenAI 其实已经走出了两条路。国内大厂目前在做的,是把 AI 装进输入法,用产品的工具属性来满足用户使用 AI 的具体场景。OpenAI 则是在尝试把语音装进 AI 工作台,让用户用 AI 直接操作电脑。
两种路线的根本区别在于,前者争夺的是用户在微信、浏览器、聊天软件、办公软件里的 " 输入权 ",后者争夺的则是 " 操作权 "。某种程度上,OpenAI 的路线明显更具有 AI Native 的风格。但这两种路线本身并不存在高低之分,只是在不同市场环境下天然存在路线差异。
可能很多人会问,为什么国内大厂不直接让用户用语音来操作 AI?这其实不是技术问题,而是生态问题。
在国内的 AI 市场上,几乎每家科技大厂都有自家的 " 大模型 +AI 办公 " 组合。腾讯有混元模型、微信、企业微信、WorkBuddy;阿里有千问、钉钉、千问办公;字节有豆包、飞书以及庞大的内容和办公产品体系。
对于这些公司来说,重新开发一个语音输入法几乎没有什么难度。它们也完全有能力像 OpenAI 一样,在 AI 工作台里加一个语音交互功能,让用户在日常场景中随时调用自家的 AI。
但是如果要做一个可以控制电脑的 AI,首先要考验的就是用户对产品的信任。而在此之前,OpenClaw 曾因为突然失控,爆发泄露用户敏感数据、绝密文件的安全事故,引发用户对 Agent 的信任危机。
此外,控制电脑还需要操作系统权限、应用权限、文件权限和浏览器权限,并且还要面对不同软件之间的兼容问题。这些问题,无疑会在用户教育层面带来大量沟通成本和工作量。在 AI 产品尚未看到 "Token 经济 " 之外的成熟商业化路径之前,国内大厂没有理由也没有必要把步子迈得这么大。
而输入法作为人们习以为常的工具类产品,显然更容易被用户接受。因此,国内大厂们选择只做输入法的策略,明显更符合产品生态的整体布局,商业逻辑也更加清晰。但是这也不代表选择先做输入法的国内大厂,没有看到 AI 操作系统的方向。相反,输入法可能只是它们后续切换到这一方向的一块跳板。
AI 竞争,从输入法走向 " 无形 "
如果回溯国内大厂 AI 产品变化会发现,过去一年各家主打的产品方向已经从 " 有问必答 " 的 AI 助手加速转向 Agent 平台。包括今年以来,AI 办公成为大厂布局 AI 的新舞台。而在另一边,语音输入法产品也是从去年底开始密集发布与更新。
单纯从时间线来看,AI 办公和语音输入法这两类看似独立的产品,意外给人一种渐渐交汇的趋势。而在现实层面,AI 办公也为桌面语音输入提供了一个可用切口。
在过去,AI 办公产品本质上还是一个聊天框,用户输入需求,然后等待提交结果。但现在 Agent 化的 AI 办公产品不再只是回答问题,而是能够写文档、做表格、搜索资料、分析数据、生成代码。而 " 一体多面 " 的 AI 办公工作台,实际上已经越来越像一个桌面 Agent。
这种感觉就像 AI 办公工作台集成了电脑上所有软件功能和文件资料,用户只需要输入具体需求,就可以让 AI 干活。而一旦用户开始习惯 " 让 AI 干活 ",语音输入就变得越来越重要。
试想一下,不久的将来或许会有这样的办公场景:你打开电脑,不用登录任何软件,只需要按下键盘上的语音输入按键,告诉 AI" 先整理昨天的会议纪要,列出今天的待办事项,然后把本周要提交的项目报表更新到最佳状态,下班前再提醒我跟进一下 ",随后 AI 就开始自动执行任务。在整个过程中,你都不需要操作软件,甚至都不必知道会议纪要的文档在哪里、项目报表在哪里。
" 让用户只需要负责说话,活儿都留给 AI 来干 ",这才是 AI 工作台真正成熟的样子,也是 AI 时代使用 AI 的理想方式。而语音输入法,也有了 AI 系统级入口的潜力。
在移动互联网时代,谈到系统级入口,可能更多的人会想到 APP、浏览器、搜索引擎、输入法,因为用户需要借助这些工具才能接入数字世界,从网络上获取信息、完成工作、执行任务。但在 AI 时代,AI 的核心能力不是帮用户找到一个工具,而是直接把任务完成。在这种操作系统下,输入法作为一种被 AI 直接调用的工具,也会像其他工具一样 " 退居幕后 "。
更具想象空间的是,当语音输入成为日常、变成全局可调用的无感交互方式,AI 能够捕捉到的就不只是办公场景下的任务指令,而是用户的想法、计划和意图。用户午饭想吃什么?周末有什么计划?工作遇到了哪些问题?这些需求都会在日常表达中透露出来,AI 不用像如今的某些 APP 一样,要通过监听用户的输入法才能获得 " 搜索关键词 ",因为 AI 本身就已经承担起了输入法的功能。
所以大厂们布局语音输入法的目的,不是为了重新造一个跑得更快的 " 新轮子 ",而是在人与 AI 对话的全新操作方式到来之前,先抢到一张入场券。围绕语音输入法展开的讨论,也不该是 " 它能不能替代键盘?",而是 " 当语音成为系统级操作方式,我们还需不需要输入这件事?"" 当输入走向无形,我们需要怎样的 AI 产品?"。
因为当 AI 已经能够理解自然语言、上下文和用户意图,人类要做的就只剩下表达目的。就像魔法世界里用咒语施法一样,或许未来有一天,AI 也能够让用户只动动嘴就能完成所有工作,真正做到 " 言出法随 "。
在过去,技术的进步往往也伴随着一代人的落后。就像下载 APP、在互联网搜索信息这些基础操作,几乎是 00 后年轻一代用户的 " 出厂设置 ",但对于很多高龄用户而言,要想使用智能手机,还得重新学习、适应系统操作。而在语音成为系统级入口的 AI 时代,技术的使用门槛被逐渐弱化,用户只需要表达目的,剩下的事情交给 AI 完成,这也是 AI 真正有机会改变普通人生活的方向。
语音输入法并不是 AI 的终点,而是一扇通往 AI 时代的大门。谁能够成为人类与数字世界沟通的 " 自然语言 ",谁就能打开这扇门,真正掌握 AI 时代的 " 系统级入口 "。