
【AI破屏而出「AI器物志」开启观察】智能手机统治了过去十几年的数字生态它是注意力的黑洞是最私密的随身之物。但手机设计逻辑止于屏幕而AI需要持续感知物理世界。当AI成为基础能力它迟早要从屏幕里破壳而出这是一个漫长的探索和演化过程。「AI器物志」栏目由此而来爱范儿将和大家一起持续观察AI如何改变硬件设计、重塑人机交互以及以怎样的形态进入日常生活。这是「AI器物志」的第19篇文章。【AI定位转变语音输入需求催生产品】过去两年AI定位从少数人的专业工具转变成日常生活的基础能力人们习惯随时随地向AI发出指令。不过以PC时代键鼠交互为主的人机交互方式逐渐暴露出短板「手动打字」需组织思绪、保持逻辑才能让AI理解。而手机时代的「语音输入」几乎没有这样的桎梏它允许人们一边输出一边思考更接近思维原本发生的方式且不需要稳定桌面环境、持续低头和优秀文字表达能力对普通人来说更接近「真正的自然交互」。这种广泛需求催生出一批围绕语音入口展开的产品如Plaud将录音、转写和总结包装成完整工作流Typeless删除语气词、进行格式清洗后「帮你成文」光帆Lightwear等可穿戴设备试图整合出全场景的完整AI使用流。【语音交互方案多样各有优劣】门槛最低的语音交互方案是一副TWS耳机加手机上的AI能组成24小时在线的虚拟副手。耳机和手机系统、第三方app有现成的语音转写等功能不需要专用硬件就能传达命令给AI模型且速度、兼容性和跨设备能力优于大多数专用AI硬件。然而其瓶颈在于麦克风对环境人声的处理如AirPods在多人环境会采集周围声音而国产品牌TWS耳机采用更激进的人声隔离策略提高了电话和AI语音的准确率。这意味着在AI成为主流使用场景时耳机好坏的评价标准正在改变耳机麦克风正从通话配件变成AI控制器。语音指挥的第二条路线是智能眼镜。唯一成功的智能眼镜是以语音、拍照和开放式音频为核心的基础款因为眼镜显示系统会牺牲重量、续航和成本还需培养全新用户习惯而「看见什么问什么AI讲给你听」已足够构成AI卖点。但智能眼镜存在问题其「无感」多存在于宣传片里会制造社交压力且麦克风阵列、通话降噪和扬声器效果不一定比TWS耳机好还与品牌客户端和云端模型深度绑定用户缺乏自由度如Meta Ray - Ban智能眼镜强制连接Meta AI不能唤醒其他智能助手很难成为主流产品。第三条路线是为语音输入AI制造独立硬件入口。如OpenAI与Work Louder联名的Codex Micro设置了用于语音输入的push - to - talkPTT按键这象征着语音输入开始获得稳定物理位置承认了其高频属性。PTT/TNT更进一步设想是摆脱屏幕OpenAI正在规划无屏便携设备若如此无异于承认了Humane AI Pin的道路且OpenAI的徽章可能更实用。【无声语音交互探索方向逐渐清晰】面对AI语音交互的尴尬和识别失真问题研究者有了奇思妙想。如「超声波舌部动作识别」设备通过探头读取舌头运动解码为语言一些研究尝试把传感器装进眼镜或头显通过面部细微运动识别无声指令苹果收购的Q.ai就是研究这个方向。这些装置虽距消费级产品远存在识别范围、准确率和佩戴体验等限制但方向清晰未来语音交互可能演化为对人类发声动作等的直接识别。【语音输入优势与成本问题】语音输入在AI时代获得超越键盘的声望是因为人类不擅长用视觉信号发送信息发出声音传递信息效率更高。用语音指挥AI虽看似低效但消弭了AI的工具感更接近人类本源的协作方式。然而「语音交互」便利的隐性成本在上升。传统STT工具只转换声音为文字而Typeless等「文本清洗」工具额外调用模型整理改写口语叠加了token消耗。多模态模型进入「原生音频」阶段后token消耗量是纯文本的10倍或更高虽与高清图片和视频处理相比成本不算离谱但在长时间实时对话中用户难控制信息长度导致AI语音交互越自然计算过程越复杂消费成本越高。这几乎成为AI厂商的「阳谋」未来AI业务竞争关键在于谁能以更低延迟、更少冗算和更透明的计费调和不同模态业务的成本差异让人们愿意一直和AI对话。