语音输入
语音输入让你「按住说话」,把识别文字直接送到电脑。
语音模式
点输入框右下角麦克风进入语音模式:键盘隐藏,输入框只读,底部出现「按住说话」按钮。
- 按住开始录音(有震动反馈),说话时实时显示识别中的文字
- 松开发送识别结果,上滑取消
- 点按钮右侧的键盘按钮切回键盘输入
首次使用会请求麦克风权限,点「允许」即可。
需先启用一个语音识别配置,否则无法开始录音。
快捷语音(键盘模式下)
键盘模式下长按麦克风按钮(约 0.4 秒)即可开始快捷语音:切到语音输入、录音、松开发送后自动回到键盘模式,未发送的键盘文字自动恢复。
快捷语音期间电脑热键会被忽略。
语音识别配置
设置 -> 语音识别 管理识别服务,凭据加密存储在手机本地,不上传。
- 点击条目启用 / 禁用(同一时间只能启用一个)
- 右侧编辑图标修改,长按删除,底部「添加配置」新增
新增或修改后点「保存并启用」会自动启用该项并切换到语音模式;禁用全部配置则自动切回键盘模式。
支持的识别服务
- 火山引擎豆包(默认)-- 按住时实时显示识别结果
- 阿里云实时语音识别 -- 实时显示,endpoint 需填业务空间 ID,可选 Qwen3-ASR / Fun-ASR 模型
- 讯飞 -- 按住时实时显示识别结果
- 智谱 GLM-ASR -- 录音结束后返回结果,单次最长 30 秒
- OpenAI Whisper / Groq Whisper -- 录音结束后返回结果,需填写对应 API Key
- 本地 / 自定义 Whisper -- OpenAI 兼容的
/audio/transcriptions接口的自建服务器;Base URL 与 Model 必填,API Key 可选
在电脑端填写
连接电脑时,配置表单中会出现「在电脑端填写」按钮:电脑弹出填写窗口,用键盘输入更快捷,填好后点「发送到手机」自动回填手机表单。
回填不等于保存,仍需在手机上点「保存并启用」。
识别文字处理
语音识别设置中可控制识别结果的自动处理(发送到电脑前生效):
- 中文数字转阿拉伯数字(如「三千二百」-> 3200)
- 日期、货币等格式化
- 标点处理:空格代替标点 / 句末不加标点 / 保留所有标点
- 标点转换:中文 ↔ 英文,或按内容自动转换
- 数字、英文前后加空格
- 首字母自动大写
这些处理与识别服务自带的断句、标点能力相互独立,可按需开启。
收音增强
开启后自动放大轻声说话的音量,静音时不放大环境噪音。适用于安静环境轻声口述、离手机较远时收音。
截图设置坐标
电脑热键在键盘模式下的录音功能,依赖「截图设置坐标」标记的录音键位置(通常为空格键):
设置 -> 截图设置坐标,对当前输入法截图
在截图键盘区域点按空格键位置
点「保存」生效
- 自动适配屏幕旋转与分辨率变化
- 未设置时按热键弹出提示引导设置
- 可「清除所有坐标」清空全部输入法标记
支持的输入法
电脑热键录音支持以下输入法(需开启无障碍服务并完成截图设置坐标):
- 按住录音:豆包、微信 / WeType、百度、搜狗、讯飞、QQ 拼音
- 点击录音:Typeless、Gboard
其他输入法暂不支持,按热键时会显示提示。