


1 / 3
全体起立!豆包语音输入支持全局快捷键
起因是发现 GitHub 上有一个项目叫做 Doubao IME Hammerspoon
这个项目做的事情很简单,按下快捷键,切换到豆包的语音输入法,接收语言,识别上屏,然后切换回原有的输入法
会有这样的工具也很好理解,假设你在写代码,这个时候你想写注释,那你是不是得切换到拼音输入法?输入完注释之后,你又想继续写代码,你又得切换回原来的字母输入法。那么这个工具就是用来解决这个问题的,可以方便快速地做语音输入和输入法的切换。
但是会带来一个问题,这个工具首先是基于 Hammerspoon 的。Hammerspoon 是一个基于 Lua 的快捷工具,类似于 Raycast 一样的东西。首先,这个工具我用过,它的界面非常的原始。其次,这一套机制也不是很先进。再者,它是基于 Lua 写的,没有那么多的库可以直接用。最后,它的 UI 库在 Mac 上并没有完全实现。
知道这个项目之后,我也尝试写过自己的工具,不论是直接写,还是说基于 Raycast 去写。虽然最后都有实现,但效果也没有那么让我满意。其实对我而言,语音识别的时候究竟是云端模型还是本地模型都不要紧,因为我不是那么在意隐私(大数据之下哪有)。我关注的是这个东西它能不能很方便的完成我们想要的功能,能不能很快捷的实现我们想要的目的。
例如快速的切换输入法,以及借用豆包或者是微信输入法这样的已经做得很完善的产品,它的语音输入的识别率和准确率都非常的高。
但自己实现就会带来一个问题。虽然我才做到本地模型这一步,也许借用云端的ASR模型能实现更好的识别效果。当然本地也可以有一些优化的方案,例如用更大的模型做一些人声分离和环境音的去噪,然后再给小模型识别。它还有一些其他优化思路,这边不展开。但整体而言,自己如果要是实现这样一套工具的话,要耗费的精力比较大,且 UI 的交互体验也不是那么的友好。
而今天我发现豆包输入法直接更新了这样一个功能,我只能说他们的产品经理真的是非常善于抓住市场需求,或者说他们愿意倾听用户的声音吧。这样的话,可以在不切换输入法的情况下,直接借用豆包的语音输入法,快速地输入我们想要的文字。对我来讲非常友好,因为我不需要频繁地去敲切换输入法的快捷键,对我来说真是方便太多了。
#豆包输入法 #语音输入 #全局快捷键 #输入法切换 #效率工具
起因是发现 GitHub 上有一个项目叫做 Doubao IME Hammerspoon
这个项目做的事情很简单,按下快捷键,切换到豆包的语音输入法,接收语言,识别上屏,然后切换回原有的输入法
会有这样的工具也很好理解,假设你在写代码,这个时候你想写注释,那你是不是得切换到拼音输入法?输入完注释之后,你又想继续写代码,你又得切换回原来的字母输入法。那么这个工具就是用来解决这个问题的,可以方便快速地做语音输入和输入法的切换。
但是会带来一个问题,这个工具首先是基于 Hammerspoon 的。Hammerspoon 是一个基于 Lua 的快捷工具,类似于 Raycast 一样的东西。首先,这个工具我用过,它的界面非常的原始。其次,这一套机制也不是很先进。再者,它是基于 Lua 写的,没有那么多的库可以直接用。最后,它的 UI 库在 Mac 上并没有完全实现。
知道这个项目之后,我也尝试写过自己的工具,不论是直接写,还是说基于 Raycast 去写。虽然最后都有实现,但效果也没有那么让我满意。其实对我而言,语音识别的时候究竟是云端模型还是本地模型都不要紧,因为我不是那么在意隐私(大数据之下哪有)。我关注的是这个东西它能不能很方便的完成我们想要的功能,能不能很快捷的实现我们想要的目的。
例如快速的切换输入法,以及借用豆包或者是微信输入法这样的已经做得很完善的产品,它的语音输入的识别率和准确率都非常的高。
但自己实现就会带来一个问题。虽然我才做到本地模型这一步,也许借用云端的ASR模型能实现更好的识别效果。当然本地也可以有一些优化的方案,例如用更大的模型做一些人声分离和环境音的去噪,然后再给小模型识别。它还有一些其他优化思路,这边不展开。但整体而言,自己如果要是实现这样一套工具的话,要耗费的精力比较大,且 UI 的交互体验也不是那么的友好。
而今天我发现豆包输入法直接更新了这样一个功能,我只能说他们的产品经理真的是非常善于抓住市场需求,或者说他们愿意倾听用户的声音吧。这样的话,可以在不切换输入法的情况下,直接借用豆包的语音输入法,快速地输入我们想要的文字。对我来讲非常友好,因为我不需要频繁地去敲切换输入法的快捷键,对我来说真是方便太多了。
#豆包输入法 #语音输入 #全局快捷键 #输入法切换 #效率工具