v1.3.2
2026-05-16告诉 Soniox 你在哪个领域说话,识别立刻贴合你的术语圈。
Soniox 设置里新增了「场景标签」(Context Tags)。你可以用 domain / topic / role 这样的键值对告诉模型自己的语境——比如 domain: software engineering、topic: web3 trading bot、role: backend engineer。模型会把这些标签当作识别时的先验,专业术语和缩写的错认率会明显下降。每个 Soniox 用户都不一样,所以这些标签可以随心配,最多 6 组,改完保存即生效。
词汇表换成了「Chip 标签」交互。原来一条条手敲的纠错表现在像贴标签一样,输入即新增,点 × 即删除,所有改动先在本地暂存,按「保存」才一次性下发到 Soniox / 词汇表。这样你可以一口气改十几条再保存,不会因为中途某一条触发重连导致连接抖动。Voilà 自己也内置了一条默认纠错——voila → Voilà,再也不用你手动加了。
四个 Provider 设置页(Soniox / ElevenLabs / Groq / 火山引擎)做了一次完整的视觉重做。原来认证区是自定义卡片、下面是 macOS 原生 Form 分组,两段视觉完全不搭,下半部分还有独立的滚动条。现在整页统一成一个滚动 + 一套卡片样式——上下连贯、宽度一致、保存按钮条也用了不透明背景让对比度更清晰。日常翻设置不再有「这是两个页面拼起来的」错觉。
修了一个 Soniox 异步模式的隐藏 bug:选了 stt-async-v4 后,录音中途会被「首 Token 看门狗」误判为连接异常然后强制重连,整段音频被吞掉。根因是看门狗只按 Provider 维度区分流式/批量,没考虑 Soniox 一个 Provider 跨两种模式的情况。现在异步模式录音稳了。