Ubuntu 26.10实测:新AI语音输入功能Myna上手体验

Ubuntu 26.10实测:新AI语音输入功能Myna上手体验

Myna:Ubuntu的AI语音输入新成员

Ubuntu 26.10即将引入AI驱动的语音输入功能Myna,支持用户通过语音将文本输入任意有效文本框。目前该功能仍处于开发阶段,笔者获取早期版本进行了实测,以了解其当前状态。

随着Ubuntu 26.10进入开发冻结阶段,Myna的用户界面组件逐步完善。本周,默认安装中新增了一个GNOME Shell扩展,用于在Myna监听和录音时显示屏幕指示器,帮助用户直观感知功能状态。

若想了解Myna的更多细节(如功能定位、技术原理),可参考笔者的Myna详解文章(已根据最新信息更新)。

Myna的架构:并非扩展,而是协调器

需明确的是,Myna本身并非GNOME Shell扩展,而是一个协调器(orchestrator)。它的核心职责是管理AI模型的加载、热键激活、音频流传递(从麦克风到模型)、文本转录,并通过IBus将结果反馈至文本框。

但上述扩展至关重要——它是用户可见的部分,用于提示Myna是否正在监听和处理音频(以及是否出现故障)。

实测体验:从激活到转录的全流程

以下是一段简短屏幕录制的截图,展示了激活Myna并在文本编辑器应用中转录简单句子的过程(测试环境为虚拟机,性能仅供参考):

Myna在文本编辑器中的转录演示(虚拟机环境)

Myna的GitHub页面介绍称:“无论您希望免提输入文本、提升可访问性,还是简化工作流程,Myna都能将无缝语音识别直接带到您的Linux生态系统中。”

在笔者测试的版本中,激活Myna的方式是按下(而非按住,这与Canonical之前的描述不同)super + t快捷键,前提是已聚焦要使用语音输入的文本框。

激活后,屏幕上会出现一个OSD(屏幕显示)提示正在监听。说话时,OSD内的“波浪”动画会振荡,这是很好的确认反馈,让用户知道功能正在运行。

完成输入后,再次按下同一快捷键停止监听。OSD动画会停止,音频在后台转录。短暂延迟后,文本将出现在目标应用的文本框中。

Myna的OSD指示器
Myna的OSD指示器提示功能运行状态

根据规格说明,激活Myna后关闭或最小化目标窗口会停止功能,但笔者测试中这一行为并不稳定,不过Myna的OSD偶尔会提示焦点丢失。而切换窗口或使用Alt+Tab不会中断输入——Myna会跟踪目标窗口,避免文本输入到错误的位置!

如果Myna没有检测到音频,会给出提示;它无法转录静音,也不能进行心灵感应式的输入。

AI模型:本地运行,多种选择

Myna由不同AI模型驱动。根据Canonical的说法,所有音频都不会离开设备,Myna完全离线运行,无论是字面意义上还是比喻意义上。此外,用于转录的音频不会被存储、记录或用于训练。

在笔者测试中,Myna使用了Whisper模型,但未来将提供多种本地AI模型(均以snap包形式),包括仅支持NVIDIA GPU、仅支持CPU、支持更广泛语言的模型等。

当该功能进入更广泛的测试阶段时,会根据系统硬件自动选择最佳的本地AI模型。目前,笔者尚未在Snap商店找到语音snap包或Myna调度器,但从GitHub源码成功运行了该功能。好消息是,它工作得相当准确,尽管在虚拟机中运行时稍显缓慢(笔者对源码的稳定性不作保证)。输入成功适配了大多数测试的文本框,包括文本编辑器、GNOME Shell概览和Firefox。

Ubuntu的AI策略:实用为先,可选可控

Canonical将采取审慎态度推进Ubuntu中的AI功能。其工程副总裁Jon Seager表示,为AI而AI通常效果不佳,Ubuntu中的任何功能都需要为用户提供实际价值。

不喜欢AI?Myna预计是可选的,且其及按需下载的语音识别模型均为Snap包,易于卸载和避免。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://www.omgubuntu.co.uk/2026/08/testing-ubuntu-ai-voice-dictation

评论列表

发表评论

你必须 登录 才能发表评论.

为您推荐


请支持IMCN发展!

谁在捐赠

微信捐赠 支付宝捐赠
微信捐赠 支付宝捐赠
ta的个人站点

发表文章4592篇

关注我的头条 不要放弃,百折不挠,坚强、自信。


扫码关注公众号:智享开源

最新科技信息


归档

近期评论