Skip to main content

L'état de la reconnaissance vocale sous Linux

Things Mr. Welch is No Longer Allowed to do in a RPG #1-2450 Reading Compilation (Juillet 2026)

Things Mr. Welch is No Longer Allowed to do in a RPG #1-2450 Reading Compilation (Juillet 2026)
Anonim

Je passe beaucoup de temps à chercher des articles et, assez souvent, je réfléchis au sujet d'un article lorsque je me rends à la gare ou lorsque je me promène en général.

Un soir, alors que je marchais sur une distance de 1,5 km pour me rendre à la gare, je me suis dit que "ça ne serait pas bien si je pouvais enregistrer ce que je voulais dire puis le transcrire automatiquement en fichier texte que je pourrais éditer et formater plus tard" .

J'ai passé de longues heures à examiner les différentes options disponibles pour la reconnaissance vocale et la dictée, notamment enregistrer directement à l'aide d'un microphone à l'aide d'un logiciel de dictée sous Linux, enregistrer le fichier au format MP3 ou WAV, le convertir via la ligne de commande et utiliser Chrome. et applications Android.

Cet article met en évidence mes découvertes après des jours de dur labeur.

Options Linux

Essayer de trouver un logiciel de dictée et de reconnaissance vocale sous Linux n’est pas aussi facile qu’il pourrait l’être et les options disponibles ne sont pas aussi intelligentes.

Cette page wikipedia présente une liste d'options potentielles, notamment CMU Sphinx, Julius et Simon.

J'utilise SparkyLinux qui est basé sur les tests Debian pour le moment et je peux vous dire que le seul logiciel de reconnaissance vocale disponible dans les référentiels est Sphinx.

Les programmes Linux natifs que j'ai finalement essayés étaient PocketSphinx, avec lesquels je convertissais les fichiers WAV en texte et Freespeech-VR, une application python permettant d’enregistrer directement à partir d’un microphone.

J'ai également essayé quelques applications Chrome, notamment VoiceNote II et Dictanote.

Enfin, j'ai essayé les applications Android «Dictée et courriel» et «Talk And Talk Dictation».

Freespeech-VR

Freespeech-VR n'est pas disponible dans les référentiels standard. J'ai téléchargé les fichiers d'ici.

Après le téléchargement et l'extraction du contenu du fichier zip, j'ai ouvert un terminal et navigué jusqu'au dossier où les fichiers ont été extraits. J'ai tapé la commande suivante pour ouvrir freespeech-vr.

sudo python freespeech-vr

J'ai une paire d'écouteurs avec un microphone assez correct et un accent du sud anglais assez clair.

Le texte suivant est apparu dans la fenêtre freespeech-vr:

Bienvenue dans l'unité des chiens de résultats Aujourd'hui Nous devons nous assurer Comment gérer les tests Une fois à utiliser Utilise le système de manière vocale Parlez-moi l'un à l'autre était seulement dans l'espoir de rester Et à moyen d'un poulet d'or comme système Le Ea quand c’est mon nom appelle le téléphone suivant Ce fichier Bientôt assez de cas un téléphone passe à la main - Espace le sphinx Going Ce n’est pas un téléphone qui sera partagé A formé et et outils Utilisez parler Quand vous avez fini Dites un fichier utilisé Last a histoire A Et en utilisant un par le quand il est très comment succès Ce Linux était comme ne vous évitez est

Je voudrais juste dire maintenant que ce n’est pas le site Web de Unit Of Dogs et qu’à aucun moment je n’ai parlé de quoi que ce soit avec les poules Golden. J'essayais en réalité de décrire le processus d'utilisation d'un logiciel de reconnaissance vocale.

J'ai essayé le logiciel plusieurs fois, notamment en modifiant la hauteur et la vitesse, mais la précision était médiocre.

PocketSphinx

PocketSphinx est capable de convertir un fichier WAV en texte en utilisant la ligne de commande. PocketSphinx est disponible via les référentiels Debian et devrait être disponible pour la plupart des distributions.

Le principal problème que j'ai constaté avec PocketSphinx est qu'il vous faut pratiquement un diplôme en concepts de reconnaissance vocale, de fichiers de langue, de dictionnaires et de formation du système.

Après avoir installé PocketSphinx, vous devez vous rendre sur le site Web de la CMU Sphinx et lire autant d’informations que possible. Vous devez également télécharger le fichier de modèle suivant.

  • Modèle de langage générique anglais américain

(Si vous n’êtes pas anglophone, choisissez le modèle de langue qui vous convient).

La documentation de PocketSphinx et de Sphinx en général est difficile à comprendre pour le profane, mais d'après ce que j'ai pu en déduire, les fichiers de dictionnaire sont utilisés pour fournir une liste de mots possibles et les modèles de langage ont une liste de prononciations potentielles.

Pour tester PocketSphinx, j'ai utilisé un enregistrement de ma propre voix, un extrait d'Al Pacino dans "The Devils Advocate" et un extrait de "Morgan Freeman". Le but de ceci était d'essayer différentes voix et pour moi, personne ne peut raconter une histoire aussi clairement que Morgan Freeman et personne ne livre une phrase comme Al Pacino.

Pour que PocketSphinx fonctionne, il a besoin d’un fichier WAV et d’un format spécifique. Si le fichier est au format MP3, utilisez la commande ffmpeg pour le convertir au format WAV:

ffmpeg -i nom_fichier_entrée.mp3 -acodec pcm_s16le -ar 16000 nomfichier_sortie.wav

Pour exécuter PocketSphinx, utilisez la commande suivante:

pochesphinx_continuous -dict /usr/share/pocketsphinx/model/lm/en_US/cmu07a.dic -infile voice2.wav -lm cmusphinx-5.0-en-us.lm 2> voice2.log

pochesphinx_continuous prend un fichier WAV et le convertit en texte.

Dans la commande ci-dessus, pochesphinx utilise un fichier de dictionnaire appelé "/usr/share/pocketsphinx/model/lm/en_US/cmu07a.dic" avec le modèle de langage "cmusphinx-5.0-en-us.lm". Le fichier en cours de conversion en texte s'appelle voice2.wav (un enregistrement que j'ai fait avec ma voix). Enfin, le 2> place toutes les sorties prolixes dont vous n’avez pas nécessairement besoin dans un fichier appelé voice2.log. Les résultats réels du test sont affichés dans la fenêtre du terminal.

Les résultats obtenus avec ma voix sont les suivants:

bienvenue à la prochaine à propos bien pas cette semaine sujet sur quel logiciel de reconnaissance dans une minute

Les résultats ne sont pas aussi épouvantables qu'avec freespeech-vr mais ne sont pas encore vraiment utilisables. J'ai ensuite essayé d'utiliser PocketSphinx avec Al Pacino mais cela n'a donné aucun résultat.

Enfin, j'ai essayé d'utiliser la voix de Morgan Freeman du film "Bruce Almighty" et voici les résultats:

000000000: nous allons sur elle000000001: sont-ils si durs oui le jour où en ce moment c'est le maximum que nous ayons vécu je fais partie du chaud000000002: dans l'ascenseur, clé d'un match de baseball ou sachant quoi faire dans la vie000000003: quels sont ceux qui vont récupérer000000004: ils ne l'ont pas écrit000000005: ils ont sur moi dès la sortie000000006: vous devez être des règles000000007: je vous attendais000000008: et il a appris ici qu'il s'agissait d'une illustration de la fête de Noël tueuse000000009: il s'avère être l'un des moyens d'écrire o. cul je pensais que peu en portaient toujours un000000010: comme le problème uni ne donnera pas le bon je suis le estimé à ce moment où nous n'avons pas tout ce que vous pensez je suis dans le monde sera la maison et j'ai vu que000000011: un père qui l'a000000012: qu'est-ce que c'est beaucoup000000013: est-ce que c'est donné000000014: tout ce que vous ceux qui ne tombent pas pour beaucoup000000015: à l'automne000000016: tiens bon juste pour moi000000017: c'est un malheur si je pense aussi qu'ils vont avoir un que le tout cela marié sur un était pas nous faisons j'aime l'inverse de la façon

Mon test peut difficilement être considéré comme scientifique et les développeurs de PocketSphinx peuvent déclarer que je n’utilise pas le logiciel correctement. Il existe également une technique appelée formation vocale qui peut être utilisée pour créer de meilleurs dictionnaires et fichiers de langue.

Mon opinion dominante est que c'est trop difficile pour un usage quotidien standard.

VoiceNote II

VoiceNote II est une application Chrome qui utilise l'API de reconnaissance vocale de Google Voice.

Si vous utilisez les navigateurs Chrome ou Chromium, vous pouvez installer VoiceNote II via le Web Store.

Les icônes de la VoiceNote II sont présentées de manière étrange, car vous devez définir la langue en bas de la fenêtre et le bouton Modifier également en bas. Toutefois, le bouton d’enregistrement est en haut à droite.

La première chose à faire est de sélectionner une langue. Pour ce faire, cliquez sur l'icône du monde.

Pour commencer l'enregistrement, cliquez sur l'icône du microphone et commencez à parler dans votre microphone. Pour obtenir les meilleurs résultats, j’ai trouvé que parler lentement était la clé pour que le logiciel puisse suivre.

Les résultats n'étaient pas excellents, comme on peut le voir ci-dessous:

Bonjour et bienvenue pour vous connecter. Go-Travels.com articles du jour sur la conversion de la voix en texte dunelm farrell recession 2008 en tant que conversions et affirmations bien étayées de la meilleure façon dont j'ai trouvé l'addon de texte vocal pour montrer le paquet 2014debian ou rpm l'ouvrir type de voix à parole en texte l'ouvrir si vous voulez choisir vs choisi à Edimbourg français allemand vous faire passer le temps au Royaume-Uni à partir de la mer microphone ce que vous avez fini d'écrire votre texte en fichier texte à son succès bien c'est l'accent anglais très standard du sud de l'angleterre meilleur pour cela mais je vais au textepar ce texte torrentalong avec le document lui-même et vous pouvez voir les erreurs qui vous remercient d’écouter vos amis

Dictanote

Dictanote est une autre application Chrome qui peut être utilisée à des fins de dictée. Elle semble être plus intuitive, mais les résultats obtenus ne sont pas meilleurs que ceux de VoiceNote II.

J'ai uniquement utilisé la version de démonstration de Dictanote, qui vous empêche de créer de nouveaux documents, mais vous permet de parler d'un texte déjà présent dans l'éditeur. J'ai pu tester la reconnaissance vocale mais les résultats ne sont pas meilleurs que ceux de VoiceNote II et je ne me suis donc pas inscrit à la version professionnelle.

Dictée et courrier

"Dictation And Mail" est une application Android qui utilise l'API de reconnaissance vocale native de Google.

Les résultats de "Dictation and Mail" étaient bien meilleurs que ceux des autres programmes tentés jusqu'à présent.

bonjour bienvenue sur Linux lifewire., Aujourd’hui, nous parlons de convertir le son en texte

Le truc avec "Dictée et Mail" est de parler lentement et de prononcer le mieux possible avec un accent égal.

Une fois que vous avez fini de parler, vous pouvez vous envoyer les résultats par courrier électronique.

Talk And Talk Dictation

L'autre application Android que j'ai essayée était "Talk And Talk Dictation".

L'interface de cette application était la meilleure du groupe et la reconnaissance vocale a très bien fonctionné. Après avoir enregistré la dictée, j'ai pu partager les résultats de différentes manières, notamment par courrier électronique.

bienvenue à linux Go-Travels.com aujourd'hui, nous parlons de la conversion de la parole en texte

Comme vous pouvez le constater, le texte ci-dessus est aussi clair que possible. Parler lentement est la clé.

Résumé

Natif Linux a encore du chemin à faire en ce qui concerne la reconnaissance vocale et plus particulièrement la dictée. Certaines applications utilisent l'API Google Voice, mais elles ne figurent pas encore dans les référentiels.

Les applications ChromeOS sont un peu meilleures, mais les meilleurs résultats ont été obtenus avec mon téléphone Android. Peut-être que le téléphone a un meilleur microphone et que, par conséquent, le logiciel de reconnaissance vocale a de meilleures chances de conversion.

Pour que la reconnaissance vocale devienne vraiment utilisable, elle doit être plus intuitive et nécessiter moins de configuration. Vous ne devriez pas avoir à vous soucier des modèles de langage et des dictionnaires pour le rendre intelligible.

J'apprécie toutefois que tout l'art de la reconnaissance vocale soit très difficile, car tout le monde a une voix différente et il y a tellement de dialectes d'une région à l'autre dans un pays indifférent aux centaines de langues utilisées dans le monde.

Mon analyse est donc que le logiciel de reconnaissance vocale est toujours en cours de développement.