Come convertire la tua voce in testo con Whisper per Windows di OpenAI

Whisper di OpenAI è una nuova soluzione basata sull'intelligenza artificiale che può aiutarti a convertire la tua voce in testo in un modo unico. Soprattutto, è gratuito.

Tuttavia, c'è un problema relativamente minore: l'installazione e l'utilizzo sono molto più difficili con un normale strumento di Windows. Soprattutto se vuoi utilizzare i core Tensor dalla tua scheda grafica Nvidia per dargli una bella spinta. Verificare I migliori strumenti basati sull'intelligenza artificiale per creare arte fotografica dalla tua scrittura gratuitamente.

Non dovresti disperare, però. Ecco perché siamo qui! Continua a leggere per sapere come installarlo e usarlo, ma anche, se possiedi una scheda grafica Nvidia, ti mostreremo come Whisper può trarne vantaggio.

Cos'è Whisper di OpenAI?

ChatGPT sta rapidamente diventando popolare tra gli utenti e abbiamo già visto come puoi usarlo ChatGPT di OpenAI. Tuttavia, non è l'unico progetto interessante di OpenAI.

Alimentato da deep learning e reti neurali, Whisper è un sistema di elaborazione del linguaggio naturale in grado di "capire" il parlato e convertirlo in testo. Ma dispone anche di diverse configurazioni personalizzate nel suo campo, superando tutte le soluzioni simili grazie a:

  1. Whisper è una soluzione di intelligenza artificiale "addestrata" al linguaggio naturale. Quindi, capire il linguaggio umano "normale" è meglio delle vecchie soluzioni.
  2. Whisper non viene fornito con un'interfaccia, né può registrare l'audio. Può solo prendere file audio esistenti e produrre file di testo.
  3. Oltre a "capire la lingua", Whisper ha anche il meglio in assoluto nella traduzione automatica.
  4. Whisper non è un servizio online e può funzionare completamente offline.
  5. Se disponi di una scheda grafica Nvidia (GTX970 o successiva), Whisper può essere eseguito in "modalità con accelerazione hardware" per velocizzarne la risposta.
  6. Non è necessario registrarsi, acquistare una licenza o acquistare un abbonamento.

Perché la scheda grafica AMD non è supportata?

Affinché le GPU siano utili per qualcosa di più del semplice output grafico, devono funzionare come processori completamente programmabili. Ecco perché Nvidia ha creato l'architettura CUDA, che è ufficialmente una "piattaforma di calcolo parallela e modello di programmazione".

CUDA è una tecnologia proprietaria Nvidia, compatibile solo con le GPU Nvidia. Le sue alternative più vicine ad AMD sono OpenCL e Radeon Compute Platform.

Rispetto alle alternative, CUDA è più maturo, ad alte prestazioni e più facile da usare. Pertanto, la maggior parte degli sviluppatori prende di mira solo CUDA, il che a sua volta significa che le loro applicazioni sfruttano solo le funzionalità hardware delle GPU Nvidia. Questo include Whisper. Verificare Confronto tra schede grafiche AMD e NVIDIA su Linux: quale utilizzare?

Come scaricare e installare Whisper

Sfortunatamente, Whisper non è un'app autonoma che puoi scaricare, installare ed eseguire normalmente. Dipende anche da altre dipendenze che devono essere installate.

Per Windows, per mantenere semplice questa guida, utilizzeremo il popolarissimo Chocolatey per installare la maggior parte delle app necessarie. Consulta la nostra guida su Il modo più veloce per installare le app di Windows Per ulteriori informazioni su Chocolatey.

Sia per Linux che per Mac, il processo di installazione (ad eccezione della variabile del percorso di Windows e dei pratici file batch che creeremo) dovrebbe essere simile.

  • Per installare e utilizzare Whisper, Python e il suo strumento PIP devono essere installati e aggiunti alla variabile "Path" di Windows. Per informazioni su questo, vedere il nostro articolo su Come installare Python PIP su Windows و Mac e Linux.
  • installare FFMPEG Attraverso Chocolatey usando questo comando:
choco installa ffmpeg

  • Inoltre, installa la sua versione Python con:
pip3 installa python-ffmpeg
  • Infine, installa Whisper dalla sua pagina Github con:
pip3 installa git+https://github.com/openai/whisper.git

Ottieni una versione abilitata per CUDA di Whisper

Sebbene Whisper non utilizzi principalmente GPU Nvidia, il pacchetto Torch su cui si basa offre una versione con accelerazione CUDA. Usarlo al posto della versione "normale" di Whisper può aiutare a completare le trascrizioni più velocemente con l'aiuto di una scheda grafica Nvidia.

Per Whisper, che utilizza CUDA di Nvidia:

  • Se hai già installato la versione "vanilla" di Torch, disinstallala ed elimina i file rimanenti usando:
pip3 disinstalla torch
  • Una volta fatto, seguilo con il seguente comando:
pulizia della cache pip
  • Installa la versione abilitata per CUDA di Torch con il comando:
pip3 installa torch torchvision torchaudio — extra-index-url https://download.pytorch.org/whl/cu117

  • Per verificare se Whisper può utilizzare la GPU Nvidia:
sussurro — aiuto | findstr -i pytorch

Dovresti vedere (predefinito: cuda) invece di (predefinito: cpu). Verificare Rafforzando i motivi per cui ChatGPT non accetta il tuo lavoro di scrittura di contenuti.

Cosa fare se Torch non si installa

Se riscontri un errore "Nessuna versione trovata" durante l'installazione di Torch, potrebbe essere necessario installare una versione precedente di Python parallela alla versione corrente.

Usa questo comando per farlo:

choco install python — versione OLDER_VERSION — affiancata

Sostituisci "OLDER_VERSION" con una versione come 3.10.

Successivamente, utilizza il percorso della versione secondaria per tutti i comandi Whisper "globali" (ad esempio, "c:\Python310\Scripts\pip.exeinvece di solo "pip").

Come registrare la tua voce

Puoi utilizzare qualsiasi applicazione di registrazione audio per convertire la tua voce in un file WAV o MP3. Windows include un'app di questo tipo: per ulteriori informazioni, vedi Come usarla App registratore vocale su Windows 10.

Per un'opzione completa, prova Audacity. Scopri come farlo con la nostra guida su Come usare Audacity Per registrare l'audio su Windows e Mac.

Come iniziare a scrivere con Whisper

Sebbene Whisper non sia dotato di una semplice GUI, il suo utilizzo è molto fluido.

Diciamo che abbiamo un file LatestNote.mp3 in lingua greca, nella cartella c:\MyAudioFiles, e vogliamo tradurlo in inglese e copiarlo in un file di testo.

cd C:\I miei file audio
  • Eseguiamo Whisper nel file con:
sussurro — modello base — linguaggio gr — compito tradurre LatestNote.mp3

Una volta elaborato, il file di testo (denominato "LatestNote.mp3.txt") verrà visualizzato nella stessa cartella. Aprilo in un editor di testo come Blocco note per visualizzare il testo tradotto.

Abbiamo usato una traduzione di esempio perché la trascrizione in inglese è più chiara: basta usare i tag “lose”, “ –language” e “-task”. Pertanto, per una semplice trascrizione fonetica, il comando precedente sarebbe:

sussurro — modello base LatestNote.mp3

Il tag "modello" è obbligatorio perché Whisper utilizza una delle diverse opzioni. Permettici di espanderlo per aiutarti a scegliere quello migliore per le tue esigenze. Verificare Cos'è la funzione voce fuori campo? Qual è il suo ruolo e come ci lavori?

Quale modello scegliere?

Whisper offre diversi modelli linguistici. Più grande è il modello, maggiore è la sua precisione, ma anche maggiori sono i suoi requisiti hardware. Che è:

  • Piccolo.
  • Basato.
  • Piccolo.
  • Medium.
  • Grande.

Le forme Tiny o Base dovrebbero andare bene per la maggior parte degli anglofoni. I non madrelingua inglese possono vedere risultati migliori con i modelli più grandi, come il medio e il grande.

Si noti, tuttavia, che i modelli Medium e Large richiedono più di 8 GB di VRAM (ovvero "la memoria della tua GPU").

Per selezionarne uno, specificare il modello dopo il tasto " — modello" nel comando:

sussurro — modello minuscolo/piccolo/medio/grande [file]

Per esempio:

sussurro — piccolo modello My_Voice_Note.mp3

Come semplificare la trascrizione

Dover digitare l'intero comando Whisper ogni volta che si desidera trascrivere dell'audio può diventare noioso rapidamente. Creiamo un file batch accessibile a livello globale per semplificare il processo.

  • Avvia Esplora risorse e visita l'unità C:.
  • Crea una cartella per gli script e copia il suo percorso negli appunti.
  • Nel menu Start di Windows, cerca e seleziona Percorso Modificare le variabili di ambiente del sistema.

  • Cercare Cambio di percorso all'interno delle variabili utente per YOUR_USERNAME. Fare doppio clic su di esso per modificarlo. Clic Nuovo e incolla il percorso nella cartella degli script. Fare clic su OK per accettare le modifiche.

  • Torna alla cartella degli script in Esplora risorse. Crea un nuovo file batch chiamato "wht.bat". "Al suo interno", aggiungi questo comando:
sussurro — modello minuscolo — linguaggio in %1

  • Crea due file batch, "whs" e "whm".
  • Aggiungi questo comando all'interno del primo file:
sussurro — piccolo modello — linguaggio in %1
  • Aggiungi questo comando all'interno del secondo file:
sussurro — modello medio — linguaggio in %1

Congratulazioni, ora hai tre file per utilizzare facilmente i modelli Whisper Small, Medium e Basic con i tuoi file audio! Per convertire qualsiasi file audio in testo:

  • Individua il file utilizzando Esplora file di Windows.
  • Fai clic con il pulsante destro del mouse su uno spazio vuoto e scegli Apri nel terminale.
  • Digita questo comando, sostituendo "wht" con "whs" o "whm" per utilizzare forme linguistiche piccole o medie:
wht IL_TUO_FILE_AUDIO.mp3

Scrivi rapidamente contenuti audio con Whisper

Anche i dattilografi più veloci non possono eguagliare la velocità con cui parliamo. Tuttavia, fino a poco tempo fa, parlare piuttosto che scrivere non era ottimale per la creazione di documenti.

La maggior parte delle soluzioni audio-testo ha prodotto risultati mediocri. Potresti trovare alcune soluzioni che valeva la pena provare, ma erano troppo complicate da usare o troppo costose. Fortunatamente, Whisper ha cambiato tutto questo.

Dopo i passaggi precedenti, dovresti essere pronto a trascrivere o tradurre la tua voce in alta definizione, con un solo comando. Puoi visualizzare ora Le migliori app da voce a testo per prendere appunti, riunioni e conferenze.

Vai al pulsante in alto