Trascrivere un'intervista: citazioni e sottotitoli con Speak-Y

Il modo più breve per passare da un'intervista a distanza a una trascrizione pubblicabile è trattare la registrazione della puntata e la trascrizione come due lavori distinti. La puntata si registra come sempre, mentre Speak-Y registra la stessa chiamata sul Mac come riunione — senza che entri alcun bot — e si preme ⌥1 dopo ogni frase che si potrebbe citare. Dopo la chiamata si danno i nomi al conduttore e all'ospite, si fa clic sull'orario di ogni citazione per ascoltarla e la si copia con Copia la battuta come citazione: arriva con il nome dell'ospite e il minuto in cui è stata detta. La trascrizione completa esce in TXT, i sottotitoli in SRT o VTT.

Questa guida descrive l'app per macOS al 1° ottobre 2026 e segue un lavoro qualsiasi: un'intervista di un'ora con un ospite su Zoom, Google Meet o uno studio nel browser, una citazione per l'articolo e i sottotitoli per il montaggio video.

La procedura in breve

La parte lenta della pubblicazione di un'intervista è tutto ciò che viene dopo la conversazione: ritrovare la frase che si ricorda, verificare che l'ospite l'abbia detta davvero così e sistemare gli orari per il video. Questa procedura sposta quasi tutto in un tasto durante la chiamata e in pochi minuti subito dopo.

Cinque passaggi da un'intervista a distanza a citazioni e sottotitoli
Due registrazioni, un tasto durante la chiamata e pochi minuti dopo: è tutta la procedura.

Prima dell'intervista: che cosa registra Speak-Y e che cosa no

Speak-Y registra le chiamate quando la Modalità riunione è attiva (Impostazioni → Interface & Behavior → Modalità riunione: Off, Manual o Auto). Cattura il microfono e l'audio riprodotto dal Mac, quindi Zoom, Microsoft Teams, Google Meet e gli studi nel browser funzionano allo stesso modo, e nell'elenco dei partecipanti dell'ospite non compare nulla: si veda registrare le riunioni senza bot.

Quella registrazione serve alla trascrizione, non alla puntata. Speak-Y conserva l'audio della chiamata sul Mac come una sola traccia mono a 16 kHz, con le due voci mescolate: abbastanza per il riconoscimento vocale e per verificare una citazione, non abbastanza per montare o pubblicare. La puntata vera e propria si registra con lo strumento per podcast o con la registrazione integrata dell'app di videochiamata.

Conviene confrontare il piano con la durata della conversazione. Al 1° ottobre 2026:

Piano Riunione più lunga Tempo di riunione al mese
Free 30 minuti 2 ore
Pro 60 minuti 10 ore
Pro+ 4 ore 40 ore

La registrazione si ferma al limite del piano, e un'ora di intervista più le chiacchiere iniziali supera i 60 minuti: per un programma settimanale serve Pro+.

Dato che non entra alcun bot, la piattaforma non annuncia la registrazione al posto di chi registra. Va chiesto all'ospite durante la chiamata e nell'invito, concordando anche se vedrà le citazioni prima della pubblicazione; è legale registrare le riunioni? riassume le regole sul consenso paese per paese. Facoltativamente si apre Impostazioni → Note → Aggiungi tipo di nota e si crea un tipo «Citazione» con colore e scorciatoia propri; il marcatore predefinito è Segna il momento su ⌥1.

Durante l'intervista: segnare le frasi da citare

Quando la chiamata inizia, Speak-Y chiede Registrare come riunione? sopra il pulsante di registrazione; si fa clic sul segno di spunta. Quando l'ospite dice qualcosa che si vorrà nell'articolo o nella descrizione della puntata, si preme ⌥1. Speak-Y segna gli ultimi 15 secondi — il pulsante mostra per un attimo Ultimi 15 s segnati — e quelle parole verranno poi evidenziate nella trascrizione.

Dopo la chiamata: dare un nome al conduttore e all'ospite

Si apre la registrazione da Riunioni. Speak-Y ha separato le voci e le numera nell'ordine in cui hanno parlato per la prima volta; di solito apre chi conduce, quindi il conduttore è Speaker 1 e l'ospite Speaker 2. Si fa clic su ciascun chip in cima alla registrazione, si scrive il nome e si preme Invio. Ora ogni battuta lo mostra, e così le citazioni copiate, le esportazioni in TXT e in sottotitoli e ciò che legge un assistente IA.

Verificare ogni citazione a orecchio

Una trascrizione è una bozza di ciò che è stato detto; una citazione stampata è la promessa che è stato detto proprio così.

Le battute di una riunione non si modificano direttamente. Se la registrazione è uscita nella lingua sbagliata o confusa, si apre … → Ritrascrivere, si sceglie la Lingua e si avvia: Speak-Y invia di nuovo l'audio conservato e aggiunge una nuova versione con la propria suddivisione per interlocutori, mantenendo quella attuale. Con il riconoscimento avanzato attivo, la finestra chiede anche Quanti partecipanti: si imposta 2. Una singola parola capita male si corregge prima nella citazione o nel file esportato, dopo aver ascoltato quel momento. Speak-Y riconosce 67+ lingue; come funziona il riconoscimento vocale spiega perché i nomi sono i primi a sbagliare.

Registrazione di un'intervista in Speak-Y riprodotta da una battuta, con il lettore in alto
Si fa clic sull'orario di una battuta per ascoltarla: ogni citazione si verifica sull'audio, non sulla trascrizione.

Copiare la citazione e la trascrizione completa

Si fa clic destro sulla battuta e si sceglie Copia la battuta come citazione. Negli appunti arriva l'intera battuta in questa forma:

«Non ho lasciato la redazione per i soldi. L'ho lasciata perché nessuno aveva il tempo di verificare niente.» — Dana Reyes, 12:41

L'orario è quello in cui inizia la battuta, così la redazione può ritrovare il momento. Speak-Y racchiude il testo tra virgolette « »; si sostituiscono secondo lo stile della propria testata.

Checklist prima di pubblicare una citazione da un'intervista
Una citazione va in stampa solo dopo essere stata ascoltata, confrontata con l'audio e attribuita.

Esportare i sottotitoli: SRT e VTT

Lo stesso menu Scarica contiene SRT (sottotitoli) e VTT (sottotitoli web). Entrambi hanno gli stessi sottotitoli, uno per battuta, ciascuno preceduto dal nome di chi parla:

48
00:12:41,200 --> 00:13:05,900
Dana Reyes: I didn't leave the newsroom because of the money. I left because nobody had time to check anything.

Tre cose da sapere prima di caricarli:

  1. Il conteggio parte da quando Speak-Y ha iniziato a registrare, non dallo strumento per podcast. Se la puntata inizia in un altro momento o si taglia l'intro, i sottotitoli vanno spostati nel programma di montaggio: se Speak-Y è partito 42 secondi dopo lo strumento di registrazione, ogni sottotitolo va posticipato di 42 secondi. In alternativa si esporta il montaggio finale, lo si importa con Importa registrazione… in cima all'elenco delle registrazioni, si danno di nuovo i nomi agli interlocutori e si esporta l'SRT da quella registrazione: a quel punto gli orari coincidono con il file pubblicato.
  2. I sottotitoli sono lunghi: una battuta o un frammento fino a circa un minuto. Vanno bene per una traccia di trascrizione; per i sottotitoli a schermo conviene dividerli nel programma di montaggio.
  3. I nomi sono nel testo. Si possono tenere, oppure togliere se i sottotitoli devono mostrare solo le parole.
Perché gli orari dei sottotitoli di Speak-Y possono richiedere uno spostamento nel montaggio
Speak-Y conta dal proprio avvio: si spostano i sottotitoli dello scarto, oppure si importa il montaggio finale e si esporta di nuovo.

Facoltativo: titoli e note della puntata con l'assistente IA

Se Claude, ChatGPT, Cursor o un altro client MCP è collegato a Speak-Y (Impostazioni → Integrazioni; il server MCP è gratuito in tutti i piani), si può chiedere:

L'assistente legge la trascrizione in locale dalla libreria di Speak-Y, con il nome di chi parla e l'orario di inizio su ogni battuta e i marcatori in un elenco a parte, quindi i suoi timestamp vengono dalla registrazione. Sono gli orari di Speak-Y, perciò se serve vanno spostati come i sottotitoli. Il modello gira nel cloud e riceve la trascrizione: per un'intervista sotto embargo conviene pensarci due volte. Prompt per interrogare l'IA sulle proprie riunioni raccoglie altre richieste di questo tipo.

Che cosa si ottiene alla fine

Un'intervista dà una trascrizione con il nome giusto su ogni battuta, le citazioni segnate — ognuna ascoltata e copiata con il suo orario —, un TXT per l'articolo e un SRT o VTT per il video. L'audio della puntata resta nello strumento di registrazione. Si fanno molte interviste? Interviste ai clienti: trovare le citazioni mostra come assegnare i tag e cercare in tutte in una volta.

FAQ

Come si trasforma un'intervista a distanza in una trascrizione con i nomi di chi parla?

Si registra la chiamata in Speak-Y come riunione: l'app cattura il microfono e l'audio riprodotto dal Mac, quindi nessun bot entra in Zoom, Google Meet o nel browser. Dopo la chiamata si fa clic sui chip Speaker 1 e Speaker 2 e si scrivono i nomi del conduttore e dell'ospite; da quel momento li riportano ogni battuta, ogni citazione copiata e ogni esportazione.

Speak-Y può sostituire la registrazione del podcast?

No. Speak-Y conserva l'audio della chiamata sul Mac come una sola traccia mono a 16 kHz con le due voci mescolate: basta per verificare una citazione, non per pubblicare una puntata. La puntata si registra con il solito strumento di registrazione, e Speak-Y serve per la trascrizione, le citazioni e i sottotitoli.

Si possono esportare i sottotitoli di un'intervista registrata in Speak-Y?

Sì. Nella registrazione si apre il menu …, poi Scarica, e si sceglie SRT (sottotitoli) o VTT (sottotitoli web). Ogni sottotitolo corrisponde a una battuta, una risposta lunga viene divisa in pezzi di circa un minuto e ogni sottotitolo inizia con il nome di chi parla. Gli orari partono dal momento in cui Speak-Y ha iniziato a registrare, quindi vanno spostati nel programma di montaggio se la puntata inizia altrove.

Si può correggere un errore nella trascrizione di una riunione?

Non scrivendo: le battute di una registrazione di riunione non si possono modificare in Speak-Y. Se la lingua era sbagliata o il testo è uscito confuso, … → Ritrascrivere crea una nuova versione dall'audio conservato; la vecchia resta. Una singola parola capita male si corregge nella citazione o nel file esportato, dopo aver riascoltato quel momento.

Quale piano di Speak-Y serve per un'intervista di un'ora?

Al 1° ottobre 2026 Free registra riunioni fino a 30 minuti, Pro fino a 60 minuti e Pro+ fino a 4 ore, con rispettivamente 2, 10 e 40 ore di riunione al mese. Un'ora di conversazione più le chiacchiere iniziali supera i 60 minuti, quindi conviene puntare su Pro+.