リモートインタビューを文字起こし・引用・SRT字幕に:Speak-Yの手順

リモートインタビューから公開できる文字起こしを作る最短の方法は、エピソードの収録と文字起こしを別々の仕事として扱うことです。エピソードはいつもどおりに収録し、同じ通話をSpeak-YにMac上で 会議 として録音させます(ボットは参加しません)。その間、引用するかもしれない発言のたびに ⌥1 を押します。通話後、ホストとゲストに名前を付け、各引用の時刻をクリックして聞き直し、発言を引用としてコピー でコピーします。ゲストの名前と発言の時刻が付いた状態で貼り付けられます。文字起こし全体はTXT、字幕は SRT または VTT で書き出せます。

このガイドは2026年10月1日時点のmacOSアプリを対象に、ごく普通の仕事を1つたどります。Zoom、Google Meet、またはブラウザ上の収録スタジオでゲストと行う1時間のインタビュー、記事用の引用、そして動画版の字幕です。

全体の流れ

インタビューを公開するときに時間がかかるのは、会話の後の作業すべてです。覚えている発言を探し、ゲストが本当にそのとおりに言ったかを確かめ、動画用に時刻を合わせる。この手順では、その大半を通話中のキー操作1回と、通話後の数分に移します。

リモートインタビューから引用と字幕までの5ステップ
2つの録音、通話中のキー操作1回、通話後の数分。手順はこれだけです。

インタビューの前に:Speak-Yが録音するもの、しないもの

Speak-Yは 会議モード がオンのときに通話を録音します(設定 → Interface & Behavior → 会議モード:Off、Manual、Auto)。マイクとMacが再生する音声を取り込むため、Zoom、Microsoft Teams、Google Meet、ブラウザ上のスタジオがすべて同じように録音でき、ゲスト側の参加者一覧には何も表示されません。詳しくはボットなしで会議を録音するをご覧ください。

この録音は文字起こしのためのもので、エピソード用ではありません。Speak-Yは通話の音声を、2人の声が混ざった 16 kHzのモノラル1トラック としてMacに保存します。音声認識や引用の確認には十分ですが、編集や公開には足りません。エピソード自体は、ポッドキャスト用のツールか、通話アプリの録画機能で収録してください。

会話の長さとプランを照らし合わせてください。2026年10月1日時点では次のとおりです。

プラン 1回の会議の上限 月あたりの会議時間
Free 30分 2時間
Pro 60分 10時間
Pro+ 4時間 40時間

録音はプランの上限で止まります。1時間のインタビューに冒頭の雑談が加わると60分を超えるので、毎週配信する番組ならPro+が必要です。

ボットが参加しないため、プラットフォームが代わりに録音を知らせてくれることはありません。通話の中でも招待状でもゲストに確認し、公開前に引用を見てもらうかどうかも決めておきましょう。国ごとの同意のルールは会議の録音は合法かで解説しています。必要なら、設定 → ノート → ノートの種類を追加 を開き、「プルクオート」のような種類を、色とホットキー付きで作成できます。既定のマークは⌥1の この瞬間をマーク です。

インタビュー中:引用する発言をマークする

通話が始まると、Speak-Yは録音ボタンの上に 会議として録音? と表示します。チェックマークをクリックしてください。記事やエピソードの説明文に使いたいことをゲストが言ったら、⌥1 を押します。Speak-Yは直前の15秒をマークし(ボタンに一瞬 直前15秒をマーク と表示されます)、その言葉は後で文字起こしの中でハイライトされます。

通話の後:ホストとゲストに名前を付ける

ミーティング から記録を開きます。Speak-Yはすでに声を分け、最初に話した順に番号を振っています。ホストが話し始めるのが普通なので、あなたが Speaker 1、ゲストが Speaker 2 です。記録の上部にある各チップをクリックし、名前を入力してEnterを押します。これで、すべての発言に名前が表示され、コピーした引用、TXTや字幕のエクスポート、AIアシスタントが読む内容にも名前が入ります。

引用はすべて耳で確かめる

文字起こしは発言の下書きにすぎません。活字になった引用は、そのとおりに言われたという約束です。

会議の発言はその場で編集できません。録音が違う言語で認識されたり、テキストが崩れたりした場合は、… → 再文字起こし を開き、言語 を選んで開始します。Speak-Yは保存済みの音声をもう一度送り、独自の話者分けを持つ新しいバージョンを追加します。今のバージョンも残ります。高精度認識がオンなら、シートで 参加者の人数 も聞かれるので、2を指定します。1語だけの聞き違いなら、その場面を聞いたうえで、引用か書き出したファイルで直すほうが早いでしょう。Speak-Yは67以上の言語を認識します。名前が真っ先に誤認識される理由は音声認識の仕組みで説明しています。

発言から再生しているSpeak-Yのインタビュー記録と上部のプレーヤー
発言の時刻をクリックして聞く。引用は文字起こしではなく、音声と照らし合わせて確認します。

引用と文字起こし全体をコピーする

発言を右クリックし、発言を引用としてコピー を選びます。発言全体が次の形でクリップボードに入ります。

«私が編集部を辞めたのは、お金のためではありません。誰にも何かを確かめる時間がなかったから辞めたんです。» — Dana Reyes, 12:41

時刻は発言の開始位置なので、編集者はその場面をすぐに見つけられます。Speak-Yはテキストを « » で囲みます。媒体の表記ルールに合わせて「」などに置き換えてください。

インタビューの引用を公開する前のチェックリスト
引用が活字になるのは、耳で聞き、音声と照らし合わせ、発言者を明記してからです。

字幕を書き出す:SRTとVTT

同じ ダウンロード メニューに SRT(字幕) と VTT(ウェブ字幕) があります。どちらも中身は同じで、1つの発言が1つの字幕になり、それぞれ話者名で始まります。

48
00:12:41,200 --> 00:13:05,900
Dana Reyes: I didn't leave the newsroom because of the money. I left because nobody had time to check anything.

アップロードする前に知っておきたいことが3つあります。

  1. 時刻はSpeak-Yが録音を始めた瞬間から数えます。 ポッドキャストのツールが録音を始めた瞬間ではありません。エピソードの開始位置が違う場合やイントロをカットした場合は、編集ソフトで字幕をずらしてください。Speak-Yが収録ツールより42秒遅く録音を始めたなら、すべての字幕を42秒後ろにずらします。あるいは完成版を書き出し、記録一覧の上部にある 録画を読み込む… で取り込み、話者に名前を付け直してから、その記録からSRTを書き出します。そうすれば、時刻は公開するファイルと一致します。
  2. 字幕の1区切りは長めです。 1つの発言、または最大約1分の断片です。文字起こしトラックならそのままで構いませんが、画面に表示する字幕にするなら編集ソフトで分割してください。
  3. 名前はテキストに含まれています。 そのまま残すか、字幕に言葉だけを表示したい場合は削除してください。
Speak-Yの字幕の時刻を編集時にずらす必要がある理由
Speak-Yは自分の録音開始から数えます。差の分だけ字幕をずらすか、完成版を読み込んで書き出し直してください。

オプション:AIアシスタントでタイトルと番組ノートを作る

Claude、ChatGPT、CursorなどのMCPクライアントをSpeak-Yに接続していれば(設定 → 連携。MCPサーバーはすべてのプランで無料です)、こう頼めます。

アシスタントはSpeak-Yのライブラリからローカルに文字起こしを読みます。各発言には話者名と開始時刻が付き、マークは別の一覧にあるので、タイムスタンプは録音に基づいたものになります。これはSpeak-Yの時刻なので、必要なら字幕と同じようにずらしてください。モデルはクラウドで動き、文字起こしを受け取ります。公開日まで内容を伏せる約束(エンバーゴ)があるインタビューでは、慎重に判断してください。この種の依頼は会議についてAIに聞くプロンプトでさらに紹介しています。

最後に手元に残るもの

1件のインタビューから、すべての発言に正しい名前が付いた文字起こし、マークした引用(どれも耳で確かめ、時刻付きでコピー済み)、記事用のTXT、動画用のSRTまたはVTTが得られます。エピソードの音声は収録ツールに残ります。インタビューを数多くこなすなら、顧客インタビューから引用を集めるで、タグを付けてすべてをまとめて検索する方法を紹介しています。

FAQ

リモートインタビューを話者名付きの文字起こしにするには?

Speak-Yで通話を会議として録音します。マイクとMacが再生する音声を取り込むので、Zoom、Google Meet、ブラウザにボットが参加することはありません。通話後、Speaker 1とSpeaker 2のチップをクリックしてホストとゲストの名前を入力すれば、すべての発言、コピーした引用、エクスポートにその名前が入ります。

Speak-Yはポッドキャストの収録の代わりになりますか?

なりません。Speak-Yは通話の音声を、2人の声が混ざった16 kHzのモノラル1トラックとしてMacに保存します。引用の確認には十分ですが、エピソードの公開には向きません。エピソードはいつもの収録ツールで録り、文字起こし、引用、字幕にはSpeak-Yを使ってください。

Speak-Yで録音したインタビューから字幕を書き出せますか?

できます。記録で … メニュー → 「ダウンロード」を開き、「SRT(字幕)」または「VTT(ウェブ字幕)」を選びます。字幕の1区切りは1つの発言で、長い回答は約1分ずつに分割され、各区切りは話者名で始まります。時刻はSpeak-Yが録音を始めた瞬間から数えるため、エピソードの開始位置が違う場合は編集ソフトでずらしてください。

会議の文字起こしの誤りを修正できますか?

直接入力しての修正はできません。Speak-Yでは会議の記録の発言は編集できない仕様です。言語が違っていたり、テキストが崩れていたりする場合は、… → 「再文字起こし」で保存済みの音声から新しいバージョンを作成します。古いバージョンも残ります。1語だけの聞き違いなら、その場面を聞いたうえで、引用か書き出したファイルで直してください。

1時間のインタビューにはSpeak-Yのどのプランが必要ですか?

2026年10月1日時点で、Freeは1回30分まで、Proは60分まで、Pro+は4時間までの会議を録音でき、月の会議時間はそれぞれ2時間、10時間、40時間です。1時間の会話に冒頭の雑談が加わると60分を超えるため、Pro+を選んでください。