リモートインタビューから公開できる文字起こしを作る最短の方法は、エピソードの収録と文字起こしを別々の仕事として扱うことです。エピソードはいつもどおりに収録し、同じ通話をSpeak-YにMac上で 会議 として録音させます(ボットは参加しません)。その間、引用するかもしれない発言のたびに ⌥1 を押します。通話後、ホストとゲストに名前を付け、各引用の時刻をクリックして聞き直し、発言を引用としてコピー でコピーします。ゲストの名前と発言の時刻が付いた状態で貼り付けられます。文字起こし全体はTXT、字幕は SRT または VTT で書き出せます。
このガイドは2026年10月1日時点のmacOSアプリを対象に、ごく普通の仕事を1つたどります。Zoom、Google Meet、またはブラウザ上の収録スタジオでゲストと行う1時間のインタビュー、記事用の引用、そして動画版の字幕です。
インタビューを公開するときに時間がかかるのは、会話の後の作業すべてです。覚えている発言を探し、ゲストが本当にそのとおりに言ったかを確かめ、動画用に時刻を合わせる。この手順では、その大半を通話中のキー操作1回と、通話後の数分に移します。

Speak-Yは 会議モード がオンのときに通話を録音します(設定 → Interface & Behavior → 会議モード:Off、Manual、Auto)。マイクとMacが再生する音声を取り込むため、Zoom、Microsoft Teams、Google Meet、ブラウザ上のスタジオがすべて同じように録音でき、ゲスト側の参加者一覧には何も表示されません。詳しくはボットなしで会議を録音するをご覧ください。
この録音は文字起こしのためのもので、エピソード用ではありません。Speak-Yは通話の音声を、2人の声が混ざった 16 kHzのモノラル1トラック としてMacに保存します。音声認識や引用の確認には十分ですが、編集や公開には足りません。エピソード自体は、ポッドキャスト用のツールか、通話アプリの録画機能で収録してください。
会話の長さとプランを照らし合わせてください。2026年10月1日時点では次のとおりです。
| プラン | 1回の会議の上限 | 月あたりの会議時間 |
|---|---|---|
| Free | 30分 | 2時間 |
| Pro | 60分 | 10時間 |
| Pro+ | 4時間 | 40時間 |
録音はプランの上限で止まります。1時間のインタビューに冒頭の雑談が加わると60分を超えるので、毎週配信する番組ならPro+が必要です。
ボットが参加しないため、プラットフォームが代わりに録音を知らせてくれることはありません。通話の中でも招待状でもゲストに確認し、公開前に引用を見てもらうかどうかも決めておきましょう。国ごとの同意のルールは会議の録音は合法かで解説しています。必要なら、設定 → ノート → ノートの種類を追加 を開き、「プルクオート」のような種類を、色とホットキー付きで作成できます。既定のマークは⌥1の この瞬間をマーク です。
通話が始まると、Speak-Yは録音ボタンの上に 会議として録音? と表示します。チェックマークをクリックしてください。記事やエピソードの説明文に使いたいことをゲストが言ったら、⌥1 を押します。Speak-Yは直前の15秒をマークし(ボタンに一瞬 直前15秒をマーク と表示されます)、その言葉は後で文字起こしの中でハイライトされます。
ミーティング から記録を開きます。Speak-Yはすでに声を分け、最初に話した順に番号を振っています。ホストが話し始めるのが普通なので、あなたが Speaker 1、ゲストが Speaker 2 です。記録の上部にある各チップをクリックし、名前を入力してEnterを押します。これで、すべての発言に名前が表示され、コピーした引用、TXTや字幕のエクスポート、AIアシスタントが読む内容にも名前が入ります。
文字起こしは発言の下書きにすぎません。活字になった引用は、そのとおりに言われたという約束です。
会議の発言はその場で編集できません。録音が違う言語で認識されたり、テキストが崩れたりした場合は、… → 再文字起こし を開き、言語 を選んで開始します。Speak-Yは保存済みの音声をもう一度送り、独自の話者分けを持つ新しいバージョンを追加します。今のバージョンも残ります。高精度認識がオンなら、シートで 参加者の人数 も聞かれるので、2を指定します。1語だけの聞き違いなら、その場面を聞いたうえで、引用か書き出したファイルで直すほうが早いでしょう。Speak-Yは67以上の言語を認識します。名前が真っ先に誤認識される理由は音声認識の仕組みで説明しています。

発言を右クリックし、発言を引用としてコピー を選びます。発言全体が次の形でクリップボードに入ります。
«私が編集部を辞めたのは、お金のためではありません。誰にも何かを確かめる時間がなかったから辞めたんです。» — Dana Reyes, 12:41
時刻は発言の開始位置なので、編集者はその場面をすぐに見つけられます。Speak-Yはテキストを « » で囲みます。媒体の表記ルールに合わせて「」などに置き換えてください。

同じ ダウンロード メニューに SRT(字幕) と VTT(ウェブ字幕) があります。どちらも中身は同じで、1つの発言が1つの字幕になり、それぞれ話者名で始まります。
48
00:12:41,200 --> 00:13:05,900
Dana Reyes: I didn't leave the newsroom because of the money. I left because nobody had time to check anything.
アップロードする前に知っておきたいことが3つあります。

Claude、ChatGPT、CursorなどのMCPクライアントをSpeak-Yに接続していれば(設定 → 連携。MCPサーバーはすべてのプランで無料です)、こう頼めます。
アシスタントはSpeak-Yのライブラリからローカルに文字起こしを読みます。各発言には話者名と開始時刻が付き、マークは別の一覧にあるので、タイムスタンプは録音に基づいたものになります。これはSpeak-Yの時刻なので、必要なら字幕と同じようにずらしてください。モデルはクラウドで動き、文字起こしを受け取ります。公開日まで内容を伏せる約束(エンバーゴ)があるインタビューでは、慎重に判断してください。この種の依頼は会議についてAIに聞くプロンプトでさらに紹介しています。
1件のインタビューから、すべての発言に正しい名前が付いた文字起こし、マークした引用(どれも耳で確かめ、時刻付きでコピー済み)、記事用のTXT、動画用のSRTまたはVTTが得られます。エピソードの音声は収録ツールに残ります。インタビューを数多くこなすなら、顧客インタビューから引用を集めるで、タグを付けてすべてをまとめて検索する方法を紹介しています。
Speak-Yで通話を会議として録音します。マイクとMacが再生する音声を取り込むので、Zoom、Google Meet、ブラウザにボットが参加することはありません。通話後、Speaker 1とSpeaker 2のチップをクリックしてホストとゲストの名前を入力すれば、すべての発言、コピーした引用、エクスポートにその名前が入ります。
なりません。Speak-Yは通話の音声を、2人の声が混ざった16 kHzのモノラル1トラックとしてMacに保存します。引用の確認には十分ですが、エピソードの公開には向きません。エピソードはいつもの収録ツールで録り、文字起こし、引用、字幕にはSpeak-Yを使ってください。
できます。記録で … メニュー → 「ダウンロード」を開き、「SRT(字幕)」または「VTT(ウェブ字幕)」を選びます。字幕の1区切りは1つの発言で、長い回答は約1分ずつに分割され、各区切りは話者名で始まります。時刻はSpeak-Yが録音を始めた瞬間から数えるため、エピソードの開始位置が違う場合は編集ソフトでずらしてください。
直接入力しての修正はできません。Speak-Yでは会議の記録の発言は編集できない仕様です。言語が違っていたり、テキストが崩れていたりする場合は、… → 「再文字起こし」で保存済みの音声から新しいバージョンを作成します。古いバージョンも残ります。1語だけの聞き違いなら、その場面を聞いたうえで、引用か書き出したファイルで直してください。
2026年10月1日時点で、Freeは1回30分まで、Proは60分まで、Pro+は4時間までの会議を録音でき、月の会議時間はそれぞれ2時間、10時間、40時間です。1時間の会話に冒頭の雑談が加わると60分を超えるため、Pro+を選んでください。