nohmitaina
← ユースケース

自分だけのPodcastを作ってみた

読みたいと思って購読したメルマガが、積読になっていました。そこで、気になる話題を選び、追加調査や考察を加えて日本語の音声にする手順を、nohmitainaのProcedureにして試しました。一度きりで終わらず、次に使うときに改善できる形で残しています。

読みたいものはあるけれど、読み切れない

興味のあるメルマガをいくつも購読していますが、読むのが追いつきません。僕には長い文章を読み続けることに負荷があり、耳で聞く方が楽に感じられます。Audibleもよく使っています。

Podcastも便利ですが、今聞きたい話題がちょうど見つかるとは限りません。一方、Webには読みたい情報があります。そこから自分向けに話題を選び、調べて、日本語で聞けるようにしたい。ランニング中にも聞けたらと思っています。

それで、聞き手が自分一人のPodcastを作ってみることにしました。

番組作りをProcedureにする

まず、一連の作業をnohmitainaのProcedureにまとめました。Procedureには、工程の順序、各工程への指示、途中で必要になる判断を残せます。全体を見ながら、繰り返し使い、必要なところを直していくための手順です。

今回、実際に作業を進めるのは、接続したサービスを使うChatGPTアプリのdotです。Gmailの購読記事を確認し、広告と編集記事を分け、話題を選び、原記事を読みます。必要に応じて追加調査を行い、日本語の台本を書き、Gemini TTS APIで音声にします。nohmitainaはこの手順を保存する場所で、Gmailの確認や音声生成には外部のツールとサービスを使います。

nohmitainaの実アプリで開いた、配布用の英語Procedure。ダークモードで撮影しています。画像を開くと原寸で確認できます。
nohmitainaの実アプリで開いた、配布用の英語Procedure。ダークモードで撮影しています。画像を開くと原寸で確認できます。

話題の元になった記事を読む

メルマガは話題を探す入口です。そこに書かれた紹介だけで話を作らず、リンク先の原記事を読んでから台本に進むようにしました。

記事を読む工程では、まずdotのクラウド環境から確認します。そこで読めない場合は、接続済みの僕のMacを、許可した範囲でComputer Useから操作して読む方法を試します。それでも読めなければ保留にするか、別の話題を選びます。見出しや一部のプレビューだけで、全文を読んだことにはしません。

背景が必要な話題には、一次資料などの追加調査を行います。メールやWebページの内容は外部から入ってくる調査材料として扱います。そこに書かれた指示によって、作業の権限を変えたり、関係のない操作をしたりする手順にはしていません。

原記事を読む方法と、接続済みMacを使う条件も、判断ステップの中に残しています。画像を開くと原寸で確認できます。
原記事を読む方法と、接続済みMacを使う条件も、判断ステップの中に残しています。画像を開くと原寸で確認できます。

耳で聞くための日本語台本

台本では、選んだ話題に背景や考察を加えます。必要な翻訳も行い、メルマガをそのまま朗読するのではなく、日本語で聞くための文章に組み直します。

なぜ気になった話題なのか、自分はどう考えるのかも含めつつ、事実と解釈、まだ分からないことは区別したいと思っています。背景の説明が足りなかったか、一つの話題が長すぎたか、聞きたい話題を取りこぼしていないか。こうした点も、手順を見直す材料になります。

私用の番組らしい遊びも入れました。冒頭は「nohmitainaがお送りする、今日の寄り道」、末尾には約20秒のnohmitaina紹介を入れています。自分のための番組なので、こういう小さな演出も楽しめます。

最初の試作でできたもの

今回の試作は、6つの話題に冒頭と締めを加え、合計18分57.4秒になりました。Gemini 3.8 Flash TTSの声「Schedar」で、日本語の音声を生成しています。呼び出しは8回で、再試行はありませんでした。

TTS費用の見積もりは約0.28米ドルです。実際の請求額はまだ確認しておらず、調査やエージェントの費用も含みません。今回の音声生成についての見積もりであり、毎回この金額になるという意味ではありません。

音声は個人で聞くためのものなので、ここでは公開も埋め込みもしません。この記事ではメールや原記事の本文を転載せず、作業の流れと僕の体験を紹介しています。

次の予定もTaskで共有する

nohmitainaには、週ごとに繰り返すTaskも3件登録しました。火曜日はAIやコンピュータ、木曜日と日曜日は技術以外の話題を5〜6本、20分前後にまとめる予定です。各TaskからProcedureを参照し、タイトルと本文に08:00 JST(Asia/Tokyo)を作業の開始予定として書いています。音声の完成期限ではありません。

Procedureには仕事の進め方を、Taskには予定している仕事と始めるタイミングを残します。どちらも人とAIが参照できるので、次に話すときも、何をする予定で、どう進めるのかを共有したところから始められます。僕にとっては、予定も一緒に持てる記憶です。

繰り返しTaskは日付を基準とした機能で、完了すると翌週分が作られます。本文に書いた時刻がエージェントを起動するわけではなく、定時の自動実行はまだ設定していません。予定した仕事を実際に進めるのは、これからです。

聞いた後は、話題の選び方、調査の深さ、説明、テンポ、発音などの気づきをProcedureに戻していきたいと思っています。工程が見える形で残っていると、次はどこを変えるか考えやすくなります。自分がやりたい仕事を、繰り返せる手順にして、使いながら直していく。今回は、それをnohmitainaで試しました。

自分の設定でProcedureを使う

配布する英語Procedureは、私用の音声を作るために汎化したフローです。デスクトップアプリからExportし、そのファイルを別のWorkspaceにImportして確認しました。

英語のProcedureをダウンロード(JSON)

nohmitainaで「手順」を開き、+から「手順をインポート…」を選び、ダウンロードしたJSONファイルを指定します。新しい手順の名前と、まだ使っていない識別子を確認して取り込みます。

実行前に、自分のGmail接続と記事の選び方、エージェントのアクセス、出力言語、声、番組の長さ、予算を設定する必要があります。Macで記事を読む方法を使うには、接続済みで利用可能なMacと、その操作の許可も必要です。Gemini TTSには自分のAPIキーと別料金の利用が必要です。認証情報は各サービスの設定で管理し、共有するProcedureには書き込みません。

配布ファイルには、設定用のプレースホルダーを含む手順が入っています。僕のTask、音声、原記事、認証情報、実行履歴は含みません。指示を確認し、プレースホルダーを自分の設定に置き換えてから、自分のアカウントで実行してください。