この mod について
live-vibe を作ったのは、ChatGPT Codex の音声モードのように Claude Code と話したかったからです。マイクをずっと開いたままにして、考えを言い終えたら返答し、私が割り込んだら黙ってほしい。Claude Code にはその機能がありませんでした。でも、新しい Mods 機能はエージェントの実行経路でプラグインのコードを動かし、ターミナルに描画できます。それだけで全体をプラグインとして作れました。MIT ライセンスで、ottomation と名付けたマーケットプレイスにあり、2 行でインストールできます。
/live は Claude との全二重音声会話です。割り込むと最初の一言で止まります。ただし話している間の "mm-hm" は割り込みと見なさず、一時停止した音声サンプルから続けます。人と話すように相づちを打てます。/vibe はディレクターモードで、Claude は読み取りと作業用サブエージェントへの指示を行い、自分ではファイルを一切編集しません。/livevibe は両方を同時に使います。小型で高速な音声モデルが私と会話し、実作業はディレクターの Claude に渡します。Claude が終わると音声が結果を一、二文で知らせます。その間にも Claude が何をしているか尋ねられ、Claude は作業を続けたまま返答が得られます。
必要なものはすべてプラグインに含まれます。Kyutai のストリーミング STT、Kokoro TTS、WebRTC のエコーキャンセル、音声フロントエンドは /live setup がダウンロードして確認します。各マシンで一度だけです。CUDA に対応し、Apple silicon も MLX 経由で使えます。会話層は軽量のローカルモデルで、動かしたくなければ Anthropic API にフォールバックします。WSL2 ではネイティブの Windows プレーヤーで音声を再生します。WSLg の RDP 音声はノイズが出て、一日中それを聞きたくなかったからです。
一番時間をかけたのは発話交代です。考えながら話せるかどうかが決まるからです。プラグインは Kyutai のポーズ予測ヘッドを読み、まだ話し続けそうかを予測します。ほとんどの発話は最後の言葉から約半秒で閉じますが、末尾の "and" やカンマがあれば言い終える時間を確保します。0.7.0 には、OpenAI の GPT-Live の解説を読んで作った実験的な経路も含まれます。モデルの確信度で待ち時間を調整し、話し終える少し前から返答を下書きし、有効にすれば相づちも打ちます。デフォルトで有効ですが、気になる場合は一つの設定で無効にできます。
Claude Code 2.1.287 以降、uv、マイク、スピーカーが必要です。/plugin marketplace add potto007/ottomation、次に /plugin install live-vibe@ottomation、最後に /live setup を実行してください。Repo: https://github.com/potto007/ottomation
試したら、あなたのマシンでの発話交代の感触を教えてください。投稿者 /u/Pale-Soil-2524 [link] [comments]


