リアルタイム音声対話におけるユーザー割り込み意図推定 -- マイクの音から 「今ユーザーが発話権を欲しがっているか」を推定し、AIがいつ黙るべきかを CONTINUE / PAUSE / YIELD の3段階で判定します。すべてこのブラウザの中で完結し、 音声はサーバーに送信されません。
音声認識・読み上げはこのブラウザ内蔵の機能(Web Speech API)で完結します。 LLMの応答生成だけ、あなたが管理するローカルサーバー(Mac上のmlx_lm.server)に 問い合わせます -- 外部のクラウドAPIは使いません。
注意: このデモに埋め込まれているモデルは、現時点では 合成音声(synthetic)のみで学習されたベースラインです。 実際の会話音声で学習していないため、判定精度は保証されません。 あくまでパイプライン(マイク入力 → 音響特徴量抽出 → 推論 → 発話制御)の 動作確認・デモ用としてご覧ください。