Architecture & Performance

技術の舞台裏:デュアルエンジン TTS — ネイティブ音声 vs ローカルニューラル AI

2026年8月15日 · 6 min read

視覚的学習者であれ、聴覚的学習者であれ、あるいはその両方をブレンドする人であれ、読書アプリはあなたに適応するべきです。GemReaderの完全にオフラインなデュアルエンジンTTSアーキテクチャが、軽量なシステム音声と超リアルなニューラルAIの両方をどのように提供するかをご覧ください。

目、耳、またはその両方で読む

人はそれぞれ異なる方法で知識を吸収します。概念を真に理解するために、文の正確な構造や句読点を見る必要がある視覚的な学習者もいます。

また、人間の声のリズムや抑揚を聞いた方が情報をよく吸収できる聴覚的な学習者もいます。しかし学習は単純な二項対立ではありません。ナレーターが声に出して読んでいる間、視覚的に追いかけて概念を記憶に深く定着させたいと思うこともあるでしょう。

この視覚と聴覚の流動的なブレンドをサポートするには、非常に堅牢なオーディオエンジンが必要です。しかしほとんどのアプリは、ロボットのようなシステム音声に耐えるか、プライバシーを侵害するクラウドAIサーバーに読書習慣を委ねるかの妥協を強います。

デュアルエンジン・ソリューション

GemReaderは根本的に異なる道を歩みます。プライバシーの基本的権利を決して妥協することなく、両方の長所を提供する完全オフラインのデュアルエンジンアーキテクチャを構築しました。

ネイティブデバイスエンジンとオンデバイスのローカルニューラルAIモデルを組み合わせることで、本がどのように聞こえるかを完全にコントロールできます。

エンジン 1:ネイティブデバイスフレームワーク

最初のレイヤーは、ネイティブデバイスのTTSエンジンです。OSのネイティブフレームワーク上に直接構築されており、12以上の国際言語で遅延ゼロの音声生成を即座に提供します。

追加のダウンロードは不要で、メモリフットプリントが非常に少なく動作します。また、システムの中断から保護するためのカスタム非同期イベントゲーティングを設計しました。電話がかかってきた場合、本は誤って章をスキップするのではなく、優雅に一時停止します。

このエンジンは、軽量で即座のハンズフリーリスニングに最適です。

エンジン 2:ローカルニューラル AI

人間のナレーターの温かみと自然な抑揚を求める読者のために、Piper LibriTTS-Rニューラルモデルを駆動するSherpa-onnxランタイムを統合しました。

ここからが本当の魔法です。900以上の異なるマルチスピーカー音声プロファイルにアクセスでき、正確なトーンとピッチを選択できます。スマートな文のチャンク化を備えた最適化された低遅延ストリーミングパイプラインを利用しているため、オーディオはほぼ瞬時に開始されます。

最も重要なことは、このニューラルAIが100%オフラインであることです。音声合成は完全にスマートフォンのプロセッサで行われます。オーディオスニペットやテキストデータが外部サーバーに送信されることはありません。

どの速度でも完璧な学習

2.0倍の速読でも、複雑な新しい言語の音素をマスターするために0.75倍に遅くしても、両方のエンジンは動的に適応します。私たちのローカルニューラルAIは、ネイティブメモリでのリアルタイムのピッチ補正機能も備えているため、速度を変えてもナレーターの自然な声が歪むことはありません。

このデュアルエンジンの基盤により、視覚的な読書、純粋な聴覚的なリスニング、または両方の強力な同期ブレンドの間をシームレスに移行できます。