AIキャラクターを「喋らせる」と言っても、実際には複数の技術が分かれています。
- LLM:何を話すか決める
- TTS:テキストを声にする
- Avatar Engine:声に合わせて顔を動かす
Anam は、このうち主に「顔を持ったリアルタイム会話体験」を提供するクラウド型のAIアバターサービスです。
Anamは何をするサービスか
Anamでは、カスタムアバターを作り、Webやアプリの中でリアルタイムに会話させられます。
特に面白いのが One-Shot Avatar です。公式FAQでは、画像をアップロードするか、テキストから画像を生成してカスタムアバターを作成できるとされています。
つまり基本的には、
1枚の人物・キャラクター画像
+
音声
↓
Anam
↓
口パク・表情付きのリアルタイム映像
という使い方ができます。
「1枚の絵から動画を事前生成する」というより、会話中にリアルタイムで顔を動かすインターフェースとして使うのがAnamの特徴です。
公式サイト: https://anam.ai/
Interactive Avatars: https://anam.ai/interactive-avatars
OSSなのか?
Anamの中核となるアバター生成基盤は、基本的には クラウドサービスとして利用するもの です。
APIやSDK、サンプル実装は提供されていますが、Anamの生成モデルを自前GPUに落として完全セルフホストするタイプのOSSとは性格が異なります。
そのため、導入は速い一方で、本番で大量利用すると Anamへの従量課金と外部依存 が発生します。
MVPでは強いですが、長期的に自前Avatar Engineを持ちたい場合は、別途セルフホスト可能な技術との比較が必要です。
Fish AudioやIrodori-TTSとは何が違う?
ここは役割が違います。
Fish Audio / Irodori-TTS
声を作る技術(TTS)
「こんにちは」
↓
Fish / Irodori
↓
音声データ
Anam
その音声に顔を与える技術
音声
↓
Anam
↓
喋っている人物・キャラクター映像
したがって競合というより、組み合わせる関係です。
例えば、
LLM
↓
返答テキスト
↓
Irodori-TTS / Fish Audio
↓
キャラクター音声
↓
Anam
↓
喋るキャラクター
という構成が考えられます。
Anam自身にも音声・エージェント機能がありますが、既存のLLM/TTSスタックを持っている場合は、アバター層として組み込む発想が分かりやすいです。
料金
2026年9月時点の公開プランは以下です。
| Plan | 月額 | 含まれる時間 | 超過料金 |
|---|---|---|---|
| Free | $0 | 30分/月 | 超過不可 |
| Starter | $12 | 50分/月 | $0.16/分 |
| Explorer | $49 | 250分/月 | $0.14/分 |
| Growth | $299 | 2,000分/月 | $0.12/分 |
| Professional | $999 | 5,000分/月 | $0.11/分 |
料金の詳細: https://anam.ai/pricing
FreeでもAPI Accessとカスタムアバター1体が含まれているため、技術検証は無料枠から始められます。
Starter以上では商用利用が明記され、Explorer以上では埋め込み時のウォーターマーク除去が可能です。
料金で特に注意する点
Anamは「AIが喋っていた秒数」だけを数えるわけではありません。
公式FAQでは、セッションを開始してから終了するまでの時間全体が課金対象と説明されています。
つまり、
ユーザーが話す
↓
AIが考える
↓
AIが話す
↓
ユーザーが黙って画面を見る
という時間も、セッションが開いたままなら利用時間に含まれます。
大量ユーザー向けサービスでは、1分単価だけではなく、
- 平均セッション時間
- 同時接続数
- 無言時間
- セッション終了処理
まで含めてコスト設計する必要があります。
1枚絵なら何でも動くのか?
「1枚から作れる」と「どんな絵でも綺麗に動く」は別です。
写真風・リアル寄りの顔は比較的相性が良い一方、
- 極端に大きいアニメ目
- 記号的な口
- 強いデフォルメ
- 人間と大きく異なる顔構造
- 複雑な髪やアクセサリー
などでは、実際の出力を確認する必要があります。
特にアニメキャラクター用途では、モデルのスペック比較より、自分たちが実際に使うキャラ画像を投入したテストの方が重要です。
KYARAFLIPとの組み合わせ
KYARAFLIPのようなキャラクタープラットフォームでは、
KYARAFLIP
キャラ画像
キャラ設定
↓
LLM / Agent
人格・会話
↓
Irodori-TTS / Fish Audio
キャラの声
↓
Anam
顔・口パク
↓
リアルタイム会話キャラクター
という構成が考えられます。
この構成の利点は、キャラクターを
「画像として登録するもの」から「実際に話せる存在」へ拡張できること
です。
ただし、Anamそのものを差別化要因にするのは難しいため、プロダクト側の資産は、
- キャラクター設定
- 長期記憶
- 会話履歴
- 専用TTS / Voice
- 他サービスでの活動履歴
- ゲーム・Discord・Webなどを跨ぐキャラクターID
といった部分に置いた方が強いでしょう。
最小検証
最初から大規模実装する必要はありません。
- キャラクター画像を1枚用意
- Anam FreeでAvatar化
- 30秒〜3分程度の会話を試す
- Irodori-TTS / Fish Audioの声を比較
- 「顔」「声」「遅延」のどこが違和感になるか確認
ここまでで、キャラクター用途に使えるかはかなり判断できます。
Anamの価値は、Avatar Engineそのものを長期間開発せず、数時間〜数日で“喋るキャラクター”の仮説を検証できることにあります。
参考
- Anam: https://anam.ai/
- Anam Pricing: https://anam.ai/pricing
- Interactive Avatars: https://anam.ai/interactive-avatars
- Fish Audio: https://fish.audio/
- Irodori-TTS: https://github.com/Aratako/Irodori-TTS
- KYARAFLIP: https://kyaraflip.com/
Tesuji