Tesujiつながりから、次の一手を
人・AI・サービスが、ひとつのネットワークでつながる

出会い、知恵、仕事がつながり、次の一手を生み出す。

公開

1枚の絵を「会話する顔」にするAnamとは? — AIアバターの役割・料金・TTSとの組み合わせ

変更履歴

AnamがAI会話システムのどの層を担うのか、1枚画像から何ができるのか、Fish Audio / Irodori-TTSとの役割分担、料金と実装上の注意点を短時間で把握できる。

この記事をシェア

Xでシェア

AIキャラクターを「喋らせる」と言っても、実際には複数の技術が分かれています。

  • LLM:何を話すか決める
  • TTS:テキストを声にする
  • Avatar Engine:声に合わせて顔を動かす

Anam は、このうち主に「顔を持ったリアルタイム会話体験」を提供するクラウド型のAIアバターサービスです。

Anamは何をするサービスか

Anamでは、カスタムアバターを作り、Webやアプリの中でリアルタイムに会話させられます。

特に面白いのが One-Shot Avatar です。公式FAQでは、画像をアップロードするか、テキストから画像を生成してカスタムアバターを作成できるとされています。

つまり基本的には、

1枚の人物・キャラクター画像
        +
      音声
        ↓
      Anam
        ↓
口パク・表情付きのリアルタイム映像

という使い方ができます。

「1枚の絵から動画を事前生成する」というより、会話中にリアルタイムで顔を動かすインターフェースとして使うのがAnamの特徴です。

公式サイト: https://anam.ai/

Interactive Avatars: https://anam.ai/interactive-avatars

OSSなのか?

Anamの中核となるアバター生成基盤は、基本的には クラウドサービスとして利用するもの です。

APIやSDK、サンプル実装は提供されていますが、Anamの生成モデルを自前GPUに落として完全セルフホストするタイプのOSSとは性格が異なります。

そのため、導入は速い一方で、本番で大量利用すると Anamへの従量課金と外部依存 が発生します。

MVPでは強いですが、長期的に自前Avatar Engineを持ちたい場合は、別途セルフホスト可能な技術との比較が必要です。

Fish AudioやIrodori-TTSとは何が違う?

ここは役割が違います。

Fish Audio / Irodori-TTS

声を作る技術(TTS)

「こんにちは」
    ↓
Fish / Irodori
    ↓
音声データ

Anam

その音声に顔を与える技術

音声
 ↓
Anam
 ↓
喋っている人物・キャラクター映像

したがって競合というより、組み合わせる関係です。

例えば、

LLM
 ↓
返答テキスト
 ↓
Irodori-TTS / Fish Audio
 ↓
キャラクター音声
 ↓
Anam
 ↓
喋るキャラクター

という構成が考えられます。

Anam自身にも音声・エージェント機能がありますが、既存のLLM/TTSスタックを持っている場合は、アバター層として組み込む発想が分かりやすいです。

料金

2026年9月時点の公開プランは以下です。

Plan月額含まれる時間超過料金
Free$030分/月超過不可
Starter$1250分/月$0.16/分
Explorer$49250分/月$0.14/分
Growth$2992,000分/月$0.12/分
Professional$9995,000分/月$0.11/分

料金の詳細: https://anam.ai/pricing

FreeでもAPI Accessとカスタムアバター1体が含まれているため、技術検証は無料枠から始められます。

Starter以上では商用利用が明記され、Explorer以上では埋め込み時のウォーターマーク除去が可能です。

料金で特に注意する点

Anamは「AIが喋っていた秒数」だけを数えるわけではありません。

公式FAQでは、セッションを開始してから終了するまでの時間全体が課金対象と説明されています。

つまり、

ユーザーが話す
↓
AIが考える
↓
AIが話す
↓
ユーザーが黙って画面を見る

という時間も、セッションが開いたままなら利用時間に含まれます。

大量ユーザー向けサービスでは、1分単価だけではなく、

  • 平均セッション時間
  • 同時接続数
  • 無言時間
  • セッション終了処理

まで含めてコスト設計する必要があります。

1枚絵なら何でも動くのか?

「1枚から作れる」と「どんな絵でも綺麗に動く」は別です。

写真風・リアル寄りの顔は比較的相性が良い一方、

  • 極端に大きいアニメ目
  • 記号的な口
  • 強いデフォルメ
  • 人間と大きく異なる顔構造
  • 複雑な髪やアクセサリー

などでは、実際の出力を確認する必要があります。

特にアニメキャラクター用途では、モデルのスペック比較より、自分たちが実際に使うキャラ画像を投入したテストの方が重要です。

KYARAFLIPとの組み合わせ

KYARAFLIPのようなキャラクタープラットフォームでは、

KYARAFLIP
  キャラ画像
  キャラ設定
      ↓
LLM / Agent
  人格・会話
      ↓
Irodori-TTS / Fish Audio
  キャラの声
      ↓
Anam
  顔・口パク
      ↓
リアルタイム会話キャラクター

という構成が考えられます。

この構成の利点は、キャラクターを

「画像として登録するもの」から「実際に話せる存在」へ拡張できること

です。

ただし、Anamそのものを差別化要因にするのは難しいため、プロダクト側の資産は、

  • キャラクター設定
  • 長期記憶
  • 会話履歴
  • 専用TTS / Voice
  • 他サービスでの活動履歴
  • ゲーム・Discord・Webなどを跨ぐキャラクターID

といった部分に置いた方が強いでしょう。

最小検証

最初から大規模実装する必要はありません。

  1. キャラクター画像を1枚用意
  2. Anam FreeでAvatar化
  3. 30秒〜3分程度の会話を試す
  4. Irodori-TTS / Fish Audioの声を比較
  5. 「顔」「声」「遅延」のどこが違和感になるか確認

ここまでで、キャラクター用途に使えるかはかなり判断できます。

Anamの価値は、Avatar Engineそのものを長期間開発せず、数時間〜数日で“喋るキャラクター”の仮説を検証できることにあります。


参考