Fish Audio Docs
IntegrationsleitfädenIntegrationen von Drittanbietern

Einrichtung des Hermes-Agenten

Konfigurieren Sie Hermes Agent, um Sprachdateien über den Fish Audio OpenAI-kompatiblen TTS-Endpunkt zu generieren.

Fish Audio TTS mit Hermes Agent verbinden

Hermes Agent kann eine benutzerdefinierte Basis-URL für seinen integrierten OpenAI TTS-Anbieter verwenden. Dadurch wird das Tool text_to_speech mit Fish Audio verbunden, ohne das Sprachmodell zu ändern, das Hermes antreibt.

Fügen Sie diesen Endpunkt nicht unter Hermes-Modellanbietern hinzu. Fish Audio macht die Sprachgenerierung am /v1/audio/speech verfügbar, nicht am /v1/chat/completions-Endpunkt, der für ein Chat-Modell erforderlich ist.

Bevor Sie beginnen

Sie benötigen:

  • Ein Fish Audio API-Schlüssel mit API-Credits
  • Eine Fish Audio-Sprach-ID
  • Eine aktuelle Hermes Agent-Installation

Erstellen Sie einen dedizierten API-Schlüssel für Hermes, damit Sie ihn unabhängig überwachen oder widerrufen können.

Fügen Sie den Schlüssel API hinzu

Fügen Sie den Schlüssel zu ~/.hermes/.env hinzu:

VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEY

Legen Sie den Schlüssel nicht in config.yaml, im Shell-Verlauf, in Screenshots oder in einem Repository ab.

Konfigurieren Sie Fish Audio TTS

Fügen Sie den Abschnitt tts in ~/.hermes/config.yaml hinzu oder aktualisieren Sie ihn:

tts:
  provider: openai
  speed: 1.0
  openai:
    base_url: 'https://fishaudio.org/v1'
    model: fishaudio-s21pro-flash
    voice: 00a1b221-6137-4b73-ad62-b0cbce134167
    speed: 1.0

Die Beispiel-Voice-ID ist eine öffentliche Systemstimme für Verbindungstests. Ersetzen Sie es nach der ersten erfolgreichen Anfrage durch Ihre bevorzugte Fish Audio Voice ID.

Aktivieren und testen Sie das Tool

Führen Sie hermes tools aus und stellen Sie sicher, dass Voice & TTS aktiviert ist. Starten Sie Hermes und fragen Sie:

Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Fish Audio test."

Hermes sollte eine MP3-Datei in seinem Audio-Ausgabeverzeichnis speichern und einen Medienpfad zurückgeben.

Einschränkung des Nachrichtenkanals

Dieses Setup ist für die MP3-Dateigenerierung verifiziert. Hermes kann bei der Übermittlung von Telegram- oder Discord-Sprachblasen eine native Opus-Ausgabe anfordern. Der Fish Audio OpenAI-kompatible Endpunkt unterstützt derzeit mp3, wav und pcm, sodass die native Opus-Sprachblasenbereitstellung von dieser Konfiguration nicht unterstützt wird. Verwenden Sie für diese Kanäle einen MP3-Anhang oder eine Konvertierungsebene.

Fehlerbehebung

  • Hermes sagt, dass kein OpenAI-Audioschlüssel konfiguriert ist: Bestätigen Sie, dass VOICE_TOOLS_OPENAI_KEY für den Prozess verfügbar ist, der Hermes startet, und starten Sie ihn dann neu.
  • Anfragen erreichen immer noch OpenAI: Bestätigen Sie, dass tts.provider openai und tts.openai.base_url genau https://fishaudio.org/v1 ist.
  • Ungültige Stimme oder ungültiges Modell: Verwenden Sie Fish Audio-IDs, nicht OpenAI-Sprachnamen wie alloy oder Modellnamen wie tts-1.
  • 401: Ersetzen Sie den fehlenden, ungültigen oder widerrufenen API-Schlüssel.
  • 402: Fügen Sie API-Credits hinzu, bevor Sie es erneut versuchen.
  • Opus-Anfrage schlägt fehl: Fordern Sie eine MP3-Datei anstelle einer nativen Nachrichten-Sprachblase an.

Verwandte Dokumentation