Einrichtung des Hermes-Agenten
Konfigurieren Sie Hermes Agent, um Sprachdateien über den Fish Audio OpenAI-kompatiblen TTS-Endpunkt zu generieren.
Fish Audio TTS mit Hermes Agent verbinden
Hermes Agent kann eine benutzerdefinierte Basis-URL für seinen integrierten OpenAI TTS-Anbieter verwenden. Dadurch wird das Tool text_to_speech mit Fish Audio verbunden, ohne das Sprachmodell zu ändern, das Hermes antreibt.
Fügen Sie diesen Endpunkt nicht unter Hermes-Modellanbietern hinzu. Fish Audio macht die Sprachgenerierung am
/v1/audio/speechverfügbar, nicht am/v1/chat/completions-Endpunkt, der für ein Chat-Modell erforderlich ist.
Bevor Sie beginnen
Sie benötigen:
- Ein Fish Audio API-Schlüssel mit API-Credits
- Eine Fish Audio-Sprach-ID
- Eine aktuelle Hermes Agent-Installation
Erstellen Sie einen dedizierten API-Schlüssel für Hermes, damit Sie ihn unabhängig überwachen oder widerrufen können.
Fügen Sie den Schlüssel API hinzu
Fügen Sie den Schlüssel zu ~/.hermes/.env hinzu:
VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEYLegen Sie den Schlüssel nicht in config.yaml, im Shell-Verlauf, in Screenshots oder in einem Repository ab.
Konfigurieren Sie Fish Audio TTS
Fügen Sie den Abschnitt tts in ~/.hermes/config.yaml hinzu oder aktualisieren Sie ihn:
tts:
provider: openai
speed: 1.0
openai:
base_url: 'https://fishaudio.org/v1'
model: fishaudio-s21pro-flash
voice: 00a1b221-6137-4b73-ad62-b0cbce134167
speed: 1.0Die Beispiel-Voice-ID ist eine öffentliche Systemstimme für Verbindungstests. Ersetzen Sie es nach der ersten erfolgreichen Anfrage durch Ihre bevorzugte Fish Audio Voice ID.
Aktivieren und testen Sie das Tool
Führen Sie hermes tools aus und stellen Sie sicher, dass Voice & TTS aktiviert ist. Starten Sie Hermes und fragen Sie:
Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Fish Audio test."Hermes sollte eine MP3-Datei in seinem Audio-Ausgabeverzeichnis speichern und einen Medienpfad zurückgeben.
Einschränkung des Nachrichtenkanals
Dieses Setup ist für die MP3-Dateigenerierung verifiziert. Hermes kann bei der Übermittlung von Telegram- oder Discord-Sprachblasen eine native Opus-Ausgabe anfordern. Der Fish Audio OpenAI-kompatible Endpunkt unterstützt derzeit mp3, wav und pcm, sodass die native Opus-Sprachblasenbereitstellung von dieser Konfiguration nicht unterstützt wird. Verwenden Sie für diese Kanäle einen MP3-Anhang oder eine Konvertierungsebene.
Fehlerbehebung
- Hermes sagt, dass kein OpenAI-Audioschlüssel konfiguriert ist: Bestätigen Sie, dass
VOICE_TOOLS_OPENAI_KEYfür den Prozess verfügbar ist, der Hermes startet, und starten Sie ihn dann neu. - Anfragen erreichen immer noch OpenAI: Bestätigen Sie, dass
tts.provideropenaiundtts.openai.base_urlgenauhttps://fishaudio.org/v1ist. - Ungültige Stimme oder ungültiges Modell: Verwenden Sie Fish Audio-IDs, nicht OpenAI-Sprachnamen wie
alloyoder Modellnamen wietts-1. - 401: Ersetzen Sie den fehlenden, ungültigen oder widerrufenen API-Schlüssel.
- 402: Fügen Sie API-Credits hinzu, bevor Sie es erneut versuchen.
- Opus-Anfrage schlägt fehl: Fordern Sie eine MP3-Datei anstelle einer nativen Nachrichten-Sprachblase an.