Fish Audio Docs
Guías de integraciónIntegraciones de terceros
Back to site

Configuración del agente Hermes

Configure Hermes Agent para generar archivos de voz a través del punto final Fish Audio compatible con OpenAI.

Conecte Fish Audio TTS al Agente Hermes

Hermes Agent puede utilizar una URL base personalizada para su proveedor OpenAI TTS integrado. Esto conecta la herramienta text_to_speech a Fish Audio sin cambiar el modelo de lenguaje que impulsa a Hermes.

No agregue este punto final a los proveedores de modelos de Hermes. Fish Audio expone la generación de voz en /v1/audio/speech, no el punto final /v1/chat/completions requerido por un modelo de chat.

Antes de empezar

Necesitas:

  • Una clave Fish Audio API con créditos API
  • Una identificación de voz Fish Audio
  • Una instalación reciente del Agente Hermes.

Cree una clave API dedicada para Hermes para que pueda monitorearla o revocarla de forma independiente.

Agregue la clave API

Agregue la clave a ~/.hermes/.env:

VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEY

No coloque la clave en config.yaml, el historial del shell, las capturas de pantalla ni en un repositorio.

Configurar Fish Audio TTS

Agregue o actualice la sección tts en ~/.hermes/config.yaml:

tts:
  provider: openai
  speed: 1.0
  openai:
    base_url: 'https://fishaudio.org/v1'
    model: fishaudio-s21pro-flash
    voice: 00a1b221-6137-4b73-ad62-b0cbce134167
    speed: 1.0

El ejemplo de ID de voz es un sistema público de voz para pruebas de conexión. Reemplácelo con su ID de voz Fish Audio preferido después de la primera solicitud exitosa.

Habilite y pruebe la herramienta

Ejecute hermes tools y asegúrese de que Voice & TTS esté habilitado. Inicie Hermes y pregunte:

Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Fish Audio test."

Hermes debería guardar un archivo MP3 en su directorio de salida de audio y devolver una ruta multimedia.

Limitación del canal de mensajería

Esta configuración está verificada para la generación de archivos MP3. Hermes puede solicitar salida nativa de Opus al entregar burbujas de voz de Telegram o Discord. El terminal compatible con Fish Audio OpenAI actualmente admite mp3, wav y pcm, por lo que esta configuración no admite la entrega nativa de burbujas de voz de Opus. Utilice un archivo adjunto MP3 o una capa de conversión para esos canales.

Solución de problemas

  • Hermes dice que no hay ninguna clave de audio OpenAI configurada: confirme que VOICE_TOOLS_OPENAI_KEY esté disponible para el proceso que inicia Hermes y luego reinícielo.
  • Las solicitudes aún llegan a OpenAI: confirme que tts.provider es openai y tts.openai.base_url es exactamente https://fishaudio.org/v1.
  • Voz o modelo no válido: use ID de Fish Audio, no nombres de voz de OpenAI como alloy o nombres de modelos como tts-1.
  • 401: reemplaza la clave API faltante, no válida o revocada.
  • 402: agregue créditos API antes de volver a intentarlo.
  • La solicitud de Opus falla: solicita un archivo MP3 en lugar de una burbuja de voz de mensajería nativa.

Documentación relacionada