Configuración del agente Hermes
Configure Hermes Agent para generar archivos de voz a través del punto final Fish Audio compatible con OpenAI.
Conecte Fish Audio TTS al Agente Hermes
Hermes Agent puede utilizar una URL base personalizada para su proveedor OpenAI TTS integrado. Esto conecta la herramienta text_to_speech a Fish Audio sin cambiar el modelo de lenguaje que impulsa a Hermes.
No agregue este punto final a los proveedores de modelos de Hermes. Fish Audio expone la generación de voz en
/v1/audio/speech, no el punto final/v1/chat/completionsrequerido por un modelo de chat.
Antes de empezar
Necesitas:
- Una clave Fish Audio API con créditos API
- Una identificación de voz Fish Audio
- Una instalación reciente del Agente Hermes.
Cree una clave API dedicada para Hermes para que pueda monitorearla o revocarla de forma independiente.
Agregue la clave API
Agregue la clave a ~/.hermes/.env:
VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEYNo coloque la clave en config.yaml, el historial del shell, las capturas de pantalla ni en un repositorio.
Configurar Fish Audio TTS
Agregue o actualice la sección tts en ~/.hermes/config.yaml:
tts:
provider: openai
speed: 1.0
openai:
base_url: 'https://fishaudio.org/v1'
model: fishaudio-s21pro-flash
voice: 00a1b221-6137-4b73-ad62-b0cbce134167
speed: 1.0El ejemplo de ID de voz es un sistema público de voz para pruebas de conexión. Reemplácelo con su ID de voz Fish Audio preferido después de la primera solicitud exitosa.
Habilite y pruebe la herramienta
Ejecute hermes tools y asegúrese de que Voice & TTS esté habilitado. Inicie Hermes y pregunte:
Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Fish Audio test."Hermes debería guardar un archivo MP3 en su directorio de salida de audio y devolver una ruta multimedia.
Limitación del canal de mensajería
Esta configuración está verificada para la generación de archivos MP3. Hermes puede solicitar salida nativa de Opus al entregar burbujas de voz de Telegram o Discord. El terminal compatible con Fish Audio OpenAI actualmente admite mp3, wav y pcm, por lo que esta configuración no admite la entrega nativa de burbujas de voz de Opus. Utilice un archivo adjunto MP3 o una capa de conversión para esos canales.
Solución de problemas
- Hermes dice que no hay ninguna clave de audio OpenAI configurada: confirme que
VOICE_TOOLS_OPENAI_KEYesté disponible para el proceso que inicia Hermes y luego reinícielo. - Las solicitudes aún llegan a OpenAI: confirme que
tts.provideresopenaiytts.openai.base_urles exactamentehttps://fishaudio.org/v1. - Voz o modelo no válido: use ID de Fish Audio, no nombres de voz de OpenAI como
alloyo nombres de modelos comotts-1. - 401: reemplaza la clave API faltante, no válida o revocada.
- 402: agregue créditos API antes de volver a intentarlo.
- La solicitud de Opus falla: solicita un archivo MP3 en lugar de una burbuja de voz de mensajería nativa.