Proveedores de reconocimiento de voz en Hedy
¿Qué son los proveedores de reconocimiento de voz?
Hedy admite múltiples opciones de reconocimiento de voz, dándole flexibilidad para elegir entre privacidad completa con procesamiento local o alternativas basadas en la nube. Puede cambiar de proveedor en cualquier momento según sus necesidades actuales: use el local para sesiones sin conexión y servicios en la nube cuando prefiera sus funcionalidades específicas.
Primeros pasos
-
Abra la aplicación Hedy
-
Navegue a Settings (toque su ícono de perfil)
-
Desplácese hasta “Speech Recognition Options”
-
Seleccione su proveedor preferido del menú desplegable
-
Configure los ajustes específicos del proveedor si es necesario
-
Su selección entrará en vigor en la siguiente sesión
Proveedores disponibles
Hedy ofrece cuatro opciones de reconocimiento de voz, cada una con características únicas:
-
Whisper (local): Opción predeterminada - 100% privada, funciona sin conexión, sin costos de uso. Su audio nunca sale de su dispositivo para la transcripción. Disponible en todas las plataformas compatibles con Hedy.
-
Nemotron (local): Un motor de streaming más reciente en el dispositivo, con transcripciones en vivo y etiquetas de hablante en el dispositivo. Usted elige entre un modo solo en inglés (la opción más rápida) y un modo multilingüe que cubre un conjunto amplio de idiomas principales. Disponible en todas las plataformas para las que Hedy ofrece una app nativa: Mac con Apple Silicon, iPhone 12 (o más reciente), iPad Air 4 (o más reciente), Windows y Android. En hardware Apple se ejecuta en el Neural Engine y etiqueta a los hablantes en vivo; en Windows y Android, las etiquetas se añaden al final de la sesión. Requiere una descarga única del modelo (aproximadamente 0,6 GB para solo inglés y 0,7 GB para multilingüe).
-
Deepgram: Servicio basado en la nube con transmisión en tiempo real y funcionalidades de formato inteligente. Usa Nova-3, que admite docenas de idiomas. Hedy expone todos los idiomas que Nova-3 ofrece, para que pueda transcribir reuniones en cualquier idioma compatible sin cambiar de proveedor. Requiere su propia clave API.
-
OpenAI: Transcripción en la nube con Voice Activity Detection y detección automática de idioma. Hedy continúa automáticamente las sesiones largas superado el límite de 60 minutos por conexión de OpenAI, rotando conexiones en segundo plano para que las reuniones de más de una hora continúen sin interrupciones. Requiere su propia clave API.
Configurar Whisper (local)
Al usar Whisper, puede optimizar la configuración para su dispositivo y necesidades:
Para usuarios de macOS:
-
Small Model: Procesamiento más rápido, recomendado para Mac con Intel
-
Regular Model: Velocidad y precisión equilibradas para la mayoría de los usuarios
-
Large Model: Capacidades mejoradas para idiomas distintos al inglés (requiere descarga de 1.5GB)
Para usuarios de iOS/Android:
-
Standard Model: Opción predeterminada adecuada para la mayoría de los dispositivos
-
Large Model: Opción de modelo alternativo (se recomienda iPhone 12+ o Android 2024+)
Voice Activity Detection (VAD):
VAD filtra automáticamente el silencio y el ruido de fondo para mejorar la calidad de la transcripción. Esta funcionalidad está habilitada de forma predeterminada para Whisper.
-
Activar/Desactivar: Active o desactive VAD según su entorno de grabación
-
Sensibilidad: Ajuste desde “High Sensitivity” (captura más habla, incluyendo sonidos más suaves) hasta “Maximum Filtering” (solo captura habla clara, filtra más ruido de fondo)
Configuración de velocidad de transcripción:
-
Slower: Espera oraciones completas antes de mostrarlas
-
Normal: Velocidad y tiempo de visualización equilibrados
-
Faster: Visualización casi en tiempo real con actualizaciones más frecuentes
Configurar Nemotron (local)
Transcribe totalmente en el dispositivo y muestra transcripciones en vivo mientras usted habla. Está disponible en todas las plataformas para las que Hedy ofrece una app nativa: iOS, iPadOS, macOS, Windows y Android. En hardware Apple se ejecuta en el Neural Engine.
Requisitos del dispositivo:
-
Mac con Apple Silicon (M1 o más reciente), o
-
iPhone 12 o más reciente, o iPad Air 4 o más reciente
Solo inglés o multilingüe:
En el menú desplegable de proveedores, Nemotron aparece como dos opciones, para que pueda elegir la que coincida con sus reuniones:
-
Nemotron English Only (local): transcripción en streaming en inglés, la opción más rápida.
-
Nemotron Multilingual (local): streaming en el dispositivo para un conjunto amplio de idiomas principales, cuando necesita algo más que inglés.
Ambos funcionan completamente en el dispositivo, y ambos identifican el idioma a partir del audio en lugar de usar la configuración de idioma de la reunión.
Configuración inicial:
-
Seleccione Nemotron English Only (local) o Nemotron Multilingual (local) en el menú desplegable de proveedores
-
Toque Download Nemotron model (aproximadamente 0,6 GB para solo inglés y 0,7 GB para multilingüe) — se recomienda Wi-Fi
-
Una vez finalizada la descarga, Nemotron se utilizará automáticamente en su próxima sesión
Etiquetas de hablante y la caché temporal de audio:
Nemotron etiqueta quién habla, tanto en vivo como después de la sesión. Para que esas etiquetas de hablante sean más precisas, Hedy conserva el audio de cada sesión en una caché temporal en el dispositivo mientras lo procesa y luego lo elimina. Este audio permanece en su dispositivo. La opción Caché temporal de audio (Nemotron) está activada de forma predeterminada; puede desactivarla en la configuración de Hedy, aunque mantenerla activada le da a Nemotron la mejor atribución de hablantes.
Configurar proveedores en la nube
Configuración de Deepgram:
-
Cree una cuenta en console.deepgram.com
-
Genere una clave API desde su panel de control
-
En Hedy Settings, seleccione Deepgram del menú desplegable
-
Pegue su clave API y toque “Test” para verificar
-
Elija sus preferencias de modelo e idioma
-
Establezca la duración máxima de sesión para controlar costos
Configuración de OpenAI:
-
Obtenga su clave API en platform.openai.com/api-keys
-
En Hedy Settings, seleccione OpenAI del menú desplegable
-
Ingrese su clave API y pruebe la conexión
-
Elija su modelo preferido
-
Opcionalmente active Voice Activity Detection con sensibilidad ajustable
-
Establezca la duración máxima de sesión para controlar costos
Elegir el proveedor adecuado
Seleccione según sus prioridades y caso de uso:
-
Privacidad primero: Use un motor local (Whisper o Nemotron) - el audio nunca sale de su dispositivo para la transcripción
-
Uso sin conexión: Todos los motores locales funcionan sin internet
-
Funcionalidades en la nube: Deepgram y OpenAI ofrecen procesamiento basado en la nube
-
Detección de voz: Whisper y OpenAI incluyen funcionalidades de Voice Activity Detection
-
Formato inteligente: Deepgram ofrece opciones de formato automático
-
Sin costos de uso: Los motores locales (Whisper, Nemotron) no tienen cargos por minuto
-
Transcripción más rápida en el dispositivo: Nemotron suele ofrecer una transcripción con menor latencia que Whisper
-
Streaming multilingüe en el dispositivo: Nemotron Multilingual le da transcripción en el dispositivo para un conjunto amplio de idiomas
-
Máxima cobertura de idiomas en el dispositivo: Para idiomas no europeos en el dispositivo, prefiera Whisper Large o Nemotron Multilingual
-
Análisis completamente privado: En macOS (Apple Silicon) o Windows, puede combinar el reconocimiento de voz local con el Procesamiento de IA local para mantener tanto la transcripción como el análisis de IA completamente en el dispositivo.
Consideraciones de costo
Entienda las implicaciones de costo de cada proveedor:
-
Whisper (local): Gratuito - sin cargos de uso
-
Nemotron (local): Gratuito - sin cargos de uso (descarga única del modelo, aproximadamente 0,6-0,7 GB)
-
Deepgram: Precio por minuto (consulte las tarifas actuales en su panel de control)
-
OpenAI: Precio basado en uso (consulte las tarifas actuales en su plataforma)
La configuración de duración máxima de sesión ayuda a prevenir grabaciones nocturnas accidentales y gestionar los costos de API.
Mejores prácticas
-
Comience con Whisper (local) para familiarizarse con la funcionalidad y después pruebe Nemotron si su dispositivo es compatible
-
Pruebe los proveedores en la nube con grabaciones cortas antes de sesiones importantes
-
Monitoree su uso de API en los paneles de control de los proveedores para rastrear costos
-
Use diferentes proveedores para diferentes escenarios según sus necesidades
-
Cambie a local cuando viaje o en áreas con internet limitado
-
Establezca duraciones máximas de sesión apropiadas (60-120 minutos para reuniones típicas)
Solución de problemas
La clave API no funciona
-
Asegúrese de haber copiado la clave completa sin espacios
-
Verifique que su cuenta tenga créditos disponibles
-
Compruebe que la clave API tenga los permisos necesarios
-
Intente regenerar la clave desde el panel de control del proveedor
La prueba de conexión falló
-
Verifique la estabilidad de su conexión a internet
-
Confirme que el firewall no esté bloqueando conexiones WebSocket
-
Asegúrese de que la clave API esté activa con cuota suficiente
-
Espere un momento e intente de nuevo (problemas temporales del servicio)
Problemas de transcripción
-
Para Whisper: Pruebe un tamaño de modelo diferente
-
Para Whisper en Windows: Si la transcripción queda muy por detrás de la conversación, revise la configuración de GPU para transcripción lenta
-
Para términos especializados, nombres y acrónimos: Agréguelos mediante la función de vocabulario personalizado
-
Para Nemotron: Use el modo English Only para reuniones en inglés; para otros idiomas, use el modo Multilingual o cambie a Whisper con el idioma configurado explícitamente
-
Para Cloud: Verifique la estabilidad de la conexión a internet
-
Asegúrese de que el micrófono esté correctamente configurado
-
Minimice el ruido de fondo durante la grabación
Los ajustes no se guardan
-
Espere a que aparezca el indicador “Saved”
-
No cambie de pantalla mientras se guarda
-
Reinicie la aplicación si los problemas persisten
-
Asegúrese de tener una conexión a internet estable
Sus claves API se almacenan de forma segura en el llavero cifrado de su dispositivo y nunca se transmiten a los servidores de Hedy. Para máxima privacidad en conversaciones confidenciales, utilice siempre un motor local (Whisper o Nemotron).