Comprender las transcripciones de Hedy

La diferencia de transcripción de Hedy
Cuando nos propusimos crear Hedy, sabíamos que los métodos de transcripción tradicionales se quedaban cortos. La mayoría de las aplicaciones graban su audio y lo envían a servidores distantes, comprometiendo su privacidad. Nosotros adoptamos un enfoque radicalmente diferente: Hedy procesa el habla localmente en su dispositivo en tiempo real. De forma predeterminada, el audio nunca se guarda; solo existe momentáneamente en la memoria de su dispositivo durante el procesamiento y se descarta inmediatamente después. Solo se conserva la transcripción de texto resultante.
Procesamiento local: Sus conversaciones, su control
Hedy realiza el reconocimiento de voz completamente en su dispositivo. Esto no es solo una funcionalidad; es una reimaginación fundamental de cómo debería funcionar la tecnología de conversación. De forma predeterminada:
-
El audio no se almacena. Hedy no guarda grabaciones de sus conversaciones. Los datos de audio se mantienen temporalmente en RAM solo durante el breve momento necesario para convertir el habla en texto, y luego se descartan inmediatamente.
-
El audio nunca se envía a los servidores de Hedy. El procesamiento de voz ocurre localmente en su dispositivo de forma predeterminada, así que ningún dato de audio llega a nosotros. Las excepciones las activa usted: un proveedor de transcripción en la nube para el que aporta su propia clave de API, e iCloud Audio Sync, que copia el audio guardado a su propia cuenta de iCloud.
-
Solo se retiene el texto. Lo que Hedy conserva es la transcripción resultante, una representación en texto de la conversación, no el audio en sí.
Si desea conservar su audio para revisión posterior, puede habilitar el guardado de audio en la configuración de su sesión. Cuando esta opción está activada, Hedy almacena la grabación de audio localmente en su dispositivo junto con la transcripción. Incluso entonces, nunca llega a nuestros servidores. En dispositivos Apple puede activar además iCloud Audio Sync, que copia el archivo a su propia cuenta de iCloud para que pueda reproducirlo en los demás dispositivos Apple en los que inicie sesión.
La privacidad no es una idea de último momento, es nuestro principio fundamental. El reconocimiento de voz se ejecuta en el dispositivo y el audio se descarta de forma predeterminada. El análisis en la nube procesa el contenido de la transcripción en memoria de forma predeterminada, y el Procesamiento de IA Local puede mantener todo el proceso en su dispositivo.
Privacidad del audio e implicaciones de consentimiento
Muchas leyes de grabación y transcripción, como las leyes de consentimiento de dos partes en ciertos estados de EE.UU. o el GDPR en Europa, se preocupan específicamente por la grabación y almacenamiento de audio. Con el guardado de audio desactivado (la configuración predeterminada), Hedy:
-
No graba ni guarda archivos de audio
-
Solo mantiene datos de audio en memoria volátil (RAM) durante los segundos necesarios para procesarlos
-
No transmite audio a ningún servidor o tercero
Esto significa que los requisitos de consentimiento que se aplican a Hedy pueden diferir de los que se aplican a herramientas que graban y almacenan audio. La transcripción de texto que Hedy genera se almacena en su dispositivo de forma predeterminada; con Cloud Sync activado, también se sincroniza de forma cifrada con la nube, y el análisis de IA en la nube procesa temporalmente el contenido de la transcripción a menos que utilice el Procesamiento de IA Local.
Si habilita el guardado de audio, el audio de la conversación se almacenará localmente en su dispositivo. En ese caso, las mismas consideraciones de consentimiento que se aplican a cualquier herramienta de grabación de audio pueden aplicarse.
Las leyes de privacidad y grabación varían según la jurisdicción. Animamos a los usuarios a familiarizarse con las regulaciones locales. Esta información se proporciona por transparencia, no como asesoramiento legal.
Transcripción en tiempo real: El desafío técnico
Crear transcripciones precisas e instantáneas en un dispositivo móvil es increíblemente complejo. Hedy debe equilibrar tres factores críticos:
-
Velocidad de procesamiento
-
Eficiencia computacional
-
Precisión del reconocimiento de voz
Nuestro enfoque prioriza brindarle perspectivas inmediatas. Esto significa que la transcripción que ve es un documento vivo y en evolución, que captura la esencia de su conversación a medida que ocurre.
Comprender las características de la transcripción
Las transcripciones generadas por Hedy son únicas. No están pensadas para ser registros perfectos de nivel judicial, sino capturas de conversación dinámicas y potenciadas por IA. Puede notar:
-
Variaciones ocasionales de puntuación
-
Ligeras diferencias en la elección de palabras
-
Formato informal que captura el flujo de la conversación
Piense en la transcripción de Hedy como un tomador de notas hábil que captura el espíritu de la conversación, no una máquina estenográfica.
Nombres de los hablantes en su transcripción
Las sesiones que separan las voces muestran una fila de chips de hablante encima de la transcripción. Cada chip representa un hablante que Hedy ha detectado. Toque un chip para asignar a ese hablante un nombre real; a partir de entonces, la transcripción, la lista de hablantes y todo lo que exporte de la sesión usarán ese nombre.
Hedy también intenta deducir los nombres por usted. Cuando alguien dice quién es o cuando otro participante se dirige a esa persona por su nombre, Hedy lo considera una prueba y aplica el nombre automáticamente. La invitación de su calendario y el contexto del tema le ayudan a asociar el nombre con la persona correcta. Cuando no hay pruebas suficientes, el hablante conserva su número en lugar de recibir un nombre por conjetura, por lo que es normal que algunos hablantes terminen con nombre y otros no.
Un nombre que usted escriba nunca se sobrescribe. La inferencia de Hedy solo asigna nombres a los hablantes que usted no haya nombrado.
Los nombres permanecen vinculados a la sesión. Aparecen en copias, elementos compartidos, descargas y exportaciones, y se sincronizan con sus otros dispositivos. La limpieza de la transcripción usa los nombres que usted haya confirmado, por lo que una transcripción limpia muestra a las personas por sus nombres reales.
Cambiar el nombre de un hablante no modifica el resumen ni las notas detalladas que ya haya generado. Hedy muestra un recordatorio para ejecutar Actualizar resumen o Actualizar notas cuando quiera actualizarlos con los nombres nuevos.
Cuando no aparecen los chips
La lista de hablantes necesita una transcripción con turnos de hablante separados, y solo el motor de voz Nemotron los produce. Esta función está disponible en:
- Mac con Apple Silicon
- iPhone 12 y modelos posteriores
- iPad Air 4 y modelos posteriores
- Windows
- Teléfonos Android de 64 bits
Las sesiones capturadas con Whisper o con un proveedor de reconocimiento de voz en la nube no contienen turnos de hablante, por lo que no muestran chips. Es una característica de la sesión, no un ajuste que pueda activar más tarde. Una sesión ya capturada con otro motor no incorporará una lista de hablantes.
La aplicación web no puede capturar por sí sola una sesión con Nemotron, pero sí muestra los chips y le permite cambiar sus nombres en las sesiones sincronizadas desde otro dispositivo.
Cuando no se puede cambiar el nombre
Los chips se muestran, pero no se pueden editar cuando:
- Otra persona compartió la sesión con usted
- La sesión sigue en curso, así que finalícela primero
- Está viendo la versión limpia. Vuelva a Original con el interruptor de destellos, cambie el nombre allí y después regrese cuando termine
Limpiar su transcripción
Si desea una versión más pulida de una transcripción, para compartir, exportar o simplemente leer con mayor facilidad, Hedy puede producir una copia limpia bajo demanda. Abra cualquier sesión completada, vaya a la pestaña Transcripción y toque el botón Limpiar transcripción (el ícono de estrellas, ✨, fácil de pasar por alto). La transcripción original nunca se sobrescribe; la versión limpia se guarda junto a ella y puede alternar entre ambas en cualquier momento.
Demasiados hablantes? Limpiar transcripción lo corrige
Hedy etiqueta automáticamente a los hablantes mientras transcribe, separando las voces que escucha en hablantes distintos. En conversaciones más largas, o cuando hay ruido de fondo o eco, puede contar de más y dividir a una sola persona en varios hablantes. Una sesión de dos personas podría terminar mostrando cinco o más hablantes. No hay nada malo con la sesión y usted no necesita volver a etiquetarla línea por línea. Ejecutar Limpiar transcripción es la solución: vuelve a leer toda la sesión y consolida las voces, de modo que demasiados hablantes, un número incorrecto de hablantes, etiquetas de hablante incorrectas o una voz dividida en múltiples hablantes se resuelvan en una sola pasada.
Antes de ejecutarla, abra la sesión y revise las notas. El limpiador lee el resumen y las notas detalladas de su sesión para determinar quién estaba hablando. Cuando esas notas nombran claramente a los participantes reales, la copia limpia puede etiquetar a las personas con sus nombres reales en lugar de recurrir a “Hablante 1” y “Hablante 2”. Por eso vale la pena asegurarse de que su resumen o sus notas nombren a todos antes de tocar Limpiar transcripción.
Si la copia limpia todavía queda con un número de hablantes incorrecto, es esperable: la limpieza es generada por IA y no acierta exactamente todas las veces. Corrija los nombres en sus notas o resumen, luego ejecute Limpiar transcripción de nuevo para regenerar una copia nueva a partir del contexto actualizado.
Cuando ejecuta una limpieza, la IA de Hedy:
-
Corrige ortografía, puntuación y gramática sin cambiar lo que se dijo
-
Agrega etiquetas de hablante, usando primero los nombres que confirmó en los chips de hablante y después los nombres reales de los participantes cuando el resumen o las notas de la sesión los identifican; si no, recurre a “Hablante 1”, “Hablante 2”, etc.
-
Mejora la legibilidad general con saltos de párrafo y frases más claras, y elimina marcadores sueltos como
[Music]o>> -
Aplica su vocabulario personalizado para que nombres de empresas, términos de productos y jerga técnica se escriban correctamente
-
Opcionalmente traduce la transcripción limpia a otro idioma en el mismo paso: elija un idioma de destino en el cuadro de diálogo de limpieza, o déjelo en “Mantener idioma original”
Una vez que una sesión tiene una versión limpia, un interruptor en la vista de transcripción (el ícono de destellos) alterna entre Original y Limpia. Aparece un banner que dice “Viendo transcripción limpia” cada vez que está en la vista limpia.
La limpieza de transcripciones usa un modelo de IA en la nube y se ejecuta en el dispositivo que capturó la sesión. No puede activar la limpieza en una sesión que se sincronizó o compartió con usted desde otro dispositivo; solo el propietario original, en el dispositivo original, puede limpiar una transcripción.
Para editar manualmente el texto de la transcripción, vuelva a la vista Original. La edición solo está disponible en la transcripción sin procesar para que su fuente de verdad literal permanezca intacta. Después de editar, puede ejecutar la limpieza de nuevo para regenerar una nueva copia pulida a partir de sus correcciones.
Idioma y precisión
Estamos comprometidos a mejorar la transcripción en todos los idiomas. Actualmente, el inglés ofrece la experiencia más refinada, pero continuamos expandiendo y refinando nuestras capacidades de procesamiento local. A medida que los procesadores de los teléfonos se vuelven más potentes, nuestra transcripción será cada vez más sofisticada.
Mejorar la calidad de su transcripción
Aunque Hedy trabaja arduamente para capturar sus conversaciones, usted puede ayudar:
-
Hable claramente y a un ritmo moderado
-
Minimice el ruido de fondo
-
Coloque su dispositivo de manera óptima
Si las transcripciones aún salen confusas o incompletas, vea cómo corregir la mala calidad de transcripción. Si una sesión completada muestra demasiados hablantes, se trata de una tarea de limpieza y no de un problema de captura: consulte la sección Limpiar su transcripción anterior.
El ruido de fondo, múltiples participantes hablando simultáneamente y entornos de audio complejos pueden desafiar incluso el reconocimiento de voz más avanzado.
Acceder y usar sus transcripciones
Hedy hace que sus transcripciones sean fácilmente accesibles:
-
Vea en tiempo real durante las sesiones
-
Revise sesiones pasadas
-
Comparta o exporte para análisis adicional
-
Integrado con perspectivas de IA y puntos destacados
El futuro de la transcripción local
Apenas estamos comenzando. Nuestra hoja de ruta incluye:
-
Expandir el soporte de idiomas
-
Mejorar los algoritmos de procesamiento
-
Aumentar la precisión en tiempo real
-
Reducir la carga computacional