Transcripción de vídeo y resúmenes con IA por API, alojados en la UE

14 min read
septiembre 23, 2026

Usamos IA para escribir más rápido, no para decidir qué es verdad. Alguien de Digital Samba ha leído cada línea de este artículo antes que tú.

Estás añadiendo vídeo a tu producto y, hacia la segunda llamada con un cliente, se hace evidente que el vídeo por sí solo no basta. La gente quiere una transcripción para buscar en ella más tarde, y alguien pedirá un resumen que pueda ojear en vez de volver a ver una hora de grabación.

Así que sales a buscar una API de transcripción de vídeo que acoplar, y ahí es donde se complica: la mayoría de los servicios de transcripción y de resumen de reuniones encaminan el audio de tus usuarios por infraestructura alojada en EE. UU., o se lo entregan a un LLM de terceros sobre el que no tienes visibilidad contractual. Para una app de consumo, es una nota al pie. Para una plataforma SaaS que vende a clientes europeos de sanidad, educación o el sector jurídico, suele ser un motivo de descarte antes incluso de que la función salga.

Hay una alternativa que conviene conocer: puedes tener subtítulos en directo, transcripciones completas y resúmenes generados con IA con atribución por hablante a través de una sola API, con el audio y el texto tratados por infraestructura y un subencargado con base en la UE, en vez de un servicio de notas independiente alojado en EE. UU. Este artículo va de cómo funciona y de cómo se integra: repasaremos qué piezas hay, cómo las implementa Digital Samba, cómo es una integración mínima y el único compromiso que conviene entender antes de activarlo. Cerca del final también veremos brevemente cómo se compara esto, a nivel de arquitectura, con acoplar un bot de notas independiente, aunque no es el foco principal.

Índice de contenidos

  1. Qué cubre de verdad una «API de transcripción» (y qué comprobar)
  2. Cómo funciona la transcripción en Digital Samba
  3. Resúmenes de reunión con IA por la misma API
  4. Un flujo de integración mínimo
  5. Alojamiento en la UE y la cuestión de las transferencias del RGPD
  6. El compromiso de cifrado que tienes que conocer
  7. Cuándo una API de transcripción gana a un bot de notas independiente
  8. Conclusión
  9. Preguntas frecuentes

Qué cubre de verdad una «API de transcripción» (y qué comprobar)

Quien evalúa este tipo de función tiende a mezclar tres cosas distintas, tanto si la llama herramienta de transcripción de reuniones, tomanotas con IA o simplemente «la API».

  • Los subtítulos en directo son la capa de accesibilidad dentro de la llamada: texto superpuesto a la reunión en tiempo real, útil para participantes sordos, con dificultades de audición o que escuchan en un segundo idioma.
  • Las transcripciones son el registro de texto duradero y recuperable de lo que se dijo, que se va formando durante la sesión o se genera cuando termina.
  • Los resúmenes con IA son un paso más allá: conclusiones condensadas generadas a partir de la transcripción, para captar la idea de una reunión sin leerla entera.

Antes de comprometerte con un proveedor, repasa una lista corta:

  • ¿Dónde se procesa el audio de verdad, y se queda dentro de la misma frontera de infraestructura que la llamada?
  • ¿Qué idiomas se admiten, y esa lista es la misma para los subtítulos en directo que para la transcripción que recuperas después?
  • ¿El servicio es en tiempo real, posterior a la sesión o las dos cosas?
  • ¿Cómo recuperas los resultados: por sondeo (polling) o por webhook?
  • ¿Qué pasa cuando el cifrado se sube al máximo? ¿La función desaparece sin más, o el proveedor finge que sigue funcionando?

Cómo funciona la transcripción en Digital Samba

Los subtítulos en directo y las transcripciones posteriores a la sesión son dos caras de la misma función. Dentro de la sala, los subtítulos se pueden activar por sala con un idioma hablado definido: el texto va entrando a medida que la gente habla y se corrige sobre la marcha para dar sensación de sincronía. Los idiomas de subtítulos cubren ahora búlgaro, catalán, danés, neerlandés, inglés, finés, francés, alemán, italiano, portugués, rumano, español, sueco y turco, y se añaden más a medida que se amplían los modelos de voz subyacentes.

La transcripción se controla tanto dentro de la sala como por la API REST. Los moderadores pueden iniciarla o detenerla desde dentro de la sesión, o puedes dispararla mediante programación, y las salas se pueden configurar con un ajuste de inicio automático para que la transcripción empiece en cuanto entra el primer participante. Una vez que una sesión tiene transcripciones, recupéralas con una petición GET contra sessions/:id/transcripts, que devuelve un array paginado de entradas. Cada una lleva el ID y el nombre del participante, el idioma, el texto de la transcripción y las marcas de tiempo de inicio y fin. Los participantes que entran por teléfono aparecen sin ID de participante, etiquetados como «Phone conference». La transcripción también cubre el audio de teléfono (PSTN) de esta forma, así que quien marca por teléfono queda recogido en la misma transcripción que todos los que entran por vídeo.

Resúmenes de reunión con IA por la misma API

Una vez transcrita una sesión, Digital Samba puede generar un resumen a partir de esa transcripción, con atribución por hablante, de modo que el resumen te dice quién planteó qué en vez de aplanar la conversación en una sola voz. Como el audio de cada participante pasa por la canalización en su propio flujo, esa atribución viene de la propia ruta de la señal, en vez de deducirse a posteriori a partir de una única grabación mezclada. Trata el resultado como un relato condensado de la conversación, no como un registro literal.

Los resúmenes se piden desde un solo endpoint, sessions/:id/summary. La primera llamada arranca la generación y devuelve un estado IN_PROGRESS; sondea el mismo endpoint hasta que el estado pase a READY, o gestiona FAILED, porque una generación fallida no dispara ningún webhook. A diferencia de las transcripciones, no hay una exportación aparte en txt o JSON para los resúmenes a través de la API pública: recibes el texto del resumen en la respuesta y lo almacenas o lo muestras tú.

Trata las dos salidas como una ayuda, no como un registro verificado. La precisión de la transcripción de voz a texto varía con el acento, la calidad del audio y el idioma, y un resumen generado con IA que se equivoque sobre una consulta jurídica o una conversación clínica tiene consecuencias reales. Que alguien revise cualquier cosa de la que dependas antes de tratarla como registro oficial. Planifica también la retención desde el principio: las transcripciones y los resúmenes son datos personales en cuanto existen, así que necesitas una política de borrado tanto como un sitio donde guardarlos. En nuestro lado están cifrados en reposo, pero eliminarlos cuando ya no hacen falta, o cuando alguien lo pide, sigue siendo tarea tuya. Se encargan de ello cuatro endpoints: DELETE sessions/:id/transcripts, DELETE sessions/:id/summaries, y los equivalentes a nivel de sala, DELETE rooms/:id/transcripts y DELETE rooms/:id/summaries.

El valor práctico aquí es tan de arquitectura como de función: una sola superficie de API para transcripción y resumen, un solo modelo de autenticación y un solo subencargado con base en la UE que trata el audio y el texto bajo nuestro acuerdo de tratamiento de datos (DPA), en vez de un contrato aparte que tengas que revisar. No estás cosiendo un bot dentro de la llamada para tomar notas y gestionando luego por separado qué hace ese bot con la grabación.

Un flujo de integración mínimo

Así es una integración básica, paso a paso.

  1. Crea una sala con la transcripción activada. En la creación de la sala solo privacy es obligatorio; todo lo demás es opcional. transcription_enabled está desactivado por defecto y depende de tu plan, así que envíalo de forma explícita:


transcription_store_enabled importa más de lo que parece. Déjalo desactivado y los subtítulos en directo siguen funcionando en la llamada, pero no se guarda nada, así que sessions/:id/transcripts vuelve vacío y no hay transcripción que resumir después.

2. Incrusta la sala con el SDK como de costumbre. Si quieres que los moderadores inicien o detengan la transcripción a mano a mitad de llamada, expón los controles dentro de la sala; si no, el ajuste de inicio automático se encarga en cuanto entra el primer participante.

3. Registra un webhook para los eventos que de verdad importan. No montes la recuperación en torno a session_ended: la transcripción y el resumen siguen procesándose después de que la sesión en sí haya terminado, así que una recuperación disparada por session_ended puede volver corta o vacía. Junto a los eventos de participante y de grabación, Digital Samba dispara dos eventos creados específicamente para esto:

4. Recupera la transcripción cuando llegue session_transcript_ready.

Para una exportación en un solo archivo, GET .../transcripts/export/?format=json devuelve toda la sesión en JSON. Deja el formato sin poner, escríbelo mal o ponle cualquier otra cosa, y recibes texto plano en su lugar.

5. Recupera el resumen cuando llegue session_summary_ready, o sondea sessions/:id/summary directamente si prefieres no esperar al webhook:

Prevé dos cosas desde el principio. Un resumen FAILED nunca dispara un webhook, así que una integración basada solo en webhooks se quedará esperando para siempre en las llamadas donde la generación falle; añade un tiempo de espera o un sondeo de reserva. Y la transcripción no está disponible en las salas de grupos (breakout rooms), así que planifica alrededor de ese hueco si tu producto las usa.

Ese es todo el bucle: sin conjeturas más allá de lo documentado, y los dos eventos «ready» te ahorran sondear con un temporizador para enterarte de cuándo está algo listo.

Alojamiento en la UE y la cuestión de las transferencias del RGPD

El factor diferencial que importa a los compradores regulados es fácil de enunciar y fácil de pasar por alto hasta que te muerde: el audio, las transcripciones y los resúmenes se quedan con ese mismo subencargado con base en la UE, bajo el acuerdo de tratamiento de datos de Digital Samba, en vez de enviarse a un LLM alojado en EE. UU. Hay un motivo legal concreto por el que esto importa, más allá de marcar una casilla de cumplimiento. Según el Capítulo V del RGPD, enviar datos personales (y el audio de una reunión claramente lo es) a un encargado fuera del EEE cuenta como una transferencia internacional. Desde la sentencia Schrems II del TJUE en 2020, se espera que las organizaciones que se apoyan en las cláusulas contractuales tipo (las condiciones contractuales modelo que se usan normalmente para legitimar esas transferencias) hagan una Evaluación de Impacto de las Transferencias documentada del régimen de vigilancia del país de destino antes de poder apoyarse en esas cláusulas. Mantener toda la canalización dentro del EEE esquiva esa evaluación en vez de exigir una respuesta defendible a ella. Si quieres ver exactamente quién trata estos datos, la lista de subencargados actual está en el DPA de Digital Samba.

Hay una segunda vía que toman algunos proveedores. Desde julio de 2023, la decisión de adecuación de la Comisión Europea para el Marco de Privacidad de Datos UE-EE. UU. permite que un encargado estadounidense certificado reciba datos personales sin ninguna Evaluación de Impacto de las Transferencias. Es una opción real, pero la decisión está ahora mismo recurrida ante el Tribunal de Justicia, así que apoyarte en ella te deja expuesto a un litigio que no controlas. Un tratamiento que nunca sale del EEE no acarrea ese riesgo.

Para un producto que vende a clientes de telesalud, EdTech o el sector jurídico, esto suele importar más que cualquier comparación de funciones. Enviar audio con datos de pacientes, expedientes de estudiantes o conversaciones privilegiadas a un tercero alojado en EE. UU. para «resúmenes inteligentes» puede convertir una función atractiva en una responsabilidad de cumplimiento en cuanto el equipo legal de un cliente pregunta adónde fue el audio. Mantener la transcripción y el resumen dentro de la misma frontera de datos de la UE que la llamada resuelve esa cuestión concreta, la del riesgo de transferencia internacional. No te regala el resto de tu cumplimiento del RGPD.

Sigues necesitando una base legal para grabar y transcribir la llamada en primer lugar, lo que en la mayoría de las jurisdicciones exige dar a los participantes un aviso claro y, a menudo, obtener su consentimiento antes de empezar, sin importar dónde se trate después. Esa obligación es tuya, uses transcripción nativa o un bot de notas independiente, así que constrúyela en tu flujo de consentimiento desde el primer día en vez de después de que un cliente pregunte por ella.

Otra norma que conviene tener en el radar: las reglas de transparencia del Reglamento de IA de la UE para el contenido generado con IA ya están en vigor (se aplican desde el 2 de agosto de 2026), y son directamente relevantes para resúmenes generados con IA como estos. Comprueba si tu despliegue necesita etiquetar la salida como generada con IA.

El compromiso de cifrado que tienes que conocer

Este es el compromiso, dicho sin rodeos. En sesiones cifradas de extremo a extremo, la transcripción y los resúmenes del lado del servidor no están disponibles, y es una consecuencia estructural de lo que significa el E2EE: el servidor enruta los medios cifrados entre participantes sin tener nunca las claves para descifrarlos, así que no hay nada que un proceso de voz a texto o de resumen del lado del servidor pueda leer. Los subtítulos y la transcripción quedan explícitamente desactivados en las salas con E2EE por exactamente este motivo.

Eso deja un compromiso que decidir por caso de uso, no un fallo que sortear. Una consulta jurídica o una conversación delicada de recursos humanos necesita la máxima confidencialidad, así que pide E2EE, y la transcripción sencillamente no forma parte del conjunto de funciones de esa sesión. Una sesión que necesita un registro con búsqueda y un resumen se sirve mejor con el cifrado de transporte estándar más el tratamiento del lado del servidor dentro de infraestructura de la UE. Construir esta elección de forma explícita en la configuración de la sala, en vez de suponer que un mismo ajuste vale para toda sesión, es la diferencia entre una plataforma que rompe una función en silencio y una que deja al desarrollador elegir bien.

Cuándo una API de transcripción gana a un bot de notas independiente

Este es un argumento de arquitectura, no una comparación de proveedores. Un bot de notas independiente, del tipo que entra en tu llamada como un participante más solo para grabarla y transcribirla, es un encargado del tratamiento aparte que se sitúa fuera de la frontera de tu plataforma. Tiene su propio almacenamiento, su política de retención, sus condiciones y su postura de seguridad, que tienes que evaluar por separado de la plataforma de vídeo en la que ya confías. Mantener la transcripción nativa en la plataforma que aloja la llamada sigue implicando un subencargado para el trabajo de IA, pero es una sola parte evaluada bajo un DPA que ya tienes, en vez de un contrato nuevo que buscar, leer y negociar por tu cuenta.

El patrón general se mantiene sea cual sea el producto de notas concreto que use un equipo. Investigadores de seguridad han señalado que estos bots suelen pedir acceso al calendario, al audio y a veces a los contactos, y envían las conversaciones a servidores externos bajo condiciones que la mayoría de las organizaciones nunca revisa. Las oficinas de privacidad de las universidades hacen una observación parecida: meter un tomanotas con IA implica compartir la conversación con un proveedor externo que no has evaluado necesariamente, aparte del acuerdo que ya tengas con tu plataforma de vídeo. El riesgo legal no es hipotético: una oleada de litigios en EE. UU. presentados en 2025 y 2026 alega que algunos bots de notas grabaron conversaciones, y en al menos un caso las usaron, sin el consentimiento pleno de los participantes, un patrón que un despacho ha comparado con un invitado no deseado sentado en una conversación privilegiada. Nada de esto dice si un producto concreto es bueno o malo. Es un motivo para sopesar, caso por caso, si añadir un participante solo para grabar la llamada compensa la relación con un proveedor extra que introduce.

Conclusión

En conjunto, esto te da transcripciones y resúmenes generados con IA recuperables por una sola API alojada en la UE, con un flujo por webhooks que te avisa de cuándo está listo cada artefacto en vez de dejarte sondeando, y un compromiso claro en torno al cifrado en lugar de una frase que finge que el compromiso no existe. Si lo estás integrando, la documentación de transcripción, webhooks y seguridad es la siguiente parada, y vale la pena leerla antes de escribir la integración, no después.

Si quieres ayuda para trasladar esto a tu propio producto, o te gustaría un recorrido por la API, ponte en contacto con el equipo de Digital Samba a través de nuestra web.

Preguntas frecuentes

¿Qué es una API de transcripción de vídeo?

Es una API que convierte en texto el audio hablado de una videollamada, y suele cubrir los subtítulos en directo durante la llamada, una transcripción recuperable después y, a veces, un resumen generado con IA a partir de esa transcripción.

¿Ofrece Digital Samba transcripción y resúmenes de reunión con IA por su API?

Sí. La transcripción se puede iniciar, detener o poner en inicio automático por la API REST y el SDK. Las transcripciones se recuperan por sessions/:id/transcripts, y los resúmenes generados con IA por sessions/:id/summary.

¿Puedo tener resúmenes de reunión con IA con atribución por hablante vía API?

Sí. Los resúmenes atribuyen cada punto al participante que lo planteó, tomado de la transcripción por participante en vez de deducirse de una grabación mezclada. Tanto la transcripción como el resumen se recuperan por la API REST.

¿Dónde se procesa el audio de la reunión, y se queda en la UE?

El audio de la reunión lo transcribe y resume un subencargado con base en la UE bajo el DPA de Digital Samba, en vez de encaminarse a un servicio de transcripción o a un LLM aparte alojado en EE. UU.

¿Necesito consentimiento para grabar y transcribir una llamada?

En la mayoría de los casos, sí. El RGPD exige una base legal, y las normas nacionales sobre grabar conversaciones varían: algunos estados miembros de la UE tratan el consentimiento de los participantes como obligatorio, otros aceptan el aviso más un interés legítimo. Comprueba la situación en las jurisdicciones donde operan tus clientes, y recuerda que la obligación es tuya como responsable del tratamiento, no de tu proveedor de vídeo.

¿Puedo borrar las transcripciones y los resúmenes cuando ya no los necesito?

Sí. Los dos se pueden borrar por la API, a nivel de sesión (DELETE sessions/:id/transcripts, DELETE sessions/:id/summaries) o a nivel de sala, y los dos están cifrados en reposo mientras se almacenan.

¿Cómo recupero una transcripción o un resumen: por sondeo o por webhook?

Las dos formas valen. Sondea los endpoints de transcripción y resumen directamente, o registra un webhook para session_transcript_ready y session_summary_ready y dispara la recuperación desde ahí en vez de adivinar el momento. Evita disparar la recuperación desde session_ended: los dos artefactos suelen estar generándose todavía en ese punto.

¿Funciona la transcripción cuando el cifrado de extremo a extremo está activado?

No. En las sesiones con E2EE el servidor nunca tiene las claves necesarias para descifrar los medios, así que la transcripción, los subtítulos y los resúmenes del lado del servidor no están disponibles por diseño. Es un compromiso deliberado entre la máxima confidencialidad y las funciones de IA del lado del servidor.

¿Qué idiomas se admiten para la transcripción y los subtítulos?

Ahora mismo se admiten 14 idiomas: búlgaro, catalán, danés, neerlandés, inglés, finés, francés, alemán, italiano, portugués, rumano, español, sueco y turco, y se añaden más a medida que se amplían los modelos de voz subyacentes. La transcripción también cubre el audio de teléfono (PSTN), no solo a los participantes que entran por el navegador.

Referencias

  1. Digital Samba. (13 de marzo de 2023). New feature: Captions in Digital Samba Embedded.
  2. Digital Samba. (27 de marzo de 2026). End-to-end encryption in video calls: what it actually protects (and what it doesn't). Medium.
  3. Digital Samba. (11 de abril de 2023). The power of E2EE in WebRTC: unlocking a world of secure communication.
  4. Digital Samba. (22 de agosto de 2025). GDPR and EU data hosting: what you need to know.
  5. Digital Samba. (8 de enero de 2026). Bring every participant in: telephony in Digital Samba.
  6. Pinsent Masons. (4 de enero de 2023). International data transfers and Schrems II: GDPR obligations. Out-Law.
  7. Congressional Research Service. (17 de marzo de 2021). EU data transfer requirements and U.S. intelligence laws: understanding Schrems II and its impact on the EU-U.S. Privacy Shield (Informe n.º R46724). Library of Congress.
  8. Nudge Security. (19 de enero de 2026). Shadow AI is taking notes: the growing risk of AI meeting tools.
  9. Privacy at Fordham University. (19 de febrero de 2025). AI notetakers in meetings: balancing efficiency with privacy and risk.
  10. DarkReading. (9 de octubre de 2025). Take note: cyber-risks with AI notetakers.
  11. Shumaker, Loop & Kendrick, LLP. (21 de enero de 2026). AI notetakers in the boardroom: privilege and privacy considerations.