Ir al contenido principal
  • audio
  • reuniones
  • transcripción

Cómo sacar la minuta de una reunión grabada con IA (y saber quién dijo qué)

Sube el audio o el video de la reunión, espera la transcripción con hablantes separados y pide la minuta. Cada acuerdo queda enlazado al segundo exacto en el que se dijo, para que nadie discuta después qué se acordó.

BrainBox Team8 min de lectura
Ver en Markdown

Una minuta útil es una lista de decisiones y responsables en la que cada punto se puede comprobar contra la grabación. Con una herramienta de IA que transcribe por hablante y guarda el timestamp de cada frase, la minuta sale en un par de preguntas y cualquier duda se resuelve escuchando diez segundos de audio en lugar de la hora completa.

¿Qué necesita una herramienta de IA para hacer bien una minuta?

Tres cosas, y las tres tienen que ocurrir antes de que el modelo escriba una sola línea.

La primera es una transcripción con hablantes separados. Sin diarización, "acordamos bajar el presupuesto" no dice quién lo propuso ni quién aceptó, y esa es justamente la información que después se discute.

La segunda es que cada frase conserve su tiempo de inicio y fin. Una transcripción plana pegada en un chat pierde eso: el modelo puede resumir, pero nadie puede volver al momento exacto para comprobarlo.

La tercera es que el modelo responda solo con lo que hay en la transcripción. Si el sistema le pasa al modelo un archivo de texto sin estructura, o si el audio es demasiado largo para su ventana de contexto, el modelo completa los huecos con lo que "suele pasar en una reunión". Eso es lo que produce minutas con acuerdos que nunca se tomaron.

BrainBox es un espacio de trabajo de IA para documentos que responde con citas a la página exacta. En audio y video, la "página" es el segundo: cada segmento de la transcripción se indexa con su hablante y su timestamp, y las respuestas citan ese punto.

¿Cómo se saca la minuta paso a paso?

  1. Sube la grabación al Box de la reunión o del proyecto

    Arrastra el MP3, MP4, M4A, WAV o MOV. El archivo aparece con estado Pendiente mientras se transcribe y pasa a Indexado cuando ya puedes preguntarle. No hace falta convertirlo ni recortarlo: el límite es 2 GB y 10 horas por archivo.

  2. Abre el archivo y revisa la transcripción

    El reproductor muestra la transcripción con el hablante y el tiempo de cada línea. Si activas Seguir transcripción, la línea activa se desplaza con el audio. Sirve para comprobar que la calidad del audio permitió una transcripción limpia antes de pedir nada.

  3. Dile a la IA quién es cada hablante

    La diarización etiqueta a las personas como Speaker A, Speaker B, etc. Un mensaje del tipo "Speaker A es Laura (gerencia), Speaker B es Andrés (finanzas)" basta para que la minuta use nombres.

  4. Pide la minuta con una estructura concreta

    Cuanto más específica la petición, más comprobable la minuta. Por ejemplo: "Minuta con: asistentes, decisiones tomadas, responsables y fechas, temas pendientes. Cita el momento de cada decisión."

  5. Verifica las decisiones haciendo clic en las citas

    Cada decisión llega con una cita que abre el reproductor en ese segundo. Si una frase está mal atribuida o el modelo resumió de más, lo ves en diez segundos de audio.

  6. Guarda la minuta en el Box o expórtala

    Puedes pedirle a la IA que escriba la minuta como archivo dentro del Box, exportar el chat a PDF, Markdown o HTML, o copiar una referencia temporal para pegarla en un correo.

¿Cómo se ve una minuta con citas al audio?

Así responde BrainBox a una petición de minuta sobre una reunión de 48 minutos. Cada decisión lleva un número de cita, y la lista de Footnotes debajo del mensaje indica el archivo y el segundo exacto.

Haz la minuta de la reunión: decisiones, responsable y fecha de cada una, y temas que quedaron pendientes. Speaker A es Laura, Speaker B es Andrés.

Decisiones

  1. Reducir el presupuesto de marketing un 12 % solo para el cuarto trimestre. Propuso Laura, aceptó Andrés con la condición de revisarlo en enero.1
  2. Congelar contrataciones nuevas hasta cerrar la ronda. Responsable: Andrés. Fecha: antes del 30 de septiembre.2

Pendientes

  • Laura pidió una proyección de caja a seis meses; no se asignó responsable.3

Footnotes

  1. 1.reunion-comite-2026-08-14.mp3- 00:14:02.000
  2. 2.reunion-comite-2026-08-14.mp3- 00:21:47.000
  3. 3.reunion-comite-2026-08-14.mp3- 00:33:15.000

Al hacer clic en una nota al pie, el reproductor se abre en ese punto y la transcripción queda así:

reunion-comite-2026-08-14.mp3
00:13:51Laura

Yo propongo bajar marketing un doce por ciento, pero solo para el último trimestre.

00:14:02Andrés

De acuerdo, con la condición de que lo revisemos en enero con los números cerrados.

00:14:09Laura

Perfecto, queda así.

La afirmación "aceptó Andrés con la condición de revisarlo en enero" no depende de la memoria de nadie: está en el minuto 14:02.

¿Qué formatos y límites tiene la transcripción?

AspectoDetalle
Formatos de audioMás de 30: MP3, WAV, M4A, M4B, AAC, FLAC, OGG, OPUS, WMA, AMR, AIFF, WebM y otros
Formatos de videoMás de 20: MP4, MOV, WebM, M4V, MTS, M2TS, MXF, FLV y otros
Tamaño máximo por archivo2 GB
Duración máxima10 horas
HablantesDiarización automática (Speaker A, B, C...)
IdiomaDetección automática
Qué se guardaTranscripción en JSON y subtítulos WebVTT junto al archivo original
CitasTimestamp de inicio y fin del segmento; clic abre el reproductor en ese punto
ClipsHasta 5 minutos, con referencia temporal copiable
CostoUnidades de inteligencia según los minutos de audio

¿Qué preguntas conviene hacer después de la minuta?

Como la transcripción queda indexada en el Box, las preguntas siguientes se responden con las mismas citas:

  • "¿Qué compromisos asumió Andrés en esta reunión y en la del 7 de agosto?" Si ambas grabaciones están en el Box, la respuesta cruza las dos con el minuto de cada una.
  • "¿En qué momento se habló del proveedor X?" Devuelve los segmentos con su timestamp, sin que tengas que escuchar nada.
  • "Redacta el correo de seguimiento con las tres decisiones y sus responsables." Sale listo para enviar, con las citas si las quieres conservar.

Si la grabación es de una audiencia o de una entrevista, la lógica es la misma. En un expediente, la cita al segundo exacto es lo que permite citar lo que se dijo sin reconstruirlo de memoria.

¿En qué se diferencia de pegar la transcripción en ChatGPT?

Pegar una transcripción en un chat general funciona para una reunión corta. Deja de funcionar cuando la reunión dura dos horas, cuando hay varias grabaciones del mismo proyecto o cuando alguien pide "¿dónde dijo eso?".

Pegar transcripción en un chat generalBrainBox
HablantesSolo si tu transcriptor los separóDiarización automática al subir
Volver al audioNo hay enlace al segundoCada cita abre el reproductor en ese punto
Reuniones largasSe corta o se resume la entradaSe indexa por segmentos; 10 horas por archivo
Varias reunionesUna a la vezTodas las del Box, con la fecha de cada cita
Después de la minutaSe pierde al cerrar el chatLa transcripción queda como fuente en el Box

NotebookLM también transcribe audio y permite preguntarle. La diferencia práctica está en la diarización, en el reproductor con transcripción sincronizada y en que la grabación convive con los PDF, correos y hojas de cálculo del mismo proyecto, de modo que una pregunta puede cruzar la reunión con el contrato que se discutió en ella.

Para equipos de cumplimiento, la misma grabación sirve como evidencia de lo acordado en un comité. Para equipos legales, es la base para preparar el acta de una audiencia o una declaración sin depender de notas tomadas a mano.

BrainBox respondiendo una pregunta sobre un archivo WAV: la respuesta lleva citas numeradas, la lista de Footnotes muestra el archivo y el segundo exacto (00:00:22 y 00:00:31), y el reproductor de la derecha muestra la transcripción con timestamps y la línea activa
Pregunta sobre un audio en BrainBox: cada dato de la respuesta remite a un segundo concreto de la grabación.

El límite práctico es 10 horas y 2 GB por archivo; una jornada completa de trabajo grabada cabe en un solo archivo y se puede preguntar entera.

Preguntas frecuentes

¿Qué formatos de audio y video acepta BrainBox para transcribir?
Acepta más de 30 formatos de audio (MP3, WAV, M4A, AAC, FLAC, OGG, OPUS, WMA, AMR, entre otros) y más de 20 de video (MP4, MOV, WebM, M4V, MTS, M2TS, MXF, FLV, entre otros). El límite es 2 GB por archivo y 10 horas de duración.
¿La transcripción distingue quién habla?
Sí. La transcripción incluye diarización: cada segmento lleva una etiqueta de hablante (Speaker A, Speaker B, ...) y su tiempo de inicio y fin. Puedes decirle a la IA quién es cada hablante en el chat y ella usará los nombres en la minuta.
¿Detecta el idioma de la reunión automáticamente?
Sí. La detección de idioma es automática, así que puedes subir reuniones en español, inglés o mezcladas sin configurar nada.
¿Cuánto tarda en transcribir una reunión de una hora?
Depende de la cola de procesamiento, pero normalmente son unos minutos. El archivo aparece como Pendiente mientras se transcribe y pasa a Indexado cuando ya puedes preguntarle.
¿Cuánto cuesta transcribir una reunión?
El costo se cobra en unidades de inteligencia según los minutos de audio. Antes de subir, la pantalla de carga te muestra si tu cuota alcanza.
¿Puedo compartir solo el fragmento donde se tomó una decisión?
Sí. Desde el reproductor puedes copiar una referencia temporal o crear un clip de hasta 5 minutos con el fragmento exacto y compartirlo.

Escrito por

BrainBox Team

Inteligencia documental, por ExaByte Company

Construimos BrainBox — la plataforma que los equipos usan para preguntar sobre sus propios documentos y obtener respuestas con citas exactas de página.