Blog••Periodismo

Transcripción de grupos focales: formatos, etiquetas de hablante y tiempos

Sarah Johnson

Sarah Johnson

Escribe sobre ventas de campo, notas de reuniones y flujos de trabajo por voz en ParrotNotes. El equipo de producto de ParrotNotes revisa cada artículo antes de publicarlo.

Transcripción de grupos focales: formatos, etiquetas de hablante y tiempos

Daniela moderó seis grupos focales para una cadena regional de supermercados en Monterrey: ocho clientes por sesión, 90 minutos cada una. En la sala, las grabaciones sonaban bien. Al transcribir la tercera sesión, ya no podía distinguir a las dos maestras jubiladas, y en un minuto acalorado sobre el costo de envío hablaban cuatro personas a la vez. (Daniela es un caso compuesto, no una investigadora real).

Eso es lo que hace que la transcripción de grupos focales sea más difícil que transcribir una entrevista. Una entrevista tiene dos voces. Un grupo focal tiene ocho, las personas se interrumpen y la mitad del valor está en quién estuvo de acuerdo con quién.

La buena noticia: casi todo se resuelve antes de escribir una sola palabra. A continuación: qué formato elegir, cómo preparar la sala para tener etiquetas de hablante limpias, una plantilla para copiar, un planificador de tiempos y cómo anonimizar una transcripción grupal.

¿Tienes grupos este mes? Descarga ParrotNotes gratis, graba con el teléfono que ya tienes y empieza cada transcripción desde un borrador en lugar de una página en blanco.

En qué se diferencia la transcripción de un grupo focal de la de una entrevista

La tarea de fondo es la misma: texto preciso y fácil de buscar. Nuestra guía sobre cómo transcribir una entrevista explica la revisión que aplica a cualquier grabación.

Los grupos agregan cuatro problemas:

  • Muchas voces. La hoja de consejos sobre grupos focales de la University of Wisconsin Extension indica que suele haber de 8 a 12 participantes y que las sesiones suelen durar de una a dos horas. Son muchas voces parecidas que hay que distinguir.
  • Superposición. La gente asiente, interrumpe y se ríe al mismo tiempo. Ahí es donde se pierden palabras.
  • La interacción también es dato. En una entrevista importa sobre todo lo que se dijo. En un grupo también importa quién lo dijo, quién lo cuestionó y si la sala estuvo de acuerdo.
  • Confidencialidad compartida. Todas las personas en la sala escuchan a las demás, y eso cambia el consentimiento y la anonimización.

Por eso, la transcripción de grupos focales vale lo que valen sus etiquetas de hablante. Planifícalas primero.

Elige un formato para la transcripción de grupos focales

Define el nivel de detalle según lo que vas a hacer con la transcripción. Para ver los estilos a fondo, consulta nuestra guía sobre transcripción literal.

Propósito del estudioFormatoConservarOmitir
Análisis temático académicoLiteral, notación ligeraCada palabra, risas, (hablan a la vez), marcas de inaudibleLa mayoría de los "eh" y "este"
Análisis del discurso o de la interacciónLiteral estrictoMuletillas, frases cortadas, superposiciones, quién interrumpe a quiénCasi nada
Investigación de mercados o reporte de UXLiteral limpiaCada idea y cada cita, etiquetas de hablanteMuletillas, frases cortadas, repeticiones
Revisión interna o evaluación de programaResumen más citas claveTemas, acuerdos, desacuerdos, frases citablesRegistro palabra por palabra

Conserva las etiquetas de hablante en cualquier formato. Sin ellas, sabes que alguien planteó una idea, pero no si una sola persona con voz fuerte la repitió cinco veces. ¿También haces entrevistas individuales? Nuestra guía de transcripción de entrevistas cualitativas incluye un protocolo de notación completo.

Antes de la sesión: prepara etiquetas de hablante limpias

Las etiquetas fallan en la sala, no frente al teclado. Cuatro hábitos resuelven casi todo:

  1. Dibuja un plano de asientos. Numera los lugares en el sentido de las manecillas del reloj a partir de quien modera (P1, P2...) y guarda el plano junto con la grabación.
  2. Haz una ronda de presentación grabada. Pide a cada persona que diga su nombre o su ID y una frase sobre sí misma. Esos primeros 60 segundos se convierten en la muestra de referencia de cada voz de la sesión.
  3. Pon la grabadora en el centro. Coloca el teléfono plano sobre la mesa, a la misma distancia de todas las personas, lejos de tazas y salidas de aire. En una mesa larga, usa dos dispositivos. Nuestra guía sobre cómo grabar una entrevista cubre las pruebas de audio y el ruido de la sala.
  4. Suma a alguien que tome notas. La hoja de Wisconsin recomienda una persona asistente de moderación que anote quién dijo qué ("an identifier of who said what"). Esa nota vale oro cuando el audio no se entiende.

Consentimiento de cada participante

Todas las personas en la sala quedan grabadas, así que todas deben aceptar, por escrito y otra vez en la grabación. El comité de ética (IRB) del Teachers College de la Columbia University recomienda que el formulario de consentimiento indique qué actividades se grabarán y cómo se guardarán y usarán las grabaciones.

La misma guía señala algo propio de los grupos: quienes investigan no pueden garantizar la confidencialidad a sus participantes ("researchers cannot guarantee confidentiality to their participants"), porque las demás personas escuchan todo. Dilo en el formulario y pide al grupo que lo que se dice en la sala se quede ahí.

En sesiones por teléfono o video con personas en distintos estados de EE. UU., las leyes de grabación cambian. Consulta nuestro resumen sobre el consentimiento de una parte en Estados Unidos. En otros países aplican sus propias reglas de grabación y protección de datos; confirma tu proceso con tu comité de ética o tu equipo legal.

Etiquetas de hablante con 6 a 10 voces

Acuerda estas reglas antes de la primera sesión y úsalas en cada transcripción del estudio:

  • MOD para quien modera, AM para la asistencia de moderación, P1 a P10 para participantes según su asiento.
  • Una persona por párrafo. Un párrafo nuevo cada vez que cambia la voz.
  • Nunca cambies las etiquetas a mitad del estudio. P4 en la sesión 2 es el asiento, no la persona. Lleva una lista que relacione los ID de cada sesión con tus códigos de participante.
  • ¿Tienes dudas? Márcalo. Usa P? con marca de tiempo en lugar de adivinar.
  • Las voces simultáneas llevan etiqueta. Escribe (hablan a la vez) donde varias personas hablan al mismo tiempo y luego transcribe las palabras que sí puedes atribuir.
  • Las reacciones del grupo cuentan. Anota (varias personas asienten), (risas) o (P2 y P5 niegan con la cabeza, según notas) cuando la reacción importa.

El registro de hablantes de quien toma notas

Durante la sesión, la persona asistente escribe una línea cada vez que alguien nuevo empieza a hablar:

HoraAsientoPrimeras palabrasNota
00:14:05P3"La verdad, la app está..."En contra del costo de envío
00:14:40P6"Yo lo pagaría si..."De acuerdo, con condición
00:15:02P1 + P4(hablan a la vez)Las dos personas se ríen, P1 más fuerte

Cuando llegue el borrador, cruza cada hora y las primeras palabras con la transcripción. Una etiqueta equivocada se corrige en segundos, en lugar de volver a escuchar el audio para adivinar entre dos voces parecidas.

Antes de tu próxima sesión: descarga ParrotNotes gratis y haz una grabación de prueba de dos minutos desde cada asiento, para saber que todas las voces se escucharán.

Marcas de tiempo y una plantilla para la transcripción del grupo focal

Elige una regla para las marcas de tiempo y mantenla: en cada cambio de hablante o, en sesiones largas, cada dos o tres minutos. Usa [hh:mm:ss] para que cualquier persona del equipo pueda ir directo al audio.

Copia esta plantilla al inicio de cada transcripción:

TRANSCRIPCIÓN DE GRUPO FOCAL
Estudio:          [nombre o código del estudio]
Sesión:           [3 de 6]
Fecha y modo:     [11 de octubre de 2026, presencial / video]
Archivo de audio: [FG03_2026-10-11.m4a, 01:31:12]
Formato:          [literal limpia, etiquetas de hablante, marca de tiempo por turno]
Moderación:       MOD = [iniciales]   Notas: AM = [iniciales]
Transcrito por:   [nombre o "borrador de IA", fecha]
Revisado contra el audio y el registro de hablantes por: [nombre, fecha]
Anonimizado:      [sí, registro ANON-FG03 / no]
Consentimiento:   [versión del formulario; los 8 confirmaron en audio a las 00:00:40]

LISTA DE HABLANTES (por asiento, en el sentido del reloj desde MOD)
P1 = [código F-01]  P2 = [F-02]  P3 = [F-03]  P4 = [F-04]
P5 = [F-05]  P6 = [F-06]  P7 = [F-07]  P8 = [F-08]

---

MOD: [00:12:30] Hablemos del envío a domicilio. ¿Qué haría que lo pagaras?

P3: [00:14:05] La verdad, la app está bien. Lo que no pago es el costo de envío.

P6: [00:14:40] Yo lo pagaría si llegara el mismo día.

(hablan a la vez, P1 y P4) [00:15:02]

P1: [00:15:06] El mismo día, claro, pero no por cinco dólares. (risas)

Mantén un turno por párrafo, para que el software de análisis y las hojas de cálculo traten cada turno como una fila.

Tiempos: cuánto tarda la transcripción de grupos focales

El tiempo depende de dos cosas: el borrador y la revisión. Hoy los borradores son rápidos. La revisión es la que se lleva las horas.

En un estudio de 2024 publicado en el European Journal of Cardiovascular Nursing, Helen Eftekhari transcribió entrevistas individuales de 40 a 131 minutos con el reconocimiento de voz de Microsoft Teams. Revisar y limpiar cada transcripción tomó entre 1.5 y 3.5 horas, según la precisión y la duración de la entrevista. Eso fue con dos voces. Un grupo de 90 minutos con ocho voces no va a tardar menos.

Este es un planificador para el estudio de seis sesiones de Daniela. Las horas por sesión son nuestra estimación de planificación para grupos, puesta por encima del rango del estudio de entrevistas, no una cifra medida:

PasoPor sesión de 90 minutosSeis sesiones
Borrador con IAMinutos después de subir el audioEl mismo día
Corregir etiquetas con el registro0.5 a 1 hora3 a 6 horas
Revisión de precisión contra el audio2 a 3.5 horas12 a 21 horas
Dar formato y anonimizar0.5 a 1 hora3 a 6 horas
Total3 a 5.5 horas18 a 33 horas

Para acortarlo, revisa cada sesión el mismo día, mientras las voces están frescas, y asigna a una sola persona la corrección de etiquetas de todas las sesiones. ¿Prefieres contratar un servicio de transcripción? Pregunta si cobra extra por cada hablante adicional, si etiqueta por asiento según tu lista y en cuánto tiempo entrega audio con muchas voces. Después, revisa tú una sesión como muestra.

Cómo anonimizar una transcripción grupal

En los grupos, las personas se llaman por su nombre. "Como dijo María" puede identificar a María aunque hayas reemplazado su nombre en sus propios turnos.

La guía del UK Data Service sobre anonimización de datos de texto recomienda reemplazar los datos que identifican con seudónimos o descripciones entre corchetes, llevar un registro aparte de cada cambio y no anonimizar tanto que los datos pierdan su sentido. Para grupos, agrega tres revisiones:

  • Busca cada nombre de la lista, incluidos los apodos, en todos los turnos.
  • Fíjate en empleadores y lugares que solo mencionaría una persona.
  • Revisa las combinaciones. Un puesto, una ciudad y una anécdota pueden apuntar a una persona aunque ya no haya nombres.

Trabaja sobre una copia y guarda el registro junto con el audio original.

Transcripción de grupos focales con ParrotNotes

ParrotNotes graba en tu teléfono o en tu Mac sin que se una ningún bot, así que un grupo presencial en un salón comunitario funciona igual de bien que una llamada. La grabación funciona sin conexión; la transcripción se hace en cuanto vuelves a conectarte.

  • Sesiones largas. Pro graba hasta 3 horas por grabación, con 3,000 minutos al mes, suficiente para un estudio completo.
  • Identificación de hablantes en Pro. Los turnos llegan separados antes de tu revisión. La ronda de presentación y el registro de hablantes hacen fácil confirmar las etiquetas, sobre todo cuando hablan a la vez.
  • Búsqueda entre sesiones. La búsqueda por palabra clave, en todos los planes, encuentra la cita que apenas recuerdas. Pro agrega la búsqueda semántica con IA.
  • Más de 99 idiomas. Pro transcribe y traduce, útil para grupos en español, inglés o una mezcla de ambos.
  • Exportación. Texto o markdown en todos los planes; DOCX o PDF en Pro.

El plan gratuito incluye 100 minutos al mes con un resumen de IA en cada grabación. Pro cuesta US$19.99 al mes, o US$14.99 al mes con pago anual.

Kofi, investigador de UX, hizo cuatro grupos en inglés y portugués. Grabó cada uno con su teléfono, confirmó los hablantes con el registro de quien tomaba notas esa misma tarde y envió las transcripciones en literal limpia dos días después de la última sesión. (Kofi es un caso compuesto).

Si las etiquetas están bien, lo demás sale solo

Una buena transcripción de grupos focales depende de unas pocas decisiones tempranas:

  • Elige el formato según lo que harás con la transcripción
  • Numera los asientos, graba una ronda de presentación y lleva un registro de hablantes
  • Pide el consentimiento de cada participante y aclara que en un grupo no se puede garantizar la confidencialidad
  • Reserva horas para revisar, no para teclear
  • Anonimiza también los nombres con los que las personas se llaman entre sí

¿Estás planeando tu próxima sesión? Descarga ParrotNotes gratis y empieza cada transcripción desde un borrador en el que puedes buscar.

Preguntas frecuentes

¿Cómo se transcribe un grupo focal?

Graba la sesión con el consentimiento de cada participante, obtén un primer borrador con software o con una persona que transcriba y luego corrige las etiquetas de hablante con el plano de asientos y el registro de quien tomó notas. Revisa cada línea contra el audio, aplica tu formato y anonimiza sobre una copia.

¿Cómo se etiquetan los hablantes en la transcripción de un grupo focal?

Usa MOD para quien modera y P1, P2, etc., según el asiento, con una lista que relacione los asientos con los códigos de participante. Empieza un párrafo nuevo en cada cambio de hablante, marca los turnos dudosos como P? con marca de tiempo y etiqueta cuando hablan a la vez.

¿Cuánto tarda la transcripción de un grupo focal?

El borrador puede estar listo en minutos; la revisión es la que toma tiempo. Un estudio de 2024 encontró que revisar entrevistas individuales tomó de 1.5 a 3.5 horas cada una. Para un grupo con muchas voces, calcula más: unas 3 a 5.5 horas por sesión de 90 minutos.

¿La transcripción de un grupo focal debe ser literal?

Depende del análisis. El trabajo académico temático o de análisis del discurso suele necesitar transcripción literal. Los reportes de investigación de mercados suelen usar literal limpia. Cualquier formato debe conservar las etiquetas de hablante.

¿Todas las personas del grupo focal deben dar su consentimiento para la grabación?

Sí. Pide el consentimiento por escrito a cada participante, confírmalo en la grabación al inicio y explica qué se graba, cómo se guardará y que en un grupo la confidencialidad no se puede garantizar por completo.