Chatbots y Asistentes

Cómo subir un audio a ChatGPT para transcribir una reunión, entrevista o clase

ChatGPT ya permite subir archivos de audio para obtener una transcripción, resumir reuniones o entrevistas y hacer preguntas sobre la grabación.

ChatGPT ya permite subir directamente archivos de audio para transcribirlos, resumir su contenido y hacer preguntas sobre la grabación. OpenAI incorporó la función el 6 de octubre de 2026 y la orienta a usos como reuniones, entrevistas, clases y otras grabaciones de voz.

La función está disponible en las suscripciones de pago de ChatGPT y en espacios de trabajo, incluido Enterprise. Por ahora, OpenAI indica que las cargas de audio no están disponibles en el plan Free. La disponibilidad concreta también puede depender de la región, la configuración del workspace, la versión de la aplicación y el modelo seleccionado.

Cómo subir un audio a ChatGPT y pedir la transcripción

El procedimiento es similar al de cualquier otro archivo:

  1. Abre una conversación nueva o existente en ChatGPT.
  2. Utiliza la opción para adjuntar un archivo.
  3. Selecciona la grabación de audio desde tu dispositivo.
  4. Espera a que termine de cargarse.
  5. Escribe qué quieres obtener del archivo.

Por ejemplo, puedes pedir directamente:

  • “Transcribe este audio completo.”
  • “Resume esta reunión y separa las decisiones y tareas pendientes.”
  • “Extrae las preguntas y respuestas de esta entrevista.”
  • “Convierte esta clase en apuntes estructurados.”
  • “Redacta un correo de seguimiento a partir de esta reunión.”

Una vez procesado el archivo, no es necesario volver a subirlo para cada consulta. Puedes continuar preguntando sobre su contenido dentro de la misma conversación.

Qué formatos de audio acepta ChatGPT

OpenAI admite actualmente los siguientes formatos para las cargas de audio:

  • WAV;
  • MP3 y MPEG;
  • OGG y OGA;
  • PCM;
  • FLAC;
  • AAC;
  • M4A;
  • WebM con solo audio;
  • MP4 con solo audio.

El archivo tiene que contener un flujo de audio válido que ChatGPT pueda decodificar.

Hay una excepción importante para WebM y MP4: si el archivo es identificado como vídeo en lugar de audio, no se admite mediante esta función aunque contenga una pista de sonido.

El límite es de 512 MB por archivo de audio

OpenAI establece un límite máximo de 512 MB por archivo de audio.

Las grabaciones largas pueden dividirse internamente en secciones más pequeñas cuando las herramientas necesarias están disponibles. La compañía advierte, sin embargo, de que el procesamiento de audios muy extensos funciona bajo un sistema de mejor esfuerzo y puede agotarse el tiempo de procesamiento.

Para una grabación especialmente larga, puede ser más práctico dividirla previamente en varios archivos y trabajar con ellos por partes.

Cómo obtener algo más útil que una transcripción completa

Subir el archivo y pedir únicamente “transcribe esto” funciona, pero ChatGPT puede aprovechar el audio de formas más útiles si se especifica el resultado esperado.

En una reunión de trabajo, por ejemplo, puedes pedir que devuelva:

  • un resumen ejecutivo;
  • las decisiones tomadas;
  • las tareas pendientes;
  • los responsables mencionados;
  • las fechas o plazos citados;
  • los temas que quedaron sin resolver.

Después puedes continuar con una petición como “redacta un email para los participantes con las decisiones y próximos pasos” sin volver a procesar manualmente la grabación.

También sirve para entrevistas y clases

En una entrevista, una opción útil es solicitar primero la transcripción y después pedir a ChatGPT que organice el contenido por preguntas, temas o declaraciones importantes.

Con una clase o conferencia puedes pedir apuntes con encabezados, conceptos clave, definiciones y un resumen final. También es posible hacer posteriormente preguntas concretas como “¿qué explicó sobre este concepto?” utilizando el propio audio como contexto.

Conviene revisar la transcripción antes de utilizarla

OpenAI advierte expresamente de que las transcripciones pueden contener errores. La precisión puede variar según el idioma, la calidad de la grabación, el ruido de fondo y otros factores.

La identificación de quién habla tampoco debe considerarse completamente fiable. Si una reunión contiene varias personas, ChatGPT puede equivocarse al atribuir una frase a un participante concreto.

Por ello, nombres, cifras, fechas, citas textuales y decisiones importantes deberían comprobarse contra la grabación original antes de utilizar la transcripción como documento definitivo.

Qué hacer si ChatGPT no acepta el archivo de audio

Si la carga falla, comprueba primero que utilizas una suscripción compatible y que la función está disponible en tu cuenta o espacio de trabajo.

Después revisa tres puntos:

  • que el formato esté entre los soportados;
  • que el archivo no supere los 512 MB;
  • que realmente contenga un flujo de audio válido y decodificable.

En el caso de archivos MP4 o WebM, asegúrate además de que sean archivos de solo audio. Un MP4 identificado como vídeo no entra en los formatos compatibles con esta función.

Con esta actualización, ChatGPT puede utilizar una grabación como material de trabajo durante toda la conversación: primero generar la transcripción y después convertirla en resúmenes, notas estructuradas, preguntas y respuestas o documentos de seguimiento.