Estadísticas de Transcripción de Video (2026): el Español es el Idioma #1 de YouTube en Nuestros Datos
Datos originales de 5,832 transcripciones reales: el español encabeza YouTube con el 45% de las solicitudes, los Reels en español corren a 192 palabras por minuto (más rápido que el inglés), y el 3.1% de los videos no contiene voz alguna.
Entre el 2 de mayo y el 12 de agosto de 2026, la gente usó Voqusa para transcribir 5,832 videos y archivos de audio de siete plataformas sociales. Esta es la edición en español del estudio, y los números le dan al español un protagonismo que no esperábamos: el español es el idioma más transcrito de YouTube en el dataset — 45.1% de las solicitudes con idioma registrado, casi el doble que el inglés (25.8%). Además, los Reels en español corren a 192 palabras por minuto, más rápido que los Reels en inglés (184 ppm) y muy por encima de las 170 ppm que la Fundéu cita como velocidad óptima de locución. Y el 3.1% de los videos que la gente intenta transcribir resulta no contener voz alguna.
Cada cifra sale de nuestra propia telemetría de producción — solo estadísticas agregadas, sin leer ni citar el contenido de ninguna transcripción — y actualizaremos el estudio conforme crezca el dataset.
Hallazgos clave#
- El español encabeza YouTube: 45.1% de las transcripciones de YouTube con idioma registrado son en español, contra 25.8% en inglés. Quien transcribe YouTube en Voqusa, transcribe sobre todo contenido en español.
- El habla en español de formato corto es rápida: 192 palabras por minuto en Reels de Instagram y 189 ppm en TikTok — por encima de los Reels en inglés (184 ppm) y del rango conversacional de 120–150 ppm.
- El usuario hispanohablante usa la transcripción para formato largo: el 80.7% de sus solicitudes son de YouTube, con una duración mediana de 21 minutos 34 segundos por video.
- El ecosistema de subtítulos de YouTube en español funciona: el 88% de las solicitudes de YouTube en español pudo servirse desde subtítulos ya existentes — mejor que el promedio global de la plataforma (71.5%). Fuera de YouTube, prácticamente el 100% requirió reconocimiento de voz.
- A nivel global, el 68.3% del audio transcrito no está en inglés. El español es el tercer idioma (16.1%), detrás del inglés (31.7%) y el coreano (16.9%).
Sobre el dataset#
El dataset cubre todas las transcripciones procesadas por Voqusa, un generador de transcripciones gratuito en línea, entre el 2 de mayo y el 12 de agosto de 2026: 5,832 transcripciones almacenadas de 5,659 videos distintos y archivos subidos, provenientes de Instagram, YouTube, Pinterest, TikTok, Facebook, X/Twitter, LinkedIn y subidas directas. Todas las estadísticas son agregados calculados sobre metadatos de la base de datos — plataforma, modo de transcripción, idioma detectado, duración y conteo de palabras — sin leer ni citar el contenido de ninguna transcripción. Las cifras de velocidad del habla usan transcripciones por reconocimiento de voz de entre 10 segundos y 2 horas, dividiendo el conteo de palabras entre la duración de audio realmente transcrita. Las cuotas de idioma excluyen 1,046 filas sin idioma registrado. El conjunto incluye una ráfaga automatizada identificada de ~230 solicitudes de YouTube el 24–25 de julio de 2026, mayoritariamente en chino; al excluirla, la cuota del español en YouTube sube de 45.1% a ~50% — el titular de este estudio es la versión conservadora.
El español, idioma #1 de YouTube#
De las 1,387 transcripciones de YouTube con idioma registrado:
| Idioma | Cuota en YouTube |
|---|---|
| Español | 45.1% |
| Inglés | 25.8% |
| Chino | 16.3% |
| Coreano | 4.9% |
| Árabe | 1.3% |
| Francés | 1.1% |
El patrón del usuario hispanohablante es distinto al de cualquier otro idioma del dataset: mientras el uso global se reparte entre Reels, TikToks y Pines, el 80.7% de las solicitudes en español son de YouTube — podcasts, entrevistas, clases y videoensayos con una mediana de 21 minutos. La transcripción en español no es una herramienta de subtítulos: es una herramienta de estudio. Pega el enlace, transcribe el video de YouTube a texto, y el contenido de 20 minutos queda disponible para citar, resumir y buscar.
La segunda diferencia es estructural: YouTube es la única plataforma con un ecosistema de subtítulos que funciona, y en español funciona mejor que el promedio — el 88% de las solicitudes en español se sirvió desde una pista de subtítulos que ya existía (global: 71.5%). En Instagram, TikTok, Pinterest y Facebook, la pista de subtítulos prácticamente nunca existe: cada transcripción tuvo que generarse desde el audio.
¿Cuántas palabras por minuto se hablan en video?#
Medido sobre transcripciones por reconocimiento de voz (el conteo por espacios no aplica a idiomas que se escriben sin ellos):
| Contexto | Velocidad | Muestra |
|---|---|---|
| Reels de Instagram en español | 192 ppm | 39 |
| TikTok en español | 189 ppm | 67 |
| Reels de Instagram en inglés | 184 ppm | 312 |
| TikTok en inglés | 172 ppm | 121 |
| YouTube en español (formato largo) | 104 ppm | 75 |
| Referencia: locución óptima (Fundéu) | 170 ppm | — |
| Referencia: conversación en inglés (VirtualSpeech) | 120–150 ppm | — |
El formato corto en español corre un 13% por encima de la velocidad óptima de locución y toca el techo del rango de un locutor profesional. A 192 ppm, un Reel entrega más de tres palabras por segundo: el gancho de los primeros dos segundos son unas seis o siete palabras — escríbelas como si costaran.
El YouTube en español baja a 104 ppm no porque se hable más lento, sino porque el formato largo incluye pausas, música e intros que diluyen el promedio por minuto de audio.
Tabla rápida (al ritmo real medido en video corto en español, ~190 ppm; entre paréntesis, a ritmo de discurso de 140–160 ppm):
| Duración hablada | Palabras aprox. |
|---|---|
| 30 segundos | ~95 (70–80) |
| 1 minuto | ~190 (140–160) |
| 2 minutos | ~380 (280–320) |
| 10 minutos | ~1,900 (1,400–1,600) |
Qué plataformas se transcriben (global)#
| Plataforma | Transcripciones | Cuota | Servidas desde subtítulos existentes |
|---|---|---|---|
| 1,720 | 29.5% | 0% | |
| YouTube | 1,469 | 25.2% | 71.5% |
| 953 | 16.3% | 0.1% | |
| TikTok | 804 | 13.8% | 0% |
| Archivos subidos | 424 | 7.3% | — |
| 275 | 4.7% | 0% | |
| X (Twitter) | 159 | 2.7% | 0% |
| 27 | 0.5% | 0% |
La mediana global también cuenta una historia de dos productos: el Reel mediano enviado a transcripción dura 45 segundos; el video de YouTube mediano, 57 minutos 47 segundos — una brecha de 77×. En las plataformas sociales se transcriben clips; en YouTube, podcasts y clases completas.
¿Qué idiomas se transcriben?#
Cuota de las 4,786 transcripciones con idioma registrado:
| Idioma | Cuota |
|---|---|
| Inglés | 31.7% |
| Coreano | 16.9% |
| Español | 16.1% |
| Hindi | 9.2% |
| Ruso | 7.9% |
| Chino | 6.9% |
| Portugués | 2.2% |
| Francés | 2.0% |
Más de dos tercios del audio que la gente transcribe no está en inglés — la demanda de transcripción es global de una forma que las conversaciones sobre herramientas, casi siempre en inglés, rara vez reconocen.
¿Cuántos videos no tienen voz?#
Medido desde la analítica de producto en el mismo periodo (6,219 intentos completados, tráfico automatizado filtrado): el 3.1% de los videos enviados a transcripción no contiene voz detectable. Pinterest lidera con 6.9% — casi 4× la tasa de Instagram (1.8%) — por los Idea Pins de música con texto en pantalla. Si una transcripción de Pinterest vuelve vacía, lo más probable es que el pin genuinamente no tenga voz.
Qué significa esto si creas contenido en español#
- Carga el gancho más de lo que se siente natural. A más de tres palabras por segundo, dos segundos son seis palabras. La guía de SEO en TikTok desglosa cómo los mejores creadores las gastan.
- No asumas que existen subtítulos fuera de YouTube. En el resto de las plataformas, prácticamente todos los videos necesitaron reconocimiento de voz. Si quieres que tu voz sea buscable, citable o accesible, el texto lo produces tú — desde el enlace del video o desde el archivo de audio.
- El formato largo es un caso de transcripción, no de subtitulado. La mediana de 21 minutos del YouTube en español dice que la audiencia hispanohablante usa las transcripciones para minar contenido largo — apuntes, citas, borradores — no para subtitularlo.
Cita estos datos#
Puedes citar libremente con atribución como "Voqusa Transcript Dataset, edición agosto 2026", con enlace a esta página. Las cifras están congeladas al 12 de agosto de 2026; publicaremos ediciones actualizadas conforme crezca el dataset.
Preguntas frecuentes#
¿Cuántas palabras por minuto es normal hablar?
En conversación, la referencia habitual es de 120–150 palabras por minuto, y la Fundéu sitúa la velocidad óptima de locución en 170 ppm. En nuestro dataset, el video corto en español corre bastante más rápido: 192 ppm en Reels de Instagram y 189 ppm en TikTok — el formato corto se habla a ritmo de locutor acelerado, no de conversación.
¿Cuántas palabras son 1 minuto hablando?
Depende del contexto: a ritmo de discurso o presentación (140–160 ppm), un minuto son unas 140–160 palabras. Al ritmo real que medimos en Reels y TikToks en español (~190 ppm), un minuto de video corto son unas 190 palabras — y un gancho de dos segundos, unas seis.
¿Qué idioma se transcribe más en YouTube?
En nuestro dataset, el español: 45.1% de las solicitudes de YouTube con idioma registrado, casi el doble que el inglés (25.8%). El usuario hispanohablante concentra el 80.7% de sus transcripciones en YouTube, con videos de 21 minutos de mediana — podcasts, entrevistas y clases más que clips.
Notas metodológicas#
- Los conteos son transcripciones almacenadas (5,832) de videos y subidas distintos (5,659); las solicitudes repetidas de un video ya transcrito se sirven desde caché y no agregan filas.
- Las cuotas de idioma excluyen 1,046 filas sin idioma registrado. Las cifras de velocidad usan transcripciones por reconocimiento de voz de 10 segundos a 2 horas, dividiendo palabras entre la duración realmente transcrita; se omiten los cortes con menos de ~30 muestras, salvo los Reels en español (n=39) y el YouTube en español (n=75), que se publican con su tamaño de muestra a la vista.
- Las duraciones cubren las filas con duración de origen registrada (62% del dataset; en el corte de YouTube en español, las filas por reconocimiento de voz, n=75). Las tasas de "sin voz" provienen de eventos de analítica de producto en los ~100 días previos al 12 de agosto (denominador ligeramente distinto al de la tabla de transcripciones), con tráfico automatizado conocido excluido.
- La ráfaga automatizada de ~230 solicitudes de YouTube del 24–25 de julio (mayoritariamente en chino) está incluida en los totales y cuantificada en "Sobre el dataset"; excluirla aumenta la cuota del español en YouTube a ~50%.
- Todas las estadísticas son agregados sobre metadatos. Ningún contenido de transcripción fue leído, citado ni muestreado para este estudio.

Building Voqusa to make video transcription free, fast, and accurate for creators in every language.

