Volver al blog

¿Cuántos caracteres chinos necesitas realmente?

Por Andreu Puy · 19 de agosto de 2026 · 10 min de lectura

Haz esta pregunta donde sea y siempre obtienes la misma respuesta: entre dos mil y tres mil. Se repite porque acierta más o menos en una cosa y falla discretamente en otra. Es una cifra cercana a lo que cuesta una cobertura casi completa de caracteres, el punto en el que casi todos los caracteres de una página ya te suenan. Y es una respuesta pésima a lo que casi todo el mundo está preguntando en realidad, que es cuántos hacen falta para que el chino empiece a ser legible.

Una sola cifra no puede responder a eso, porque la frecuencia de los caracteres es extraordinariamente desigual. Así que en lugar de repetir el tópico, lo hemos contado. Lo que sigue es una curva de cobertura construida sobre 33.000 millones de caracteres de chino real, hablado y escrito, que muestra qué parte de una página corriente representan los 100, 500, 1.000 o 3.000 caracteres más frecuentes.

La versión corta

De dónde sale esto: hacemos Hanzio, un diccionario y app de estudio de chino, así que mantenemos datos de frecuencia de todo el idioma de todos modos. Las cifras de abajo salen de ahí: de los mismos datos de frecuencia con los que están construidas las propias puntuaciones de Hanzio, y no de una estimación publicada. El método completo está en Cómo lo hemos contado, incluido lo que haría que estas cifras no te sirvieran.

¿Cuántos caracteres necesitas?

Unos 1.000 caracteres cubren aproximadamente el 90 % de los caracteres del texto chino cotidiano. 500 cubren en torno al 75 %. Para llegar al 98 % necesitas unos 2.300, y el 99 % cuesta unos 2.900. La mitad de todo lo que leerás en tu vida la sostienen solo 170 caracteres.

Caracteres que conocesProporción del textoCaracteres desconocidos por cada 100
10040 %60
25059 %41
50075 %25
1.00089 %11
1.50094 %6
2.00097 %3
2.50098 %2
3.00099 %1

Lee la última columna antes que la del medio. Es la misma información y cuesta mucho más alegrarse con ella.

Lo que esa cifra no significa

Los porcentajes de cobertura son seductores y se venden de más constantemente, también por parte de quien vende apps de chino. Hay que decir dos cosas antes de la parte interesante.

Cobertura no es comprensión

Con 1.000 caracteres conoces alrededor del 89 % de los caracteres de una página. Eso no es el 89 % del significado. Son once caracteres desconocidos por cada cien, más o menos uno por línea, y no van a estar repartidos de forma uniforme. Se concentran justo en los sitios que llevan la información: nombres propios, términos técnicos, el verbo concreto sobre el que gira la frase.

Incluso el 97 %, que exige 2.000 caracteres, son tres desconocidos por cada cien. Una página de novela tiene unos cientos de caracteres, así que hablamos de varios huecos por página. Eso es leer de forma viable con un diccionario. No es leer con comodidad. Quien te diga que una cifra de cuatro dígitos vuelve legible el chino está redondeando una curva real hasta convertirla en eslogan.

(Hay un resultado conocido en investigación sobre lectura en segunda lengua según el cual la comprensión sin ayuda requiere en torno al 98 % de cobertura. Merece la pena conocerlo, pero se refiere a cobertura de palabras, no de caracteres, así que no se traslada directamente a la tabla de arriba. Lo mencionamos como analogía, no como prueba.)

Saber caracteres no es saber palabras

Las palabras chinas se construyen casi siempre con dos o más caracteres, y la combinación a menudo no se deduce de las partes. 意 y 思 son ambos frecuentes y poco llamativos por separado; 意思 significa «significado». 电 es electricidad y 脑 es cerebro; 电脑 es un ordenador. Puedes conocer todos los caracteres de una frase y seguir sin entenderla.

Así que los caracteres son una buena unidad por la que empezar, no un sustituto del vocabulario. Simplemente rinden mucho más por unidad al principio: alcanzar esa misma cobertura del 89 % con palabras enteras exige unas 11.800 palabras. (Las dos cifras se miden en unidades distintas, el 89 % de caracteres y el 89 % de palabras, así que toma lo de «unas doce veces más» como la forma de la diferencia y no como una proporción exacta.)

La curva de cobertura

Esto es todo. El eje horizontal es cuántos caracteres conoces, empezando por los más frecuentes; el eje vertical es la proporción de los caracteres de una página corriente que esos cubren. Cobertura, no comprensión: mira más arriba.

Proporción del texto corriente que cubren los caracteres más frecuentes

La curva sube muy deprisa al principio, pasa del 75 % hacia los 500 caracteres y del 90 % hacia los 1.090, y luego se aplana: a partir de 2.000 caracteres es casi horizontal y nunca llega del todo al 100 %. Las cifras exactas están en la tabla de arriba.
La banda sombreada son los primeros 1.000 caracteres. Fuente: datos de frecuencia de Hanzio, 33.000 millones de caracteres han. hanzio.app

Importan dos rasgos. La curva es casi vertical en el extremo izquierdo y casi horizontal en el derecho. Casi todo lo útil que se puede decir sobre aprender caracteres chinos se deduce de esos dos hechos.

Los primeros 500 hacen casi todo

Divide los primeros 3.000 caracteres en bloques de 500 y pregunta qué compra cada bloque.

Puntos porcentuales de texto corriente que añade cada bloque de 500 caracteres
1-500 +74,6
501-1.000 +14,1
1.001-1.500 +5,6
1.501-2.000 +2,7
2.001-2.500 +1,4
2.501-3.000 +0,7

El primer bloque vale más que los otros cinco juntos, y por bastante. Y se concentra todavía más abajo: los treinta caracteres más frecuentes suponen por sí solos alrededor del 23 % de todo el texto corriente. Treinta. Estos:

的我是了不在你有一人这个们大来他要上中为到会和好就国么以时生

No hay nada sorprendente en esa lista. Son sobre todo gramática, pronombres y el puñado de verbos que necesita cualquier frase, y ese es justamente el asunto. Los caracteres que cargan con el peso del chino son estructurales e inevitables, y te los vas a encontrar el primer día lo planifique alguien o no.

Los últimos mil no aportan casi nada

Ahora lee la misma tabla desde abajo. Los caracteres del 2.001 al 3.000, mil caracteres que para la mayoría son un año o más de trabajo constante, aportan entre todos unos dos puntos porcentuales. Los treinta caracteres de arriba valen más de diez veces eso.

No es un argumento para pararse en 2.000. Esos últimos caracteres son los que te llevan de buscar algo cada una o dos líneas a buscar algo una vez por párrafo: la diferencia entre el 97 % y el 99 % es la diferencia entre tres caracteres desconocidos por cada cien y uno. Menos interrupciones, no ninguna: el vocabulario que escriben esos caracteres es otro trabajo, y es el que decide si de verdad entiendes la página.

Es un argumento sobre el orden, y sobre qué esperar. El tramo inicial paga tan rápido que el progreso parece espectacular. El tramo final no, y es habitual interpretar esa desaceleración como un fracaso propio en lugar de como la forma de la distribución. Es la forma de la distribución.

Depende un poco de lo que leas

La curva de arriba mezcla registros, así que describe a un lector general y no a uno concreto. Separarlos mueve las cifras, aunque menos de lo que cabría esperar, y no siempre en la dirección obvia.

El diálogo es el más fácil con diferencia: el 90 % de cobertura llega hacia los 810 caracteres frente a los 1.090 de la mezcla, y esa ventaja crece hasta unos 540 caracteres cuando llegas al 99 %. Y el habla no es solo una muestra más pequeña: usa más caracteres distintos que la mayoría del material escrito, y aun así concentra más texto en los pocos cientos más frecuentes. No es que quien habla tenga menos vocabulario; es que se apoya mucho más en la parte alta. El texto escrito también varía, pero en una banda más estrecha: del más fácil al más difícil hay unos 150 a 200 caracteres de diferencia en el 90 % de cobertura, y cuanto más formularia es la escritura, antes llega la curva.

La magnitud del efecto son unos cientos de caracteres a cada lado de las cifras de arriba. No te lleva de 1.000 a 3.000. Si lees mucha prosa, cuenta con que la curva vaya algo retrasada; si te apoyas más en el diálogo, va adelantada.

De dónde viene el «2.000-3.000»

La cifra del tópico no está inventada, y no es realmente falsa. Responde a otra pregunta.

La Tabla de caracteres chinos estándar generales recoge 3.500 caracteres en su primer nivel, descrito como el que cubre las necesidades de la vida cotidiana, y 8.105 en total. De un adulto nativo con estudios se suele estimar que ronda los 6.000. Son recuentos de inventario: cuántos caracteres contiene una norma, o cuántos ha acumulado una persona a lo largo de su vida.

La cobertura de texto corriente es otra medida, y en esa medida el 2.000-3.000 cae en la banda del 97-99 %. Es decir, la cifra describe discretamente lo que cuesta una cobertura casi completa de caracteres. Se le suelta a los principiantes como si fuera el precio de entrada, y eso es lo único que tiene de malo: nadie menciona que casi todo el valor llega en la primera quinta parte del camino.

Qué implica para lo que estudias

De aquí salen tres cosas, y ninguna es complicada.

El orden por frecuencia gana al orden del libro de texto durante los primeros mil caracteres. Mientras la curva es pronunciada, la diferencia entre una lista bien ordenada y una mal ordenada es enorme: cientos de caracteres de esfuerzo desperdiciado. A partir de 1.500 la curva es lo bastante plana como para que el orden deje de importar mucho, y lo que leas debería pasar a decidir lo que aprendes.

Esto pesa más en español que en inglés. El material graduado de chino pensado para hispanohablantes es escaso, así que no puedes apoyarte en un ecosistema enorme de lecturas ya ordenadas por nivel: el orden de estudio lo acabas eligiendo tú, y conviene que lo elija la frecuencia.

Aprende los caracteres dentro de palabras, no como lista. El argumento de eficiencia a favor de los caracteres es real, pero un carácter aprendido aislado es una forma con una glosa pegada. Aprendido dentro de 电脑 o 意思 viene con lo que de verdad necesitabas, que es una palabra que puedes usar.

Cuenta con la meseta y cambia de táctica al llegar. Machacar tarjetas es muy eficiente en la parte pronunciada y muy ineficiente en la parte plana. En algún punto entre 1.500 y 2.000 caracteres, leer mucho material ligeramente demasiado difícil empieza a rendir más que cualquier cantidad de disciplina con tarjetas, porque los caracteres que quedan son lo bastante raros como para que solo se aprendan encontrándolos en contexto.

Cómo lo hemos contado

Las cifras de esta página salen de los datos de frecuencia propios de Hanzio. Son datos propietarios, construidos internamente a partir de grandes corpus de chino en los registros hablado y escrito, ponderados para que ningún registro domine.

Suman 33.000 millones de caracteres han y 19.361 caracteres distintos. Cada corpus se contó por separado y se normalizó sobre su propio total antes de aplicar los pesos, de modo que un corpus grande no pueda ahogar a uno pequeño. Los caracteres se contaron tal como aparecen en el texto corriente, también dentro de palabras de varios caracteres, que es por lo que los totales son recuentos de caracteres y no de palabras. Todos los porcentajes de esta página son proporciones de caracteres encontrados, no del diccionario.

Tres límites que conviene decir con claridad. Esto es solo chino simplificado: no hemos medido el tradicional, así que ninguna de estas cifras debería citarse para él. La mezcla es un modelo, no una medida de tu lectura: describe a alguien que reparte su atención entre chino hablado y escrito en esas proporciones, y nadie hace exactamente eso. Los corpus descartan lo más raro, lo que empuja las cifras de cobertura muy ligeramente hacia arriba; el efecto es pequeño, pero va en la dirección optimista y no en la pesimista, y conviene saber hacia dónde inclina.

Hanzio muestra un valor de frecuencia en cada entrada del diccionario: como palabra, como pieza dentro de palabras más largas y como componente de otros caracteres. Son puntuaciones en una escala de 0 a 100, no el puesto que usamos aquí, y mantienen separados el uso como palabra y como pieza donde esta página suma los dos. Así que guardan una correlación amplia con el orden que usamos aquí, pero no son el mismo orden: 不 es el quinto en la curva de esta página, el primero en la medida de pieza y el último de ese grupo en la de palabra suelta. Los mismos datos, pregunta distinta.

Preguntas frecuentes

¿Bastan 2.000 caracteres para leer un periódico chino?

Con 2.000 caracteres conoces alrededor del 97 % de los caracteres de un texto corriente, lo que suena a poco margen pero equivale a un carácter desconocido cada 34: varios por párrafo. Puedes seguir una noticia con el diccionario abierto y deducir bastante por contexto. Pero leer con comodidad, sin parar, exige más que caracteres: exige el vocabulario que esos caracteres escriben, así que 3.000 es la mitad del trabajo que corresponde a los caracteres, no el trabajo entero.

¿Cuántos caracteres necesito para el 90 % del chino cotidiano?

Unos 1.090. La curva es muy pronunciada al principio y muy plana al final: 500 caracteres ya cubren el 75 % del texto corriente y 1.000 cubren el 89 %, pero cada bloque de 500 aporta menos que el anterior. Pasar del 90 % al 95 % cuesta otros 500 caracteres aproximadamente.

¿Cuántas palabras chinas necesito saber?

Muchas más que caracteres. Alcanzar la misma cobertura del 89 % que te dan 1.000 caracteres exige unas 11.800 palabras. Ese es el argumento práctico para empezar por los caracteres: son la unidad más pequeña y más reutilizable. No es un argumento para aprenderlos en lugar de palabras, porque conocer dos caracteres no te dice qué significa su combinación.

¿Cuántos caracteres conoce un hablante nativo?

Se suele estimar que un adulto nativo con estudios ronda los 6.000, y la escolarización china apunta a unos 3.500. La tabla estándar nacional completa recoge 8.105. Son recuentos de inventario, es decir, cuántos caracteres contiene una norma o ha acumulado una persona, que es una pregunta distinta de cuánto texto corriente cubre una cifra dada.

¿Sirven estas cifras para los caracteres tradicionales?

No. Todo esto se ha contado sobre chino simplificado, así que las cifras describen material continental. La forma de la curva (muy pronunciada al principio, muy plana al final) también se cumple con los tradicionales, pero no hemos medido esos números y no vamos a citar ninguno.

¿Qué caracteres debería aprender primero?

Los más frecuentes, y el orden importa mucho más al principio que después. Los treinta caracteres más frecuentes suponen por sí solos alrededor del 23 % de todo lo que lees. Cualquier lista ordenada por frecuencia sirve; Hanzio muestra un valor de frecuencia en cada entrada del diccionario para que veas dónde encaja un carácter antes de decidir estudiarlo.

¿Incluyen estas cifras nombres propios y caracteres raros?

En su mayor parte. Los recuentos salen de nuestras propias listas de frecuencia, construidas sobre texto en bruto, así que ahí están los nombres de persona, los topónimos y las marcas, y es deliberado: forman parte de lo que te encuentras de verdad en una página. Pero esas listas descartan sus entradas más raras, así que la cola es algo más larga de lo que muestran estas cifras: el último 1 % de cobertura se reparte entre miles de caracteres que verás una vez, y hay algunos más de los que hemos contado.

¿Necesito saber escribirlos a mano?

Para leer, no. Reconocer un carácter y producirlo de memoria son destrezas distintas, y todas las cifras de esta página se refieren solo al reconocimiento. Escribir a mano sí ayuda a muchos estudiantes a distinguir caracteres parecidos, y es como la mayoría acaba notando que 未 y 末 no tienen la misma forma, pero es otro objetivo.

Apréndelos en el orden que compensa

La curva solo sirve si sabes dónde cae cada carácter. Hanzio pone un valor de frecuencia en cada entrada del diccionario, así que cuando buscas algo puedes ver de un vistazo si es lo bastante frecuente para que te compense ahora o si conviene dejarlo. El diccionario es gratis.