Qué hace Cedilla
Cedilla toma el texto que pegas y te devuelve un archivo MP3 en el que alguien lo lee. Ahora mismo hay 36 voces en español repartidas en 10 regiones de España y América, voces nativas para 64 idiomas más, y la posibilidad de crear tu propia voz con una grabación de tres a ocho segundos.
Lo que distingue esta página de las demás en español son las regiones y la medición. En otros sitios eliges entre «España» y «latino», y con suerte entre tres países; aquí hay diez regiones que eligieron las propias personas que grabaron, y cada voz viene con un dato comprobado: si pronuncia la zeta como en Madrid o como en Bogotá.
Una petición puede tener hasta 500 palabras, y entre dos peticiones pasan 5 segundos. No hay versión de pago, no hay nada a lo que subir de nivel, y el archivo no lleva marca de agua.
De dónde salen las voces
De Common Voice, el corpus abierto de Mozilla. Personas voluntarias leen frases y declaran ellas mismas su género y la región de su español, eligiendo entre diez etiquetas. Todo el material está bajo CC0 1.0, la licencia que más se acerca a una cesión al dominio público: no hay que pedir permiso ni citar a nadie.
Del corpus solo se tomaron personas que declararon LAS DOS cosas, región y género, y que eligieron una sola región. No adivinamos nada: si alguien no lo indicó, no está aquí aunque su grabación sea buena. De cada persona elegida se tomó la grabación más limpia, medida como distancia entre voz y ruido.
No son grabaciones de estudio. La gente grabó en casa, con el micrófono que tenía. Descartamos todo lo que estaba por debajo de un umbral de ruido medido, pero un estudio es otra cosa, y precisamente por eso este material es libre.
Español estándar con acento regional, no jerga
Es la frase más importante de esta página y está también en cada página de región. Las personas de Common Voice leyeron frases en español estándar. Lo que oyes es el estándar con la pronunciación de cada región: la zeta o su ausencia, la ese aspirada o entera, la ye rioplatense. No hay jerga, y el voseo solo aparece si tu texto lo lleva escrito.
Las etiquetas son anchas. «México» es todo México; «Caribe» son siete países y dos costas; «Andino-Pacífico» va de Bogotá a La Paz. Common Voice no registra nada más fino en cantidad utilizable, así que no afirmamos nada por debajo de ese nivel.
Por qué hay un cupo por región
Porque una selección honesta importa más que una grande. Hay 2 voces en la región con menos, y ese número es una consecuencia de los datos, no una decisión de diseño.
En Common Voice, Canarias tiene doce mujeres que declararon a la vez región y género, en todo el corpus. México tiene más de seiscientas personas. Sin cupo, la mayoría de las voces serían mexicanas y la página diría «diez regiones» en el título para entregar una. Canarias es el cuello de botella de todo el proyecto, y decide cuántas voces hay en total.
La medición del seseo
Una máquina que clona voces oye mucho español de todas partes, y a veces se le escapa: pone la zeta de Madrid en una voz de Lima o se la quita a una de Valladolid. Cada voz lee dos frases, una llena de zetas y ces y otra con las mismas vocales y solo eses, y un análisis acústico compara las consonantes. Si la voz contradice la región que declaró su dueño, no entra en el selector.
La medición tiene un margen de ruido, y lo publicamos junto al resultado en /seseo. Mide un solo rasgo: no dice nada de la ese aspirada, del rehilamiento ni del voseo. Es un suelo, no un certificado.
Por qué es gratis
Porque la parte cara ya está pagada. La síntesis corre en un único equipo que se compró para otro trabajo y está libre la mayor parte del tiempo. Esta página aprovecha los huecos. No hay inversores, ni anuncios, ni cesión de datos, ni plan de convertir esto en una suscripción.
Los límites (500 palabras por lectura, 60 lecturas al día por dirección IP, 5 segundos de pausa) no existen porque detrás espere una versión de pago, sino porque una sola tarjeta gráfica genera el audio para todo el mundo. Son por IP, no globales: quien usa mucho se frena solo a sí mismo.
Lo que no sabe hacer
Los números son la fuente de error más frecuente. Un año, una cifra con decimales o una hora pueden salir raros, y las abreviaturas («Sr.», «EE. UU.») a veces se leen letra a letra. Si un número tiene que estar perfecto, escríbelo con letras.
No hay euskera, quechua, guaraní ni árabe, y los cuatro deberían estar. El motivo es falta de material verificado, no una decisión: abriremos esas páginas cuando exista una voz nativa comprobada.
Tu propia voz a partir de una grabación corta se parece a la original pero no es una copia perfecta, y conserva su acento en otros idiomas. La página no tiene cola con aviso: si hay mucha gente, tarda más, y si hay demasiada, recibes una negativa con el tiempo de espera en lugar de una espera larga. Es a propósito.