# Nuevo conjunto de datos de mitad de año: ¡Más datos, más idiomas!

**URL:** <https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430>\
**Category:** Español (es)\
**Created:** [June 12, 2019, 8:21pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430 "2019-06-12T20:21:39Z")\
**Posts on this page:** 11\
**Page:** 1

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [June 12, 2019, 8:21pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/1 "2019-06-12T20:21:39Z")

</div>

El equipo de Common Voice se complace en anunciar la publicación de un nuevo conjunto de datos que incluye un total de 2366 horas de datos de voz, y por primera vez ¡31 horas en español!

El proyecto ha visto un aumento en las colaboraciones y publicación de muchos nuevos idiomas en los últimos seis meses. Queremos asegurarnos de que la comunidad puede usar los datos de manera rápida y eficiente. Para hacer esto, hemos avanzado con una versión de mitad de año que incluye todos los clips grabados en 28 idiomas, disponibles en la página [Archivo de datos](https://voice.mozilla.org/datasets) en [Common Voice](https://voice.mozilla.org).

Los nuevos idiomas que se publican hoy son: Casco, chino (simplificado), Dhivehi, estonio, kinyarwanda, mongol, ruso, sakha, español y sueco; algunos de estos son los primeros conjuntos de datos disponibles públicamente para estos idiomas.

Somos conscientes que los proyectos de investigación necesitarán una identificación de versión y lo vamos a hacer por idioma a través de nuestra convención de nombres: Idioma, número total de horas y fecha de publicación.

`<LOCALE>_<TOTAL_INCLUDING_UNVALIDATED_HOURS>h_<ISO_DATE>`

p.ej. `en_1085h_2019-06-12`

Esperamos vuestros comentarios y vuestras aportaciones mientras colaboramos para avanzar en el desarrollo de tecnologías de voz abierta.

[Según lo prometido](https://discourse.mozilla.org/t/dataset-releases-whats-more-valuable-for-you/38080/), pronto compartiremos información a la comunidad con una propuesta más detallada sobre nuestra estrategia para los conjuntos de datos a largo plazo, que probablemente incluya un ciclo de publicación de datos más predecible.

Finalmente, todo el equipo de Common Voice desea extender un sincero agradecimiento a esta gran comunidad y a todos los que han contribuido o han validado las voces.

¡Gracias!

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [June 12, 2019, 9:42pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/2 "2019-06-12T21:42:05Z")

</div>

Excelente!!! Muchas gracias, no puedo esperar para hacer mis pruebas 🙂

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [June 13, 2019, 12:38pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/3 "2019-06-13T12:38:16Z")

</div>

Analizando los datos podemos ver que la mayoría de frases tienen unas 4 grabaciones, algo que no es muy útil para entrenar DeepSpeech.

Recuerdo este tema

> [@open\_book Necesitamos más frases en español](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/):
>
> Hola, Actualmente sólo tenemos 6687 frases en la base de datos de Common Voice en español. Esto quiere decir que si de media cada frase son 4s de lectura, nos permiten tener 7,43 horas de voces sin repetir frases. Ahora mismo hay 25 horas validadas en español, lo que quiere decir que hace mucho que estamos grabando las mismas frases una y otra vez. ¿Por qué es esto importante? Cuando entrenamos los modelos de Deep Speech realmente no es muy útil tener más de una vez una frase grabada ya que…

Espero que a finales de mes podamos tener el extractor de wikipedia lo suficientemente maduro para incorporar más idiomas y hacer una extracción grande para el español.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [July 2, 2019, 11:45pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/4 "2019-07-02T23:45:02Z")

</div>

Estoy de acuerdo que no funciona para entrenar, para hacer pruebas está más que perfecto. Anteriormente no podía tener buenos sets de prueba porque de una u otra forma eran del mismo dominio lo cual me generaba resultados erróneos. Ahora con este set puedo hacer mis pruebas en él y tener resultados realistas.

Fyi  
Comparto los resultados que tengo de momento:

| Horas | LR | Dropout | Epochs | Mode | Batch Size | Test set | WER |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 500 | 0.00012 | 0.24 | 1 | Transfer Learning | 12 | Train-es-common voice | 27% |
| 500 | 0.000001 | 0.11 | 2 | Transfer Learning | 10 | Train-es-common voice | 46% |
| 500 | 0.0001 | 0.22 | 6 | From scratch | 24 | Train-es-common voice | 50% |

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [July 2, 2019, 11:53pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/5 "2019-07-02T23:53:43Z")

</div>

Genial @carlfm01

¿Podrías explicar un poco qué significan los datos que pones en la tabla para los que no somos expertos?

¡Gracias!

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [July 3, 2019, 12:23am UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/6 "2019-07-03T00:23:59Z")

</div>

Con gusto

Horas = Horas totales con las que estoy entrenando.  
WER= Porcentaje de error por palabras  
Mode= Cuando usé transfer learning quiero decir que usé el modelo entrenado del inglés tomando sus capas y ajustandolas con el nuevo set de datos en español, y from scratch bueno, todo inició de 0 con valores aleatorios.

El resto son hyperparametros, para ver con los que se entrenó el modelo en inglés puede verlos aquí:

> **[Releases · mozilla/DeepSpeech](https://github.com/mozilla/DeepSpeech/releases/)**
>
> DeepSpeech is an open source embedded (offline, on-device) speech-to-text engine which can run in real time on devices ranging from a Raspberry Pi 4 to high power GPU servers. - mozilla/DeepSpeech

LR = Learning rate, es un hyperparametro que se usa para indicarle al modelo cuanto ajuste tiene que hacer “cuando aprende” por cada batch más info aquí:[Learning rate - Wikipedia](https://en.wikipedia.org/wiki/Learning_rate)

Batch\_size: La cantidad de ejemplos que se usan por cada iteración

Epoch: 1 epoch es decir que se completa una vuelta completa de entrenamiento en todo el set de datos.

Dropout: Porcentaje que se usa para eliminar unidades de una capa de manera aleatoria.

Para el que quiere leer toda la terminología completa:

> **[Glosario sobre aprendizaje automático
    |  Machine Learning...](https://developers.google.com/machine-learning/glossary/?hl=es-419)**

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [July 3, 2019, 12:27am UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/7 "2019-07-03T00:27:18Z")

</div>

¿Cómo se complejo sería entrenar un modelo con el dataset que tenemos ahora mismo en español?

Sería bueno ver qué resultados da ahora, aunque sean malos (o muy malos por ahora) a la hora de reconocer conversaciones cotidianas.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [July 3, 2019, 12:57am UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/8 "2019-07-03T00:57:58Z")

</div>

> [@nukeador](#):
>
> ¿Cómo se complejo sería entrenar un modelo con el dataset que tenemos ahora mismo en español?

Personalmente no es que sea complicado, es que estoy limitado en hardware, tengo experimentos que quiero hacer en cola como por ejemplo entrenar sólo la capa lstm (la que aprender las relaciones) con datos de un TTS y ver que tanta información semántica se puede retener. Eventualmente prodría sacar el tiempo para ver dónde estamos con los datos de common voice, librivox y voxforge. Hacer 1 epoch me tomó 2 días usando transfer learning en una K80.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [July 3, 2019, 5:56pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/9 "2019-07-03T17:56:47Z")

</div>

> [@nukeador](#):
>
> Sería bueno ver qué resultados da ahora, aunque sean malos (o muy malos por ahora) a la hora de reconocer conversaciones cotidianas.

Creo que compartiendo mi modelo para que pruebes no hay problema, incluye datos como tatoeba y por eso no lo puedo compartir públicamente.

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [July 3, 2019, 6:07pm UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/10 "2019-07-03T18:07:43Z")

</div>

> [@carlfm01](#):
>
> Creo que compartiendo mi modelo para que pruebes no hay problema, incluye datos como tatoeba y por eso no lo puedo compartir públicamente.

Los modelos no tienen que tener la misma licencia que los datos que se usaron para entrenarlos. En el caso de Common Voice sí, porque además liberamos los datos, pero los modelos son como el binario.

La idea que estábamos hablando la semana pasada era montar una página web super sencilla que usará algún modelo entrenado con lo que hay ahora y que la gente pudiera ver el estado.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [July 6, 2019, 11:18am UTC](https://discourse.mozilla.org/t/nuevo-conjunto-de-datos-de-mitad-de-ano-mas-datos-mas-idiomas/41430/11 "2019-07-06T11:18:05Z")

</div>

Voy a enviar el modelo en español para pruebas.
