# 📖 Necesitamos más frases en español

**URL:** <https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405>\
**Category:** Español (es)\
**Created:** [May 15, 2019, 7:51pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405 "2019-05-15T19:51:44Z")\
**Posts on this page:** 20\
**Page:** 1

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 7:51pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/1 "2019-05-15T19:51:45Z")

</div>

Hola,

Actualmente sólo tenemos 6687 frases en la base de datos de Common Voice en español.

Esto quiere decir que si de media cada frase son 4s de lectura, nos permiten tener 7,43 horas de voces sin repetir frases.

Ahora mismo hay 25 horas validadas en español, lo que quiere decir que hace mucho que estamos grabando las mismas frases una y otra vez.

**¿Por qué es esto importante?**

Cuando entrenamos los modelos de Deep Speech realmente no es muy útil tener más de una vez una frase grabada ya que reduce significativamente la calidad del modelo, por que tenemos que procurar que cada frase es grabada muy pocas veces, idealmente solo una.

**¿Qué hacer?**

Necesitamos añadir más frases de dominio público [en la herramienta](https://common-voice.github.io/sentence-collector/#/) y validarlas.

Hasta que podamos tener [el extractor de wikipedia](https://discourse.mozilla.org/t/extending-our-sentence-collection-capabilities/38783) para el español es la única forma que tenemos de añadir frases.

Para poder tener un buffer de 25 horas, necesitaríamos unas 22500 frases (a 4s por frase), que entiendo que es muchísimo, por lo que la alternativa es esperar a que el extractor de wikipedia esté listo y no hacer grandes eventos hasta entonces.

Un saludo.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [May 15, 2019, 8:05pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/2 "2019-05-15T20:05:05Z")

</div>

Los textos de Wikipedia funcionan? Creo que por ahí leí que no cumplian los requisitos del proyecto.

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 8:06pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/3 "2019-05-15T20:06:08Z")

</div>

No, no podemos usar textos de wikipedia directamente, pero si ves el tema que enlacé, hay una forma legal de poderlo hacer (de forma muy limitada) bajo “fair use”, pero queremos asegurarnos que se hace bajo el control de este script que estamos desarrolando y es ejecutado por el equipo de Common Voice, para evitar problemas legales.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [May 15, 2019, 8:13pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/4 "2019-05-15T20:13:18Z")

</div>

Excelente, yo no envié más frases de librivox debido a que la mayoría de los textos fueron creados por OCR y por momentos hay palabras separadas, o dos palabras juntas. De las 1000h de español que en teoría son apenas conseguí sacar 100h aprox.  
Ya estoy haciendo últimas validaciones para liberar esas 100h, yo sé que es de lejos lo ideal, pero será algo para iniciar, en español hay muy muy pocos datos que se puedan usar.

---

<div class="post-metadata">

**Author:** ![karlalhdz](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/karlalhdz/32/37306_2.png) [@karlalhdz](https://discourse.mozilla.org/u/karlalhdz)\
**Post date:** [May 15, 2019, 8:19pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/5 "2019-05-15T20:19:04Z")

</div>

Fijate @nukeador que en El Salvador tenemos un proyecto de autores salvadoreños que se encuentra recopilando obras que se encuentren en el dominio público. El proyecto es [autores.sv](http://www.autores.sv) y pues por ejemplo la obra de jicaras tristes de [Alfredo Espino](http://www.autores.sv/obra/15636) ya que existe una versión [.txt](https://archive.org/stream/AlfredoEspinoJicarasTristes/Alfredo_Espino_Jicaras_Tristes_djvu.txt) del mismo y pues de copiar pegar y fragmentar devidamente.

¿se podria agregar por frases u oraciones al colector?

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 8:20pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/6 "2019-05-15T20:20:32Z")

</div>

> [@karlalhdz](#):
>
> ¿se podria agregarse por frases al colector?

Claro, siempre que sean Public Domain. Lo idea sería hacerlo para que las frases tuvieran sentido y no se vieran como frases cortadas, por lo que habría que crear un algoritmo de filtrado que las dejara adecuadas para leer en trozos cortos de 4 a 8s aprox.

---

<div class="post-metadata">

**Author:** ![karlalhdz](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/karlalhdz/32/37306_2.png) [@karlalhdz](https://discourse.mozilla.org/u/karlalhdz)\
**Post date:** [May 15, 2019, 8:23pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/7 "2019-05-15T20:23:14Z")

</div>

A chivo, si es que me acorde de la plataforma y asi podria ponerme a fragmentar y si entiendo lo de los trozos adecuados. 🙂 Pero tenia mis dudas. jejejeje ¡gracias! por el momento seguire a mano… pero le planteare a mi compañero su se anima a crear un algoritmo que extraiga de la web o de plano lo envio a la entrada del proyecto de lo con la wikipedia.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [May 15, 2019, 8:24pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/8 "2019-05-15T20:24:05Z")

</div>

El problema que le veo es el mismo que mencioné antes, si el texto fue creado por OCR es muy difícil filtrarlo.

Ejemplo

> i Anchas calles sol\* is, llenas dettng^, iduoiti  
> das débilmente .aróles de ga: que, ontr ?  
> niebla espesa y el agua, parecen po -f candil s  
> i de pueblo. ü

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 8:25pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/9 "2019-05-15T20:25:11Z")

</div>

> [@karlalhdz](#):
>
> de plano lo envio a la entrada del proyecto de lo con la wikipedia.

De wikipedia yo evitaría cualquier esfuerzo, ya que va a estar integrado en el script oficial y es el único que se va a usar para wikipedia por las restricciones legales. Estoy hablando con el equipo para ver cuando podemos tener algo que compartir para que las comunidades puedan adaptar este script para otros idiomas, espero tener alguna respuesta en las próximas semanas.

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 8:26pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/10 "2019-05-15T20:26:51Z")

</div>

Se podría usar un diccionario y comprobar que las palabras existen. De todas formas el sentence collector hace comprobaciones básicas para que no “se cuelen” símbolos o caracteres especiales.

El código está aquí y permite hacer validaciones diferentes por idioma:

> **[GitHub - common-voice/sentence-collector: Tool to collect and review sentences for Common...](https://github.com/Common-Voice/sentence-collector/)**
>
> Tool to collect and review sentences for Common Voice

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [May 15, 2019, 8:51pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/11 "2019-05-15T20:51:28Z")

</div>

Sin usar un diccionario estas son las que salen:

[https://pastebin.com/JRKk94jH](https://pastebin.com/JRKk94jH)

Usando diccionario no pasa ninguna, tendré que hacerlo un poco más grande.

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 15, 2019, 9:00pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/12 "2019-05-15T21:00:32Z")

</div>

Sí, es importante que no haya palabras que no existen o cortadas. Además que lo ideal es que las palabras sean de uso moderno, por eso muchos libros de dominio público no son buenos, porque son difíciles de leer por la gente.

---

<div class="post-metadata">

**Author:** ![carlfm01](https://avatars.discourse-cdn.com/v4/letter/c/ec9cab/32.png) [@carlfm01](https://discourse.mozilla.org/u/carlfm01)\
**Post date:** [May 15, 2019, 11:27pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/13 "2019-05-15T23:27:48Z")

</div>

Pensando un poco más como solucionar este problema de las frases y la importancia de frases actuales se me ocurrió crear un generador de frases.

¿Cómo sería?

Bueno no es complicado obtener listas de nombres de profesiones, nombres de personas, nombres de los días, nombres del mes, nombres de los países, nombres de ciudades, números escritos, nombres de empresas relacionadas, nombres de animales salvajes, nombres de animales domésticos, nombres de planetas, nombres de estrellas, nombres de partes del cuerpo, nombres de enfermedades, nombres de los elementos, nombres marcas de autos, nombres de escritores, nombres de canciones, nombres de programas de software, y así con muchos otros.

Bueno la idea con todos esos grupos es algo así como lo que hace las herramientas de NLP de Google como dialowflow o LUIS de MS, pero sería lo contrario, no vamos a detectar las sentencias relacionadas, vamos a crearlas mezclando los grupos.

Para hacer un ejemplo digamos que:

[nombreGrupo] = sería el nombre del grupo de palabras relacionadas que quiero usar

(10,rand) = cantidad de sentencias, tipo para generalas ya sea secuencial siguiendo el orden de cada lista o random

Bueno con eso ya definido podríamos iniciar a crearlas ej:

> en el año [añosEscritos] en [ciudades] mi [familiares] se compró un [animalesdomesticos] (10,rand)

Y las sentencias generadas serían algo así:

- en el año mil quinientos dos en Madrid mi papá se compró un perro

- en el año dos mil cinco en Heredia mi sobrina se compró un gato

Y así hasta completar la cantidad de oraciones indicadas, sería cuestión de que los usuarios se pongan creativos.

creo que para generarlas sería muy fácil, copias y pegas unas cuentas cambiando palabras y ya tiene una buena cantidad.

Así:

- era el año [añosEscritos] en [ciudades] y estaba con mi [familiares] (100,rand)
- el [nombredías] de [meses] viajo con mi [familiares] (100,rand)
- en [meses] llega mi [familiares] de [ciudades] (100,rand)
- en [meses] viajo donde mi [familiares] en [ciudades] (100,rand)
- en [paises] no hay vuelos para [cuidades] de [aerolineas] (100,rand)
- en [paises] sí hay vuelos directos a [cuidades] de la compañia [aerolineas] para el [nombredías] (100,rand)

Me gustaría ver opiniones sobre lo que propongo.

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 16, 2019, 11:11am UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/14 "2019-05-16T11:11:24Z")

</div>

> [@carlfm01](#):
>
> Pensando un poco más como solucionar este problema de las frases y la importancia de frases actuales se me ocurrió crear un generador de frases.

Aquí creo que hablaban de algo similar en inglés

> [@How unique should a sentence be?](https://discourse.mozilla.org/t/how-unique-should-a-sentence-be/40222/):
>
> There are lots of sentences like the following in the Wikipedia dump: All songs written by Trey Anastasio, except as noted. The artist name in each sentence is unique, but all surrounding words are either almost or exactly identical each time. While the sentences are technically unique, is the similar/identical wording overly biasing the model and they should therefore be removed? cc @kdavis

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 16, 2019, 2:22pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/15 "2019-05-16T14:22:45Z")

</div>

Hoy he estado hablando con el equipo y vamos a dar un vistazo a estos modelos ya entrenados para generar qué palabras pueden sustituirse

> **[Word vectors for 157 languages · fastText](https://fasttext.cc/docs/en/crawl-vectors.html)**
>
> We distribute pre-trained word vectors for 157 languages, trained on \[\*Common Crawl\*\](http://commoncrawl.org/) and \[\*Wikipedia\*\](https://www.wikipedia.org) using fastText.

---

<div class="post-metadata">

**Author:** ![Fernando](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/fernando/32/63878_2.png) [@Fernando](https://discourse.mozilla.org/u/Fernando)\
**Post date:** [May 17, 2019, 2:00pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/16 "2019-05-17T14:00:00Z")

</div>

en españa creo que los derechos de autor estan sobre los 70 años despues de la muerte del autor aqui dan un listado de autores y obras de domino publico

[http://www.bne.es/es/Servicios/InformacionBibliografica/AutoresDominioPublico/](http://www.bne.es/es/Servicios/InformacionBibliografica/AutoresDominioPublico/)

---

<div class="post-metadata">

**Author:** ![Fernando](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/fernando/32/63878_2.png) [@Fernando](https://discourse.mozilla.org/u/Fernando)\
**Post date:** [May 17, 2019, 2:16pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/17 "2019-05-17T14:16:57Z")

</div>

Por ejemplo puede haber obras de Benito Perez Galdos que aunque es antiguo es de principios del siglo pasado y el lenguaje puede no ser tan diferente al actual

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 17, 2019, 2:35pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/18 "2019-05-17T14:35:04Z")

</div>

Exacto, aunque mucho ojo porque hay trampa, las editoriales sacan nuevas versiones cuyo copyright empieza a contar desde su publicación.

Puedes encontrar obras de la antigua Grecia cuya traducción y/o edición es de 1980 por ejemplo y están aún sujetas a copyright :S

---

<div class="post-metadata">

**Author:** ![Fernando](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/fernando/32/63878_2.png) [@Fernando](https://discourse.mozilla.org/u/Fernando)\
**Post date:** [May 17, 2019, 2:45pm UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/19 "2019-05-17T14:45:16Z")

</div>

Eso que dices es correcto pero el contenido de la obra salvo que lo cambiasen es el que es las frases no deberian cambiar cambiara el formato del libro el prologo etc pero esta bien que lo indiques gracias

---

<div class="post-metadata">

**Author:** ![nukeador](https://sea1.discourse-cdn.com/flex001/user_avatar/discourse.mozilla.org/nukeador/32/20533_2.png) [@nukeador](https://discourse.mozilla.org/u/nukeador)\
**Post date:** [May 20, 2019, 10:33am UTC](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405/20 "2019-05-20T10:33:43Z")

</div>

Aunque las frases no cambien, es lo absurdo del sistema de copyright, que toda la obra vuelve a tener vigente porque es la versión de tal editorial.

[Next page](https://discourse.mozilla.org/t/necesitamos-mas-frases-en-espanol/40405.md?page=2)
