MultiParaDetox-2025-es

MultiParaDetox es un dataset para la detoxificación de texto, una tarea de transferencia de estilo que convierte expresiones tóxicas en un registro neutral. Extiende el enfoque de ParaDetox a múltiples idiomas, permitiendo la creación automática de corpus paralelos para detoxificación.
Idioma(s)
Español
Francés
Hindi
Italiano
Ucraniano
Año
2024
Dominio
Diversos
Anotaciones
parallel corpus
Acceso a datos
Publico

Publicación
Daryna Dementieva, Nikolay Babakov, Amit Ronen, Abinew Ali Ayele, Naquee Rizwan, Florian Schneider, Xintong Wang, Seid Muhie Yimam, Daniil Moskovskiy, Elisei Stakovskii, Eran Kaufman, Ashraf Elnagar, Animesh Mukherjee, and Alexander Panchenko. 2025. Multilingual and Explainable Text Detoxification with Parallel Corpora. In Proceedings of the 31st International Conference on Computational Linguistics, pages 7998–8025, Abu Dhabi, UAE. Association for Computational Linguistics.
Número de unidades
1000
Tipo de unidades
Tuits
Tamaño set entrenamiento
400
Tamaño set evaluación
600

Si has publicado un resultado mejor que los de la lista, envía un mensaje a odesia-comunicacion@lsi.uned.es indicando el resultado y el DOI del artículo, junto con una copia del mismo si no está publicado en abierto.