MultiParaDetox es un dataset para la detoxificación de texto, una tarea de transferencia de estilo que convierte expresiones tóxicas en un registro neutral. Extiende el enfoque de ParaDetox a múltiples idiomas, permitiendo la creación automática de corpus paralelos para detoxificación.
Idioma(s)
Español
Francés
Hindi
Italiano
Ucraniano
Enlace descripción Dataset
Año
2024
Dominio
Diversos
Anotaciones
parallel corpus
Enlace guía anotaciones
Acceso a datos
Publico
Enlace acceso a datos
Publicación
Daryna Dementieva, Nikolay Babakov, Amit Ronen, Abinew Ali Ayele, Naquee Rizwan, Florian Schneider, Xintong Wang, Seid Muhie Yimam, Daniil Moskovskiy, Elisei Stakovskii, Eran Kaufman, Ashraf Elnagar, Animesh Mukherjee, and Alexander Panchenko. 2025. Multilingual and Explainable Text Detoxification with Parallel Corpora. In Proceedings of the 31st International Conference on Computational Linguistics, pages 7998–8025, Abu Dhabi, UAE. Association for Computational Linguistics.
Enlace publicación
NLP Topic
Número de unidades
1000
Tipo de unidades
Tuits
Tamaño set entrenamiento
400
Tamaño set evaluación
600
- Inicie sesión o registrese para enviar comentarios

