SatirA 2025

El dataset SatirA 2025 consiste en un conjunto de segmentos de audio (aprox. 25 horas) y sus transcripciones, extraídos de programas satíricos y noticieros en español y anotados como sátira o no sátira.
Idioma(s)
Español
Año
2025
Dominio
Diversos
Anotaciones
Cada instancia está etiquetada con una categoría binaria que indica si el contenido es satírico o no satírico, basada en la intención comunicativa del segmento.
Acceso a datos
Registro

Publicación
Pan R., et al. 2025. Overview of SatiSPeech at IberLEF 2025: Multimodal Audio-Text Satire Classification in Spanish. Procesamiento del Lenguaje Natural, 75, pp. 513-522.
Número de unidades
8000
Documentos
8000
Tamaño
8000.00MB
Tamaño set entrenamiento
6000
Tamaño set evaluación
2000

Si has publicado un resultado mejor que los de la lista, envía un mensaje a odesia-comunicacion@lsi.uned.es indicando el resultado y el DOI del artículo, junto con una copia del mismo si no está publicado en abierto.