El conjunto de datos Mu-SHROOM consiste en una colección de prompts, salidas de modelos, logits e identificadores de modelos de lenguaje de gran tamaño de acceso abierto. El conjunto de datos abarca 10 idiomas con datos de validación y prueba (árabe estándar moderno, alemán, inglés, español, finés, francés, hindi, italiano, sueco y chino mandarín), 4 idiomas solo de prueba (“sorpresa”) (catalán, checo, euskera y persa), así como datos de entrenamiento no etiquetados para inglés, español, francés y chino. Metadatos complementarios, incluidas las anotaciones en bruto antes del posprocesamiento y las URLs de Wikipedia utilizadas como referencia, así como los scripts empleados para generar las salidas de los modelos en los 14 idiomas y el código de las interfaces de anotación y envío, están disponibles públicamente.
- Inicie sesión o registrese para enviar comentarios

