Datos para la IA: datasets, corpus, evaluaciones y red teaming
Conjuntos de datos para usar tal cual: entrenar un modelo, alimentar un RAG, probarlo o atacarlo.
Dataset de IA sobre la población de municipios de España
41 diálogos con la tabla del INE en el contexto (Padrón 2025): el modelo lee la…
Evaluación de IA de la anonimización de textos
Comprueba que un modelo o contexto de anonimización no deja pasar ningún dato…
Red teaming: 12 ataques a un chatbot de atención
12 ataques para un chatbot de atención al cliente de una tienda online…
Red teaming: 10 pruebas a un asistente de RR. HH.
10 pruebas para un asistente interno de RR. HH.: datos de empleados,…
Dataset español de anonimización de datos personales (RGPD)
20 ejemplos para anonimizar textos de España (RGPD, LOPDGDD): DNI, teléfonos…
¿Qué son los datos para la IA?
Los datos, aquí, son un conjunto de ejemplos o documentos que se usa tal cual: para entrenar un modelo (dataset), darle conocimientos en un RAG (corpus), medir sus respuestas (evaluación) o atacarlo para encontrar sus fallos (red teaming). No le dicen al modelo qué hacer: le muestran casos, reales o ficticios, con su fuente.