Let's discuss your project

Home
/
Blog
/
General
/

Cómo crear un conjunto de datos de referencia para el control de calidad de las anotaciones

Last updated:
24.08.2026
Read time:
X
min
Author:
Roy Andraos
Aprenda a crear un conjunto de datos de referencia para evaluar anotadores, validar modelos de IA y mejorar el control de calidad de las anotaciones.

Crear un conjunto de datos de referencia permite evaluar la calidad de las anotaciones, calibrar equipos y validar modelos de IA con criterios estables. Esta guía explica cómo seleccionarlo, documentarlo, versionarlo y usarlo en control de calidad continuo.

Topics
Keypoints
  • Crear un conjunto de datos de referencia permite evaluar la calidad de las anotaciones, calibrar equipos y validar modelos de IA con criterios estables.
  • Esta guía explica cómo seleccionarlo, documentarlo, versionarlo y usarlo en control de calidad continuo.
  • Para garantizar la reproducibilidad y la equidad en la puntuación del control de calidad, las anotaciones de referencia deben estar controladas por versiones y permanecer inmutables durante su uso.
  • Después, este conjunto puede utilizarse como conjunto de datos de control de calidad posterior para evaluar la precisión de los anotadores o actualizar reglas de etiquetado para el reentrenamiento.

Por qué un conjunto de datos de referencia es imprescindible

En la anotación de datos, la consistencia y la precisión son fundamentales. Un conjunto de datos de referencia es un grupo de muestras cuidadosamente revisadas con anotaciones validadas por expertos. Se utiliza como referencia para evaluar el rendimiento de los anotadores humanos y de los modelos de aprendizaje automático.

Sin un conjunto de referencia, el control de calidad se vuelve subjetivo. Los equipos terminan comparando anotaciones sin un punto de referencia claro, lo que genera inconsistencias y posibles desviaciones del modelo.

Un conjunto de datos de referencia sólido ayuda a:

  • Evaluar objetivamente el rendimiento de los anotadores
  • Validar modelos de aprendizaje automático con salidas correctas conocidas
  • Detectar errores e inconsistencias de etiquetado en fases tempranas
  • Alinear a los equipos en torno a las directrices de anotación
  • Formar y calibrar eficazmente a nuevos anotadores

En sectores de alto impacto, como Healthcare, vehículos autónomos e imágenes satelitales, no contar con un conjunto de referencia no solo es arriesgado; también puede resultar inaceptable desde el punto de vista legal y ético.

¿Qué convierte a un conjunto de datos en una referencia de calidad?

El término “referencia” no es solo una expresión atractiva: implica confianza, rigor y calidad. En el contexto de la anotación de datos, significa que el conjunto de datos se considera la referencia definitiva: suficientemente preciso, inequívoco y representativo para servir como punto de comparación en todos los flujos de trabajo de control de calidad, validación de modelos y anotación.

Entonces, ¿qué lleva a un conjunto de datos a ese nivel? Estas son las cualidades clave:

Anotaciones validadas por expertos

Los conjuntos de datos de referencia son etiquetados directamente por expertos del dominio, como radiólogos certificados o agrónomos con doctorado, o por anotadores de alto rendimiento bajo supervisión experta. Cada etiqueta se revisa en detalle, se debate cuando es necesario y se finaliza con confianza.

  • En un proyecto de IA para radiología, por ejemplo, una “etiqueta de referencia” podría ser el resultado de tres anotaciones independientes realizadas por radiólogos y resueltas por consenso.
  • En conjuntos de datos para Autonomous Driving, las etiquetas de referencia pueden provenir de anotadores líderes con más de 10.000 horas de experiencia en etiquetado, validadas por especialistas en control de calidad.

Cumplimiento de las directrices de anotación

No se trata solo de quién realiza el etiquetado, sino también de cómo lo hace. Los conjuntos de referencia deben estar plenamente alineados con las directrices de anotación, que deben ser inequívocas y estar sujetas a control de versiones. Si una etiqueta puede interpretarse de más de una manera, todavía no está lista para ser referencia.

  • Si las directrices indican “etiquetar todos los vehículos estacionados”, entonces todos los vehículos estacionados deben anotarse de forma consistente en todo el conjunto de referencia.
  • Los casos límite deben resolverse con claridad, dejando documentado el razonamiento para futuras consultas y para la incorporación de nuevos anotadores.

Consistencia entre muestras

Lo que se debe evitar es que una muestra esté etiquetada de forma muy ajustada y otra de manera laxa. Los conjuntos de datos de referencia mantienen consistencia dentro de cada tipo de etiqueta, incluso cuando participan varios anotadores o sesiones. Esto incluye:

  • Margen y ajuste uniformes en las cajas delimitadoras
  • Uso idéntico de clases en escenas similares
  • Precisión en la colocación de puntos clave o en los contornos de las máscaras de segmentación

El objetivo es que el conjunto de datos refleje cómo debe verse una anotación correcta en todo momento, no solo la mayor parte del tiempo.

Representatividad de los datos del mundo real

Un verdadero conjunto de referencia refleja la diversidad del entorno de implementación:

  • Variaciones de iluminación, como día y noche
  • Condiciones meteorológicas, como niebla, lluvia o nieve
  • Ruido, oclusiones y desenfoque por movimiento
  • Desequilibrio de clases o escenarios poco frecuentes, por ejemplo, trabajadores caídos o pavimento agrietado

Esto garantiza que el conjunto de referencia no solo sea limpio, sino también auténtico. De lo contrario, las pruebas de control de calidad y la validación del modelo no serán realistas.

Inmutabilidad y auditabilidad

Para garantizar la reproducibilidad y la equidad en la puntuación del control de calidad, las anotaciones de referencia deben estar controladas por versiones y permanecer inmutables durante su uso. Esto no significa que nunca se actualicen, sino que las actualizaciones deben registrarse de forma transparente. Siempre debería ser posible responder:

  • ¿Quién etiquetó esto?
  • ¿Cuándo se actualizó por última vez?
  • ¿Qué versión de la guía se utilizó?

Este tipo de trazabilidad auditable se vuelve crucial en sectores regulados, como salud, finanzas o aviación, y cuando intervienen varios proveedores o equipos.

Justificación documentada y gestión de casos límite

Por último, cada decisión difícil debe estar respaldada por una razón. ¿Ese objeto pequeño se etiquetó como “herramienta” o como “pieza de máquina”? El conjunto de referencia debe incluir notas o etiquetas que aclaren el motivo.

  • “Etiquetado como ‘herramienta’ porque se opera manualmente y es portátil”.
  • “Clasificado como ‘desconocido’ debido a oclusión parcial”.

Estas notas no solo ayudan al control de calidad: también pasan a formar parte de la memoria institucional del conjunto de datos.

¿Cuándo debe crearse el conjunto de datos de referencia?

Lo antes posible, idealmente antes de iniciar la anotación a gran escala.

Crear un conjunto de datos de referencia no es algo que convenga añadir al final. Es la base sobre la que descansa todo el flujo de trabajo de anotación. Sin embargo, suele descuidarse por la urgencia de empezar a etiquetar a gran escala.

Así se puede abordar el momento adecuado:

Antes de iniciar la anotación: escenario ideal

Si se está construyendo un conjunto de datos desde cero, este es el mejor escenario:

  • Comenzar con una fase piloto de 200 a 1000 muestras.
  • Crear directrices de anotación y refinarlas mediante revisiones de expertos.
  • Etiquetar el conjunto piloto con expertos o anotadores líderes.
  • Usarlo como la versión 1 del conjunto de referencia.

Este enfoque ayuda a:

  • Detectar ambigüedades en las directrices
  • Probar herramientas y flujos de trabajo
  • Alinear a los equipos desde el inicio

También permite ahorrar tiempo y costes más adelante al evitar retrabajos.

Durante un proyecto en curso: sigue siendo muy valioso

Supongamos que ya se han etiquetado 50.000 imágenes. Aún es posible crear un conjunto de referencia mediante estos pasos:

  • Seleccionar entre 500 y 1000 ejemplos diversos de todo el conjunto de datos.
  • Volver a etiquetarlos con los anotadores de mayor confianza o con expertos del dominio.
  • Validarlos frente a las directrices actualizadas.
  • Congelar este subconjunto como referencia para el control de calidad en adelante.

Este ajuste a mitad del proyecto ofrece:

  • Una forma de detectar inconsistencias
  • Un punto de referencia para medir necesidades de reanotación
  • Una base para formar o recalibrar equipos de anotación

Es una forma eficaz de recuperar el control sobre la calidad, incluso si el proyecto ya está avanzado.

Después del despliegue del modelo: tarde, pero posible

Esperar hasta después del despliegue del modelo para definir el conjunto de referencia no es lo ideal, pero sigue siendo mejor que operar sin referencia. En este caso:

  • Utilice el análisis de errores del modelo desplegado para identificar ejemplos problemáticos.
  • Cree un conjunto de referencia a partir de falsos positivos, falsos negativos y casos límite.
  • Úselo para monitorizar la desviación del rendimiento a lo largo del tiempo.

Después, este conjunto puede utilizarse como conjunto de datos de control de calidad posterior para evaluar la precisión de los anotadores o actualizar reglas de etiquetado para el reentrenamiento.

Definir desde el inicio una cadencia de revisión

Tanto si el conjunto de referencia se crea al principio como si se construye más adelante, es importante definir una cadencia regular de revisión:

  • ¿Cada nueva actualización de las directrices? Reevalúe el conjunto de referencia.
  • ¿Cada 3 a 6 meses? Vuelva a muestrear y añada nuevos casos límite.
  • ¿Después de expandirse a nuevas geografías o dominios? Cree conjuntos de referencia adaptados a ese dominio.

Esto garantiza que el punto de referencia siga siendo relevante a medida que evolucionan los datos y los casos de uso de IA.

Paso a paso: cómo crear un conjunto de datos de referencia

El proceso puede desglosarse en una secuencia práctica y repetible.

Definir primero las directrices de anotación

El conjunto de referencia es tan fiable como las directrices que lo sustentan. Asegúrese de que la guía de anotación sea:

  • Clara: sin ambigüedades sobre qué etiquetar ni cómo hacerlo.
  • Visual: con ejemplos, casos límite y contraejemplos.
  • Controlada por versiones: con actualizaciones registradas y comunicadas.

Puede revisar la plantilla de guía de etiquetado de código abierto como fuente de inspiración.

Seleccionar las muestras de datos adecuadas

Evite el muestreo aleatorio. Seleccione datos que:

  • Representen escenarios del mundo real, como día/noche, ruido u oclusión
  • Cubran todas las clases conocidas y los casos límite
  • Sean diversos en geografía, entornos o demografía
  • Incluyan muestras difíciles propensas a desacuerdo entre anotadores

Se busca un conjunto de “agujas de referencia”, no simplemente un pajar.

Involucrar a expertos o anotadores sénior

Asigne la creación del conjunto de referencia a:

  • Expertos en la materia dentro del dominio
  • Anotadores líderes con precisión demostrada
  • Revisores de consenso en flujos de trabajo con varios anotadores

Procure contar con al menos dos revisiones expertas por elemento y una verificación final de control de calidad por parte de un tercero.

Establecer procesos de revisión y resolución de conflictos

Los desacuerdos son inevitables. Se necesita un sistema para:

  • Registrar desacuerdos
  • Resolverlos mediante arbitraje experto
  • Documentar la justificación de cada decisión

Una herramienta útil para esto es FiftyOne, que permite inspeccionar y visualizar muestras versionadas.

Validar estadísticamente las anotaciones

Una vez creado el conjunto de referencia inicial:

  • Calcule el acuerdo entre anotadores (IAA), por ejemplo, Kappa de Cohen
  • Use matrices de confusión para comprender los errores frecuentes
  • Compare de forma cruzada con las predicciones del modelo de producción existente

Esto garantiza que el conjunto de referencia sea consistente e informativo.

Almacenar y etiquetar correctamente

En la plataforma de datos o en la canalización de MLOps, etiquete las muestras de referencia con:

  • gold=true
  • source=expert-reviewed
  • version=1.0

Se pueden usar campos de metadatos en plataformas como SuperAnnotate o Encord para gestionar las muestras de referencia de forma independiente.

Cómo usar un conjunto de datos de referencia en el control de calidad

Una vez establecido, el conjunto de datos de referencia se convierte en el núcleo de la estrategia de calidad de anotación.

Evaluación comparativa de control de calidad

Compare las nuevas anotaciones con el conjunto de referencia para evaluar:

  • Precisión: ¿las etiquetas se aplican correctamente?
  • Exhaustividad: ¿están presentes todas las etiquetas requeridas?
  • Acuerdo: ¿las anotaciones se alinean dentro de una desviación aceptable?

Utilice scripts automatizados o herramientas integradas de control de calidad para ejecutar comparaciones a escala.

Incorporación y formación de anotadores

Cada nuevo anotador debería comenzar con una evaluación basada en el conjunto de referencia:

  • Proporcione ejemplos del conjunto de referencia
  • Evalúe su desempeño con muestras reservadas
  • Califique la precisión frente al punto de referencia

Esto permite filtrar a anotadores mal alineados antes de que trabajen con datos de producción.

Monitorización continua

El control de calidad de la anotación no es una tarea puntual. Con un conjunto de datos de referencia, se puede:

  • Auditar periódicamente lotes activos
  • Detectar desviación de concepto o desviación de etiquetas
  • Reentrenar anotadores o actualizar directrices cuando sea necesario

Algunas empresas incluso crean “tablas de clasificación de control de calidad” para gamificar las mejoras de rendimiento.

Errores que conviene evitar

Crear un conjunto de datos de referencia es una práctica poderosa, pero solo si se evitan estos errores comunes:

Tratarlo como un activo estático

El conjunto de referencia debe evolucionar con:

  • Cambios en las directrices
  • Ampliaciones de las definiciones de clases
  • Nuevos casos límite emergentes

Programe revisiones periódicas y actualizaciones de versión.

Usar muy pocas muestras

Un conjunto de referencia con solo 20 imágenes no generalizará bien. Según el dominio, conviene apuntar a:

  • Entre el 1 % y el 5 % del conjunto de datos total, o
  • Entre 500 y 2000 imágenes para proyectos medianos

Falta de documentación

Documente siempre:

  • Quién etiquetó cada elemento
  • Cuándo y por qué se realizaron cambios
  • Desacuerdos y resoluciones

Esto garantiza trazabilidad y confianza, especialmente en sectores regulados como salud o finanzas.

Caso de estudio: anotación de imágenes médicas en radiología

Un equipo que trabajaba en un modelo de IA para radiología comenzó con miles de radiografías de tórax y tomografías computarizadas. Para garantizar una alta precisión diagnóstica, creó un conjunto de datos de referencia con la ayuda de radiólogos certificados en Francia y Líbano.

Los pasos clave incluyeron:

  • Crear definiciones de clase detalladas, por ejemplo, “atelectasia” frente a “derrame pleural”
  • Triage de casos límite con radiólogos hospitalarios
  • Ejecutar análisis estadístico de acuerdo con residentes médicos
  • Usar el conjunto de referencia para formar a anotadores junior y calibrar el rendimiento del modelo

¿El resultado? La precisión del modelo mejoró un 14 % después de la alineación con el conjunto de referencia, y el tiempo de control de calidad se redujo un 40 %.

Integración del control de calidad con conjunto de referencia en flujos de trabajo de MLOps

Un conjunto de datos de referencia es más eficaz cuando está plenamente integrado en las operaciones de aprendizaje automático. Estas son algunas formas de hacerlo:

Control de versiones con DVC o Git

Almacene versiones de las imágenes de referencia, etiquetas y metadatos en DVC o Git LFS para garantizar la trazabilidad. Esto favorece la reproducibilidad entre experimentos.

Integración en la canalización

En canalizaciones de CI/CD:

  • Incluya muestras de referencia en cada ejecución de validación del modelo
  • Marque para revisión las muestras de referencia clasificadas erróneamente
  • Use las puntuaciones de control de calidad para condicionar el despliegue de nuevos modelos

Esto ayuda a construir una cultura de responsabilidad y confianza.

Compatibilidad de la plataforma

Muchas herramientas modernas de anotación, como Kili Technology, Scale AI y Labelbox, admiten etiquetado de muestras de referencia y flujos de trabajo de control de calidad. Elija una plataforma que permita:

  • Control de versiones
  • Registros de auditoría
  • Revisiones basadas en roles
  • Acceso mediante API para control de calidad automatizado

Cuándo actualizar o retirar el conjunto de datos de referencia

Incluso un conjunto de referencia puede perder vigencia. Debe revisarse y actualizarse cuando:

  • Se actualicen las directrices o se añadan nuevas clases
  • Los patrones de error de los anotadores cambien de forma significativa
  • Los modelos empiecen a clasificar erróneamente muestras de referencia que antes eran estables
  • Se incorporen nuevas geografías o dominios de caso de uso

Mantenga un registro de cambios y considere utilizar versionado semántico, por ejemplo, v1.0 → v1.1, para las actualizaciones.

Reflexiones finales

Un conjunto de datos de referencia no es un lujo: es la base del control de calidad de las anotaciones y del éxito de los modelos de IA. Construirlo requiere rigor, experiencia de dominio y mejora continua. Pero, una vez establecido, aporta confianza y transparencia a cada parte del flujo de trabajo, desde la anotación hasta el despliegue del modelo.

Tanto si se anotan radiografías, señales de tráfico o cultivos en imágenes satelitales, invertir hoy en un conjunto de referencia puede traducirse mañana en mayor precisión, consistencia y confianza.

Fortalecer el conjunto de datos para control de calidad

Si está preparando un flujo de trabajo sólido de control de calidad para anotación, DataVLab puede ayudarle a crear, gestionar y evolucionar sus conjuntos de datos de referencia con soporte experto y orientación independiente de la plataforma. Contacte con DataVLab.

¿Cómo crear un conjunto de datos de referencia para el control de calidad de las anotaciones?

Crear un conjunto de datos de referencia permite evaluar la calidad de las anotaciones, calibrar equipos y validar modelos de IA con criterios estables. Esta guía explica cómo seleccionarlo, documentarlo, versionarlo y usarlo en control de calidad continuo.

¿Por qué un conjunto de datos de referencia es imprescindible?

En la anotación de datos, la consistencia y la precisión son fundamentales. Un conjunto de datos de referencia es un grupo de muestras cuidadosamente revisadas con anotaciones validadas por expertos. Se utiliza como referencia para evaluar el rendimiento de los anotadores humanos y de los modelos de aprendizaje automático.

¿Qué convierte a un conjunto de datos en una referencia de calidad?

El término “referencia” no es solo una expresión atractiva: implica confianza, rigor y calidad. En el contexto de la anotación de datos, significa que el conjunto de datos se considera la referencia definitiva: suficientemente preciso, inequívoco y representativo para servir como punto de comparación en todos los flujos de trabajo de control de calidad, validación de modelos y anotación.

¿Cuándo debe crearse el conjunto de datos de referencia?

Lo antes posible, idealmente antes de iniciar la anotación a gran escala. Crear un conjunto de datos de referencia no es algo que convenga añadir al final. Es la base sobre la que descansa todo el flujo de trabajo de anotación.

¿Cómo usar un conjunto de datos de referencia en el control de calidad?

Una vez establecido, el conjunto de datos de referencia se convierte en el núcleo de la estrategia de calidad de anotación. Acuerdo: ¿las anotaciones se alinean dentro de una desviación aceptable? Utilice scripts automatizados o herramientas integradas de control de calidad para ejecutar comparaciones a escala.

¿Cómo se puede garantizar la calidad?

Un conjunto de datos de referencia es más eficaz cuando está plenamente integrado en las operaciones de aprendizaje automático. Almacene versiones de las imágenes de referencia, etiquetas y metadatos en DVC o Git LFS para garantizar la trazabilidad.

Roy Andraos

CEO DataVlab
Fundador de DataVLab, una empresa de anotación de datos que acompaña a equipos de IA en sanidad, agricultura, retail, imágenes satelitales y otros sectores con gran carga visual. Desde 2019 ayudamos a las organizaciones a convertir datos complejos de imagen, vídeo y texto en conjuntos de entrenamiento fiables, combinando experiencia operativa con un enfoque riguroso en la calidad y la escalabilidad de las anotaciones.

Let's discuss your project

We can provide realible and specialised annotation services and improve your AI's performances

Abstract blue gradient background with a subtle grid pattern.

Explore nuestros diferentes
Aplicaciones industriales

Nuestros servicios de etiquetado de datos se adaptan a diversas industrias, lo que garantiza anotaciones de alta calidad adaptadas a sus necesidades específicas.

Servicios de anotación de datos

Libere todo el potencial de sus aplicaciones de IA con nuestra tecnología experta en etiquetado de datos. Garantizamos anotaciones de alta calidad que aceleran los plazos de sus proyectos.

Servicios de anotación de datos

Anotación de datos para IA y machine learning

Servicios de anotación de datos para entrenar IA con precisión, seguridad y escala.

Servicios de etiquetado de datos

Etiquetado de datos para IA

Etiquetado de datos con control de calidad experto y flujos seguros para equipos de IA.

Servicios de anotación de imágenes

Servicios de anotación de imágenes para IA

Etiquetado de imágenes para visión artificial con control de calidad y escalabilidad.

Anotación de vídeo

Servicios de anotación de vídeo para IA

Etiquetado temporal y seguimiento en vídeo para modelos de IA dinámicos.