Un amigo me contó que una vez entrenó un modelo de clasificación de imágenes con su propio dataset.
El mismo sacó las fotos de lo que tenía que clasificar, en este caso eran distintos tipos de vegetales que la máquina cosechadora tenía que clasificar.
Como todos sabemos, dividió el dataset en train, val y test. Resultados buenos, ajustaba rápido, buenos resultados con el dataset de test.
Cuando lo pusieron en producción, el modelo de prueba (CON SOLO DOS VEGETALES) fue un terrible desastre, una precisión del 50%.
¿A alguien se le ocurre por qué?