Computer vision se centra en permitir a las aplicaciones de IA ser capaces de procesar información visual.
El término computer vision es una aglomeración de tareas y técnicas donde la IA procesa input visual, típicamente de imágenes, vídeos o live streams.
Clasificación de imágenes
Una de las ramas más antiguas. Un modelo es entrenado con un set de imágenes realmente grande para poder predecir una text label a partir de una imagen.

Detección de objetos
Examina multiples regiones de una imagen para encontrar objetos individuales y su posición en la imagen. Indica las coordenadas del objeto mediante un box rectangular.

Segmentación semántica
Una técnica más sofisticada. Un modelo es estrenado para encontrar objetos y marcar sus píxeles individuales en la imagen.

Análisis contextual de imágenes
Los últimos modelos multimodales de visión son capaces de encontrar relaciones contextuales entre objetos en imagenes y el texto que los describe. Ahora son capaces de interpretar semánticamente una imagen según lo que esté pasando.
(A person eating an apple)
