ChatGPT Vision: capire le immagini con l'AI
ChatGPT Vision e' la capacita di GPT-4o e GPT-5 di analizzare immagini caricate dall'utente. Non e' un tool separato ma una feature nativa multimodale: carichi una foto e ChatGPT la descrive, estrae testo, risolve problemi o suggerisce azioni.
Cosa puo fare
- OCR avanzato: estrae testo da foto, scansioni, screenshot anche con grafia manuale
- Descrizione scene: identifica oggetti, persone (non riconoscimento facciale), ambientazioni
- Analisi grafici: legge bar chart, line chart, tabelle in formato immagine
- Code review da screenshot: identifica bug guardando il codice nello screenshot
- Diagnostica visiva: spiega messaggi di errore, schermate UI, layout
- Traduzione cartelli: traduce segnaletica o menu in lingua straniera
Come usarlo
Su web/mobile clicca l'icona graffetta o trascina l'immagine in chat. Aggiungi un prompt specifico: più sei chiaro su cosa vuoi sapere, migliore sarà la risposta. Formati supportati: PNG, JPG, WEBP, GIF non animati. Max 20 MB per file.
Casi d'uso aziendali
- Audit conformita visiva (foto cantiere, magazzino, retail)
- Compilazione automatica form da scansioni
- Generazione descrizioni prodotto e-commerce da foto
- Analisi schemi tecnici, planimetrie, fustelle
- Quality check fotografico su linee produttive
Limiti importanti
- Non identifica volti di persone specifiche (policy OpenAI)
- Misure e proporzioni esatte spesso imprecise
- Conteggio oggetti in scene affollate poco affidabile
- Non analizza video (solo frame singoli)
Prompt esempio
"Carico la foto del menu. Estrai tutti i piatti, traducili in inglese e crea una tabella con prezzo originale e prezzo in dollari al cambio attuale."
Vuoi automatizzare flussi con riconoscimento immagini AI? G Tech Group progetta integrazioni Vision per il tuo business. Richiedi info.