Skip to content

2. I tre problemi studiati e i risultati

Chiederemo ai IA di studiare tre problemi, dal più semplice al più complesso. Diamo un’occhiata a uno screenshot di Google Gemini:

 
  • In [1], l’URL di Gemini;
  • In [2], la versione di Gemini utilizzata;
  • In [3-5], i tre problemi posti a Gemini;

2.1. Problema 1

Il problema 1 è una semplice domanda:

 

Tutti i IA risponderanno correttamente a questa domanda.

2.2. Problema 2

Il problema 2 è il seguente (screenshot di Gemini):

 
  • In [1], il principio del calcolo dell’imposta 2019 sui redditi del 2018 è spiegato in un PDF. Ci torneremo;
  • In [2], si forniscono istruzioni precise a Gemini su ciò che si desidera: uno script Python pulito che risolva il problema posto e che convalidi la soluzione proposta con 11 test unitari;
  • Nel [3], per avviare Gemini bisogna scrivere qualcosa;

Ci troviamo esattamente nella stessa situazione di un TD assegnato all’università.

I IA testati risolveranno il problema, ad eccezione di MistralAI e Perplexity.

2.3. Problema 3

Sempre con uno screenshot di Google Gemini, il problema 3 è il seguente:

 
  • In [1] forniamo le nostre istruzioni, le stesse di prima. Ma poiché non forniamo il PDF che forniva le regole esatte di calcolo, il IA dovrà cercare queste regole su Internet;
  • In [3], si avvia l’esecuzione di IA;

Solo tre IA hanno superato questo test, in ordine di eccellenza (opinione strettamente personale, ovviamente):

  1. ChatGPT di OpenAI;
  2. Grok di xAI;
  3. Goggle Gemini;

L’IA ClaudeAI non ha superato il problema 3. L’IA MistralAI ha fallito nei problemi 2 e 3, così come l’IA Perplexity. IA e DeepSeek non hanno superato il problema 3.