Skip to content

2. Trzy analizowane zadania i wyniki

Poprosimy IA o przeanalizowanie trzech problemów, od najprostszego do najbardziej skomplikowanego. Spójrzmy na zrzut ekranu z Google Gemini:

 
  • W [1], URL Gemini;
  • W [2] – wersja Gemini, z której korzystano;
  • W [3-5] – trzy zadania postawione Gemini;

2.1. Zadanie 1

Zadanie 1 to proste pytanie:

 

Wszystkie IA udzielą prawidłowej odpowiedzi na to pytanie.

2.2. Zadanie 2

Zadanie 2 wygląda następująco (zrzut ekranu z Gemini):

 
  • W [1] zasada obliczania podatku za rok 2019 od dochodów z roku 2018 została wyjaśniona w PDF. Wrócimy do tego później;
  • W pliku [2] podajemy Gemini dokładne instrukcje dotyczące tego, czego oczekujemy: czysty skrypt w języku Python, który rozwiązuje postawiony problem i weryfikuje proponowane rozwiązanie za pomocą 11 testów jednostkowych;
  • W zadaniu [3], aby uruchomić Gemini, należy napisać pewien kod;

Mamy tu do czynienia dokładnie z tym samym przypadkiem, co w przypadku pliku TD podanego na uniwersytecie.

Przetestowane pliki IA rozwiążą problem, z wyjątkiem MistralAI i Perplexity.

2.3. Problem 3

Wciąż na podstawie zrzutu ekranu z Google Gemini, problem 3 wygląda następująco:

 
  • W przypadku [1] podajemy nasze instrukcje, takie same jak poprzednio. Ponieważ jednak nie podajemy PDF, który zawierał dokładne zasady obliczeń, IA będzie musiał wyszukać te zasady w Internecie;
  • W pliku [3] uruchamiamy wykonanie pliku IA;

Tylko trzy pliki IA przeszły ten test, w kolejności według doskonałości (oczywiście jest to wyłącznie moja osobista opinia):

  1. ChatGPT autorstwa OpenAI;
  1. Grok z xAI;
  2. Goggle Gemini;

IA ClaudeAI nie poradził sobie z zadaniem 3. IA i MistralAI nie poradziły sobie z zadaniami 2 i 3, podobnie jak IA Perplexity. IA i DeepSeek nie zaliczyły zadania nr 3.