Skip to content

2. Три розглянуті задачі та їхні результати

Ми попросимо IA дослідити три задачі — від найпростішої до найскладнішої. Давайте подивимося на скріншот Google Gemini:

 
  • У [1] — URL Gemini;
  • На [2] — версія Gemini, що використовувалася;
  • У [3-5] — три завдання, поставлені Gemini;

2.1. Задача 1

Задача 1 — це просте запитання:

 

Усі IA дадуть правильну відповідь на це питання.

2.2. Завдання 2

Завдання 2 виглядає так (скріншот із Gemini):

 
  • У [1] принцип розрахунку податку за 2019 рік на доходи за 2018 рік пояснюється в PDF. Ми ще повернемося до цього;
  • У файлі [2] надаються точні інструкції для Gemini щодо того, що саме потрібно: чистий скрипт на Python, який вирішує поставлене завдання та перевіряє запропоноване рішення за допомогою 11 модульних тестів;
  • У [3] для запуску Gemini потрібно написати певний код;

Це точно той самий випадок, що й у випадку з TD, який задавали в університеті.

Перевірені IA вирішать задачу, за винятком MistralAI та Perplexity.

2.3. Проблема 3

Знову ж таки, на прикладі скріншоту з Google Gemini, проблема 3 полягає в наступному:

 
  • У [1] ми надаємо наші інструкції, такі самі, як і раніше. Але оскільки ми не надаємо PDF, який містив точні правила обчислення, IA доведеться шукати ці правила в Інтернеті;
  • У [3] запускається виконання IA;

Лише три IA пройшли цей тест, у порядку від найкращого до гіршого (це, звісно, суто особиста думка):

  1. ChatGPT від OpenAI;
  1. Grok від xAI;
  2. Goggle Gemini;

IA ClaudeAI не впорався із завданням 3. IA та MistralAI не впоралися із завданнями 2 та 3, так само як і IA Perplexity. IA та DeepSeek не впоралися із завданням 3.