Skip to content

2. 所研究的三个问题及其结果

我们将要求 IA 研究三个问题,从最简单到最复杂。让我们来看一下 Google Gemini 的屏幕截图:

 
  • 在 [1] 中,Gemini 的 URL;
  • 在 [2] 中,所使用的 Gemini 版本;
  • 在 [3-5] 中,是向 Gemini 提出的三个问题;

2.1. 问题 1

问题1是一个简单的问题:

 

所有 IA 都能正确回答这个问题。

2.2. 问题 2

问题2如下(Gemini的屏幕截图):

 
  • 在 [1] 中,关于如何计算 2018 年收入的 2019 年税款的原理已在 PDF 中进行了解释。我们稍后会再回到这一点;
  • 在 [2] 中,向 Gemini 提供了明确的指令,说明所需内容:一个能解决给定问题并使用 11 个单元测试验证所提解决方案的干净 Python 脚本;
  • 在 [3] 中,为了启动 Gemini,我们需要编写一些代码;

这与大学里给出的TD案例完全相同。

经过测试的IA都能解决问题,但MistralAI和Perplexity除外。

2.3. 问题 3

仍然以 Google Gemini 的屏幕截图为例,问题 3 如下:

 
  • 在 [1] 中,我们给出了与之前相同的指令。但由于未提供包含精确计算规则的 PDF,IA 将不得不通过互联网搜索这些规则;
  • 在 [3] 中,我们启动了 IA 的执行;

仅有三个IA通过了此项测试,按优劣顺序排列(纯属个人观点,不言而喻):

  1. ChatGPT(来自OpenAI);
  2. Grok(源自 xAI);
  3. Goggle Gemini;

IA ClaudeAI 在第 3 题中未通过。 IA MistralAI 在问题 2 和 3 上失败,IA Perplexity 也是如此。 IA 和 DeepSeek 在问题 3 上失败。