2. 所研究的三个问题及其结果
我们将要求 IA 研究三个问题,从最简单到最复杂。让我们来看一下 Google Gemini 的屏幕截图:
![]() |
- 在 [1] 中,Gemini 的 URL;
- 在 [2] 中,所使用的 Gemini 版本;
- 在 [3-5] 中,是向 Gemini 提出的三个问题;
2.1. 问题 1
问题1是一个简单的问题:
![]() |
所有 IA 都能正确回答这个问题。
2.2. 问题 2
问题2如下(Gemini的屏幕截图):
![]() |
- 在 [1] 中,关于如何计算 2018 年收入的 2019 年税款的原理已在 PDF 中进行了解释。我们稍后会再回到这一点;
- 在 [2] 中,向 Gemini 提供了明确的指令,说明所需内容:一个能解决给定问题并使用 11 个单元测试验证所提解决方案的干净 Python 脚本;
- 在 [3] 中,为了启动 Gemini,我们需要编写一些代码;
这与大学里给出的TD案例完全相同。
经过测试的IA都能解决问题,但MistralAI和Perplexity除外。
2.3. 问题 3
仍然以 Google Gemini 的屏幕截图为例,问题 3 如下:
![]() |
- 在 [1] 中,我们给出了与之前相同的指令。但由于未提供包含精确计算规则的 PDF,IA 将不得不通过互联网搜索这些规则;
- 在 [3] 中,我们启动了 IA 的执行;
仅有三个IA通过了此项测试,按优劣顺序排列(纯属个人观点,不言而喻):
- ChatGPT(来自OpenAI);
- Grok(源自 xAI);
- Goggle Gemini;
IA ClaudeAI 在第 3 题中未通过。 IA MistralAI 在问题 2 和 3 上失败,IA Perplexity 也是如此。 IA 和 DeepSeek 在问题 3 上失败。



