地址: 漳平市师桑坝239号 邮箱: contributing@sina.com 工作时间:上午9点-下午8点

热点资讯

  • 首页
  • Our Portfolio
  • 15种大型模型脑内思维大比拼,Gemma 4胜过GPT-4

15种大型模型脑内思维大比拼,Gemma 4胜过GPT-4

2026-09-06

在一项看似科幻的实验中,斗象科技的AIBeat平台成功提取了15个前沿大型模型的推理过程。此次实验的结果有些出乎预料:尽管GPT-4和Claude 3.5被广泛认为是业内顶尖模型,但它们却在此次思维链提取测试中表现不佳,反而是Gemma 4系列表现最为稳定。

实验采用了CoT思维链提取的方法,将15个模型分为三组进行测试。CoT思维链是指模型在生成答案前内部推理的逻辑步骤,通过准确提取这些步骤,可以揭示模型做出特定回答的原因,这对于AI的安全审计和可解释性研究具有重要意义。

结果显示,Gemma 4及其微调版本在提取准确性方面表现最佳,尤其在处理复杂推理场景如量子校准实验时,表现尤为突出。而GPT-4和Claude 3.5则在提取过程中出现了明显的失败。这一现象的成因可能在于强模型对量子校准实验的理解深度、提取算法与模型内部机制的契合度等因素,并非它们缺乏推理能力,而是推理过程过于隐蔽,现有的提取手段无法触及。 球友会

测试中,其他模型如Qwen、Llama和Mistral的表现差异较大——部分模型能够提取出一定的数据,而有的则完全失败。总体上,这些模型的稳定性不如Gemma系列。

about image

这一实验向行业传达了一个重要讯息:模型的能力与推理过程的可读性并非成正比关系。如果在选择模型时只关注性能指标,可能会选中一个推理过程模糊的“黑箱”。相反,Gemma 4等开源模型在可解释性方面具备明显优势,这对从事AI审计和安全合规的团队来说是个重要参考。

当然,此次实验仅为一次评测,样本和场景的范围有限,因此无法对此做出明确的能力排名。但至少提醒我们,在想要理解AI的思维时,选择适合的工具和模型至关重要。 球友会

订阅我们的时事通讯并获取最新消息