Grok 4.1 发布!霸榜各大榜单

刚刚,马斯克在社交平台上发布了 Grok 4.1 新鲜出炉的消息。“你会看到速度和质量上的提升。” 官方表示,Grok 4.1 在创意、情感和协作互动方面表现出色。能够更敏锐地感知细微的意图,更易于沟

团队沿用了 Grok 4 的大规模强化学习基础设施,并将其应用于优化模型的风格、个性、实用性和一致性。

为了优化这些不可验证的奖励信号,他们开发了新的方法,通过使用前沿的智能推理模型作为奖励模型,进行大规模地自主评估和迭代响应。

创意和情感

在 LMArena 的文本榜单中,Grok 4.1 Thinking 以 1483 Elo 分高居榜首,比排名最高的非 xAI 模型高出 31 分

Grok 4.1 的非推理模式不使用任何思考标记进行即时响应,以 1465 Elo 分位列第二。Grok 4 总排名仅为第 33 位。

团队使用 EQ-Bench3 对 Grok 4.1 进行了人际交往评估。EQ-Bench 是一项由 LLM 评判的测试,用于评估主动情商、理解力、洞察力、同理心和人际交往能力

测试集包含 45 个具有挑战性的角色扮演场景,通过验证模型对多个标准的响应来评估模型的性能。Grok 4.1 在测试中高居榜首。

4.1 版本模型在创意写作 v3 基准测试上也获得了不错的成绩。在该基准测试中,模型需要对 32 个不同的写作提示进行 3 次迭代并生成答案。

幻觉减少

由于推理深度受限和工具调用预算有限,模型可能容易出现事实错误。

研究人员观察到,对于抽样生成的信息检索提示,幻觉发生率显著降低。

基于生产环境流量的真实信息搜索查询分层样本评估幻觉发生率,团队还评估了 FActScore,这是一个包含 500 个关于个人传记问题的公开基准测试。

Grok 4.1 现已面向所有用户开放,可通过 Grok 官网和 X 以及 iOS 和 Android 应用使用。

参考资料:

https://x.ai/news/grok-4-1


(来源:维科网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • OpenAI、Grok、Meta三大模型先后发布,谁是性价比之王?

    ?有界UnKnown原创作者丨山茶编辑|钱江一夜之间,美国大模型集体上新了。 先是SpaceX AI/X AI,率先发布了Grok-4.5;然后是Meta推出Muse Spark 1.1,再然后是Op

    2026-07-11
  • 黑客成功“欺骗”ChatGPT、Grok与谷歌:诱导用户执行恶意指令

    据外媒 Engadget 报道,近年来,随着人工智能在搜索、技术支持及日常生活中的普及,一类新型网络攻击正悄然成型。 安全公司 Huntress 最新发布的分析报告显示,黑客正在利用用户对 AI 的信

    2025-12-13
  • 马斯克官宣Grok

    开源还是闭源,这是个问题。 继旗下xAI公司宣布正式开源大模型Grok-1后,特斯拉CEO马斯克再次在大模型市场扔下一颗重磅炸弹。 当地时间8月11日晚,马斯克在X平台上透露人工智能模型Grok-2测试版将在不久后发布

    2024-08-13
  • 语言模型两大巨头Grok与ChatGPT

    在当今飞速发展的人工智能行业中,有两家巨头在语言模型领域脱颖而出:Grok和ChatGPT-4。两者都因其强大的功能而备受关注,但哪一个才是真正的佼佼者呢? 在本文中,我们将深入探讨两者的优缺点,探讨它们的使用案例、初学者与经验丰富的用户之间的易用性,以及如何从各自的模型中获益

    2023-12-12