欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

编辑:编辑部 HNZ

【导读】法国初创Mistral,刚刚推出定价碾压DeepSeek V3的模型,而模型性能,却超过Claude Sonnet 3.7的90%。不过在网友们的实测中,它却翻车了?有人建议:不必下载浪费流量和硬盘空间。

就在刚刚, Mistral AI发布了他们最新多模态模型Mistral Medium 3。

Mistral兴奋地宣称Mistral Medium 3的性能接近甚至达到了Claude Sonnet 3.7的水平,但成本却比DeepSeek V3还低。

性价比拉满!

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

在Mistral官方的博客中,列出了Mistral Medium 3的核心亮点:

1. Mistral Medium 3平衡了:

  • 顶尖性能

  • 成本降低至原来的八分之一

  • 更易于部署,从而加速企业应用

2. 模型在代码编写和多模态理解等专业应用场景中表现出色。

3. 模型提供一系列企业功能,包括:

  • 支持混合云部署、本地部署以及在VPC内部署

  • 定制化后训练

  • 集成到企业工具和系统中

Mistral Medium 3 API,现已在Mistral La Plateforme和Amazon Sagemaker上线,并将很快登陆IBM WatsonX、NVIDIA NIM、Azure AI Foundry和Google Cloud Vertex。

完美平衡

Mistral Medium 3在提供前沿性能的同时,成本却降低了一个数量级。

例如,在各项基准测试中,Mistral Medium 3的性能达到甚至超过了Claude Sonnet 3.7的90%,但成本却显着降低(每百万Token的输入成本为0.4美元,输出成本为2美元)。

Mistral Medium 3的性能也超越了领先的开源模型,如Llama 4 Maverick和Cohere Command A等企业模型。

无论是API还是自主部署,Mistral Medium 3的成本都要比DeepSeek V3还低。

此外,Mistral Medium 3还可以部署在任何云上,包括四个GPU及以上的自托管环境。

顶级性能

Mistral表示,Mistral Medium 3的目标是成为一款性能顶尖的模型,尤其是在编码和STEM任务中表现突出,性能直逼那些规模更大、速度更慢的竞争对手。

从Mistral给出的表中可以看出Mistral Medium 3性能已经基本上超越Llama 4 Maverick和GPT-4o,接近Claude Sonnet 3.7以及DeepSeek 3.1的水平。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

人工评估结果

除了学术基准之外,Mistral还公布了第三方人工评估,后者更能代表真实世界的用例。

可以看到,Mistral Medium 3在编码领域表现出色,并且在各个方面都比其他竞争对手提供了更好的性能。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

专为企业级应用打造

Mistral Medium 3在适应企业环境的能力方面优于其他SOTA模型。

在企业面临通过API进行微调,或从零开始自部署并定制模型行为的艰难选择时,Mistral Medium 3提供了一条将智能全面集成到企业系统中的途径。

Mistral还推出了由Mistral Medium 3模型驱动的Le Chat Enterprise,一款面向企业的聊天机器人服务。

它提供了一个AI智能体构建工具,并将Mistral的模型与Gmail、Google Drive和SharePoint等第三方服务整合。

这就可以解决企业面临的AI挑战,如工具碎片化、不安全的知识集成、僵化的模型以及缓慢的投资回报率等,为所有组织工作提供统一的AI平台。

Le Chat Enterprise很快将支持MCP协议,这是Anthropic提出的连接AI与数据系统和软件的标准。

One more thing…

Mistral还在博客中透露,虽然Mistral Small和Mistral Medium都已经发布,但在未来几周内,他们有一个「大」计划,也就是Mistral Large。

他们表示刚发布的Mistral Medium性能已经远胜Llama 4 Maverick等顶尖开源模型,Mistral Large的性能更加值得期待。

网友实测:就这?

号称超越Claude Sonnet 3.7的90%,Medium 3果然有这么强吗?

媒体和网友们立刻展开了实测。

在基于《纽约时报》Connections栏目词汇分类题的评测中,Medium 3处于倒数的位置,几乎找不到它。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

在全新的100题测评中,它在前排模型中也排不上号。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

有人测试Medium 3后表示,它的写作能力还是老样子,没啥进步。不过在LLM评测中,它倒是处在帕累托前沿。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

而Zhu Liang测试后发现,模型在代码编写和文本生成方面表现都很扎实,在这两项评测中都跻身前五。

在简单编码任务(Next.js TODO应用)中:

  • 它生成了简洁明了的回复

  • 评分和Gemini 2.5 Pro、Claude 3.5 Sonnet差不多

  • 逊于DeepSeek V3 (新) 和GPT-4.1

在复杂编码任务(基准测试可视化)中:

  • 产生的平均结果与Gemini 2.5 Pro和DeepSeek V3(新)相似

  • 不如GPT-4.1、o3和Claude 3.7 Sonnet

在写作上:

  • 它的内容覆盖了大部分要点,但格式不正确

  • 评分与DeepSeek V3 (新) 和Claude 3.7 Sonnet相近

  • 不如GPT-4.1和Gemini 2.5 Pro

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

知名大佬「karminski-牙医」实测后发现,它的性能并不像官方吹得那么强。

建议我们不必下载,浪费流量和硬盘空间了。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

参考资料:

Mistral claims its newest AI model delivers leading performance for the price

https://venturebeat.com/ai/mistral-comes-out-swinging-for-enterprise-ai-customers-with-new-le-chat-enterprise-medium-3-model/

https://mistral.ai/news/mistral-medium-3

内容来源于网络。发布者:科技网btna,转转请注明出处:https://www.btna.cn/7555.html

(0)
科技网btna的头像科技网btna
上一篇 2025年5月8日 下午4:00
下一篇 2025年5月8日 下午4:00

相关推荐

  • 刚刚,ICML 2025录用结果公布!好评论文惨遭拒,审稿人敷衍引全网怒喷

    编辑:桃子 【导读】ICML 2025录用结果新鲜出炉!今年共有3,260篇论文被录用,录用率26.9%。然而,这届评审质量再掀热议,审稿人敷衍参评各种乌龙被曝出。 ICML 2025录用结果,终于公布了! 今年,顶会共提交了12107篇有效投稿(不包括「桌拒」论文)。其中,3260篇论文被接收,录用率为26.9%。 值得一提的是,ICML总投稿数量每年激增…

    2025年5月2日
    7100
  • 大学文凭成废纸?AI暴击美国00后!他哥大退学成千万富翁,我却还要还学贷

    编辑:编辑部 ZXH 【导读】美国Z世代表示:因为ChatGPT,大学文凭已经变成一张废纸!纯属浪费时间浪费金钱。刚刚出炉的调查显示,同意此观点的年轻人已经达到了49%。而哥大退学网红等00后创业明星的故事,更是让美国人对大学教育完全祛魅了。 摊牌了,不装了,美国的Z时代已经对上大学彻底不耐烦了。 现在,他们喊出这样的宣言:有了ChatGPT,大学文凭已经彻…

    2025年4月23日
    6200
  • 万径归于「概率」,华人学者颠覆认知!英伟达大牛力荐RL微调新作

    编辑:KingHZ 【导读】华人学者参与的一项研究,重新确立了强化学习在LLM微调的价值,深度解释了AI训练「两阶段强化学习」的原因。某种意义上,他们的论文说明RL微调就是统计。 最近,英伟达的高级研究科学家、牛津大学博士yobibyte,推荐了今年3月份公布的arXiv预印本论文。 来自卡内基梅隆大学和康奈尔大学等机构的研究者,在论文中解释了初看违反直觉的…

    2025年5月10日
    7100
  • 只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%

    编辑:KingHZ 【导读】南加州大学团队只用9美元,就能在数学基准测试AIME 24上实现超过20%的推理性能提升,效果好得离谱!而其核心技术只需LoRA+强化学习,用极简路径实现超高性价比后训练。 只用9美元,在数学基准测试AIME 24上,实现了超过20%的推理性能提升! 来自南加州大学(University of Southern Californi…

    2025年5月2日
    6900
  • 完全开源!全新多合一AI智能体框架来了:无缝支持多种工具、多种任务

    编辑:LRST 【导读】当AI与工具相结合,智能体不再只是概念!Minion-agent整合多框架能力,解决碎片化问题,支持多智能体协作与工具调用,降低开发门槛,已在多个场景中展现高效能力,有望推动AI智能体创新和普及! AI智能体(AI Agent)正在成为技术领域的焦点,尤其是随着OpenAI、Anthropic等大模型提供商不断增强其API能力,构建自…

    智能 2025年5月10日
    8300

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信