欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

编辑:编辑部 HNZ

【导读】法国初创Mistral,刚刚推出定价碾压DeepSeek V3的模型,而模型性能,却超过Claude Sonnet 3.7的90%。不过在网友们的实测中,它却翻车了?有人建议:不必下载浪费流量和硬盘空间。

就在刚刚, Mistral AI发布了他们最新多模态模型Mistral Medium 3。

Mistral兴奋地宣称Mistral Medium 3的性能接近甚至达到了Claude Sonnet 3.7的水平,但成本却比DeepSeek V3还低。

性价比拉满!

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

在Mistral官方的博客中,列出了Mistral Medium 3的核心亮点:

1. Mistral Medium 3平衡了:

  • 顶尖性能

  • 成本降低至原来的八分之一

  • 更易于部署,从而加速企业应用

2. 模型在代码编写和多模态理解等专业应用场景中表现出色。

3. 模型提供一系列企业功能,包括:

  • 支持混合云部署、本地部署以及在VPC内部署

  • 定制化后训练

  • 集成到企业工具和系统中

Mistral Medium 3 API,现已在Mistral La Plateforme和Amazon Sagemaker上线,并将很快登陆IBM WatsonX、NVIDIA NIM、Azure AI Foundry和Google Cloud Vertex。

完美平衡

Mistral Medium 3在提供前沿性能的同时,成本却降低了一个数量级。

例如,在各项基准测试中,Mistral Medium 3的性能达到甚至超过了Claude Sonnet 3.7的90%,但成本却显着降低(每百万Token的输入成本为0.4美元,输出成本为2美元)。

Mistral Medium 3的性能也超越了领先的开源模型,如Llama 4 Maverick和Cohere Command A等企业模型。

无论是API还是自主部署,Mistral Medium 3的成本都要比DeepSeek V3还低。

此外,Mistral Medium 3还可以部署在任何云上,包括四个GPU及以上的自托管环境。

顶级性能

Mistral表示,Mistral Medium 3的目标是成为一款性能顶尖的模型,尤其是在编码和STEM任务中表现突出,性能直逼那些规模更大、速度更慢的竞争对手。

从Mistral给出的表中可以看出Mistral Medium 3性能已经基本上超越Llama 4 Maverick和GPT-4o,接近Claude Sonnet 3.7以及DeepSeek 3.1的水平。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

人工评估结果

除了学术基准之外,Mistral还公布了第三方人工评估,后者更能代表真实世界的用例。

可以看到,Mistral Medium 3在编码领域表现出色,并且在各个方面都比其他竞争对手提供了更好的性能。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

专为企业级应用打造

Mistral Medium 3在适应企业环境的能力方面优于其他SOTA模型。

在企业面临通过API进行微调,或从零开始自部署并定制模型行为的艰难选择时,Mistral Medium 3提供了一条将智能全面集成到企业系统中的途径。

Mistral还推出了由Mistral Medium 3模型驱动的Le Chat Enterprise,一款面向企业的聊天机器人服务。

它提供了一个AI智能体构建工具,并将Mistral的模型与Gmail、Google Drive和SharePoint等第三方服务整合。

这就可以解决企业面临的AI挑战,如工具碎片化、不安全的知识集成、僵化的模型以及缓慢的投资回报率等,为所有组织工作提供统一的AI平台。

Le Chat Enterprise很快将支持MCP协议,这是Anthropic提出的连接AI与数据系统和软件的标准。

One more thing…

Mistral还在博客中透露,虽然Mistral Small和Mistral Medium都已经发布,但在未来几周内,他们有一个「大」计划,也就是Mistral Large。

他们表示刚发布的Mistral Medium性能已经远胜Llama 4 Maverick等顶尖开源模型,Mistral Large的性能更加值得期待。

网友实测:就这?

号称超越Claude Sonnet 3.7的90%,Medium 3果然有这么强吗?

媒体和网友们立刻展开了实测。

在基于《纽约时报》Connections栏目词汇分类题的评测中,Medium 3处于倒数的位置,几乎找不到它。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

在全新的100题测评中,它在前排模型中也排不上号。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

有人测试Medium 3后表示,它的写作能力还是老样子,没啥进步。不过在LLM评测中,它倒是处在帕累托前沿。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

而Zhu Liang测试后发现,模型在代码编写和文本生成方面表现都很扎实,在这两项评测中都跻身前五。

在简单编码任务(Next.js TODO应用)中:

  • 它生成了简洁明了的回复

  • 评分和Gemini 2.5 Pro、Claude 3.5 Sonnet差不多

  • 逊于DeepSeek V3 (新) 和GPT-4.1

在复杂编码任务(基准测试可视化)中:

  • 产生的平均结果与Gemini 2.5 Pro和DeepSeek V3(新)相似

  • 不如GPT-4.1、o3和Claude 3.7 Sonnet

在写作上:

  • 它的内容覆盖了大部分要点,但格式不正确

  • 评分与DeepSeek V3 (新) 和Claude 3.7 Sonnet相近

  • 不如GPT-4.1和Gemini 2.5 Pro

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

知名大佬「karminski-牙医」实测后发现,它的性能并不像官方吹得那么强。

建议我们不必下载,浪费流量和硬盘空间了。

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

参考资料:

Mistral claims its newest AI model delivers leading performance for the price

https://venturebeat.com/ai/mistral-comes-out-swinging-for-enterprise-ai-customers-with-new-le-chat-enterprise-medium-3-model/

https://mistral.ai/news/mistral-medium-3

内容来源于网络。发布者:科技网btna,转转请注明出处:https://www.btna.cn/7555.html

(0)
科技网btna的头像科技网btna
上一篇 2025年5月8日 下午4:00
下一篇 2025年5月8日 下午4:00

相关推荐

  • 手机行业今年进入7000mAh时代 甚至有8K+80W方案

    近期,有数码博主透露,手机行业正加速进入7000mAh电池时代。据CNMO了解,手机厂商通过电池材料革新与快充技术升级,推动续航体验跨越式发展。这一趋势标志着继2024年6000mAh普及后,智能手机电池容量再度迎来爆发。 7000mAh手机电池 目前来看,电池容量的跃升主要得益于硅碳负极材料的广泛应用。2023年起,硅碳电极含硅量突破6%,解决了传统石墨负…

    2025年3月14日
    31100
  • 诺奖得主Hassabis豪言:AI十年治愈所有疾病!哈佛教授警告AGI终结人类文明

    编辑:桃子 好困 【导读】未来5-10年,AI将改变一切,破解科学难题,治愈所有疾病。这是谷歌DeepMind掌门人Demis Hassabis在最新采访中最大胆的预测。与此同时,哈佛历史学家却警示,AGI到来可能重塑人类文明,成为取代我们的「外星人」。 「未来十年,AI将会治愈所有疾病」。 在最新《60分钟》采访中,谷歌DeepMind首席执行官Demis…

    2025年4月23日
    9600
  • 全球顶尖AI来考公,不会推理全翻车!致命缺陷曝光,被倒数5%人类碾压

    编辑:编辑部 ZJH 【导读】公考行测中的逻辑推理题,是不少考生的噩梦,这次,CMU团队就此为基础,打造了一套逻辑谜题挑战。实测后发现,o1、Gemini-2.5 Pro、Claude-3.7-Sonnet这些顶尖大模型全部惨败!最强的AI正确率也只有57.5%,而人类TOP选手却能接近满分。 就在昨天,OpenAI憋出个大招,放出了o3和o4-mini。 …

    2025年4月18日
    17400
  • 全网惊了!陶哲轩带AI下场,33分钟「盲证」数学

    编辑:桃子 KingHZ 【导读】菲尔兹奖得主陶哲轩再放大招,仅数天时间,开源的概念验证工具借助Copilot迭代至2.0版本。而在最新视频中,他甚至用AI在33分钟「盲做」形式化一页证明,效率惊人。 数学大神陶哲轩携手ChatGPT,打造了开源项目——数学概念验证工具,专攻任意正参数的不等式证明。 没想到,才几天的时间,这款工具迎来2.0版本惊艳升级! 它…

    智能 2025年5月11日
    20700
  • 「消失的」Ilya Sutskever

    编辑:定慧 好困 【导读】Ilya Sutskever,曾亲手缔造OpenAI的联合创始人,仿佛人间蒸发一般,只留下一家没有产品、没有收入、却估值高达300亿美元的公司Safe Superintelligence。当Altman在忙着打官司、重组OpenAI时,Ilya选择了「消失」,也许只为等待那个值得他出手的「超级智能」。 2025年的5月,Sam Al…

    2025年5月8日
    6000

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信