百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

谷歌首款混合推理Gemini 2.5登场,成本暴降600%,思考模式一开,直追o4-mini

zhezhongyun 2025-04-24 10:33 6 浏览

刚刚,谷歌重磅发布首个混合推理模型——Gemini 2.5 Flash。

与Claude类似,新模型的「思考预算」可以自定义,即可开启/关闭Gemini 2.5的思考模式。

值得一提的是,关闭思考的成本直接暴降600%,而且性能还不输Gemini 2.0 Flash。

具体来说,Gemini 2.5 Flash关闭思考输出价格0.6美元/百万token,开启思考输出价格3.5美元/百万token。

当然了,思考越久,模型性能也会随之提升。

在GPQA知识问答中,新模型24k思考预算,性能提升了6%;对于代码任务(LiveCodeBench),16k思考预算性能最佳。

在多项基准测试中,Gemini 2.5 Flash再次刷新SOTA。在大模型排行榜中,Flash预览版以1392 ELO高分位居第二,与GPT-4.5-preview、Grok 3并驾齐驱。

在数学(AIME 2025/2024)、多模态推理(MMMU)、知识问答(GPQA)等基准上,Gemini 2.5 Flash完全碾压Claude 3.7 Sonnet,足以与最新o4-mini相媲美。

就模型每百万token输入/输出价格来看,Gemini 2.5 Flash更具性价比。

在人类最后一次考试中,Gemini 2.5 Flash拿下12.1%高分,仅次于o4-mini

目前,Flash预览版可以在Gemini中使用,API同时向开发者开放。

首款混合推理Gemini登场

击败Claude 3.7

混合推理模型,就是专为需要在性能、成本、延迟之间找到完美平衡的开发者而设计。

Gemini 2.5 Flash不仅继承了2.0 Flash的高速响应特点,还引入了革命性的「思考模式」——可根据任务需求灵活调整推理深度。

Gemini 2.5系是「思考模型」,能够在回答前先行推理。

模型不会立即输出结果,而是先执行「思考」流程,更好地理解提示词,拆解复杂任务并规划回答。

如下图所示,相较于2.0 Flash,Gemini 2.5 Flash在复杂任务,如数学推理、科研分析中表现更优异。

在LMArena其他评估中,比如Hard Prompts、编码、长查询,Gemini 2.5 Flash全部拿下第一。

另外从下图中可看出,在同类模型中,2.5 Flash以超高性价比领跑,兼具最优性能和极低成本的优势。

网友实测

在网友的实测中,2.5 Flash物理模拟能力足够惊艳,小球会随着多边形变化精准运动。

而且,2.5 Flash还轻轻松松通过了4o-mini/o3无法通过的Galton Board(高尔顿板)测试。

它还能根据精灵图,创建出自定义游戏城房间。

另一位网友用了最大24k预算,让2.5 Flash设计出了一个《创:战纪》风格的游戏。

提示:Create Design a visually striking Tron-style game in a single HTML file, where AI-controlled light cycles compete in fast-paced, strategic battles against each other

如今Claude 3.7已经完全没有优势了,在设计登录界面时,Gemini 2.5 Flash用时最短速度最快。

思考预算

智能控制

不同使用场景在质量、成本与延迟之间各有取舍。

为给开发者更大灵活性,2.5 Flash新增了「思考预算」功能。开发者可以通过设置预算(0 – 24576 Token),来控制模型在思考阶段的推理深度。

低预算(甚至为0):适合简单查询,保持2.0 Flash超低延迟和成本,性能更强

高预算:模型会进行更深入的推理,生成更准确、全面的答案。

需要强调的是,预算只是设定了2.5 Flash的思考上限;若prompt并不复杂,模型不会用满全部预算。

开发者也可通过API参数,或在Google AI Studio与Vertex AI控制台的滑块控件,为思考阶段指定具体的Token预算

更智能的是,模型会根据prompt复杂度,自动判断所需推理量和思考时间,避免了预算的浪费。

以下示例中,展示了2.5 Flash在默认模式下,可能使用的推理量。

· 需要低推理量的提示词:

示例1:

「Thank you」的西班牙语表达

示例2:

加拿大有多少个省?

· 需要中等推理量的提示词:

示例1:

掷两枚骰子,点数之和为7的概率是多少?

示例2:

我的健身房在周一、三、五9-15点以及周二、周六14-20点开放篮球自由场地。如果我每周工作5天、时间为9-18点,但想在工作日打5小时篮球,请为我制定一份可行的日程表。

· 需要高推理量的提示词:

示例1:

一根悬臂梁,长度L=3 m,矩形截面宽b=0.1 m、高h=0.2 m,材质钢 (E=200 GPa)。梁全长受均布载荷w=5 kN/m,且自由端承受集中载荷P=10 kN。请计算最大弯曲应力σ_max。

示例 2:

编写函数evaluate_cells(cells: Dict[str, str]) -> Dict[str, float],用于计算电子表格单元格的数值。

每个单元格的内容可能为:

· 一个数字(如 「3」),或

· 一个公式,例如「=A1 + B1 * 2」,可使用「+、-、*、/」运算符并引用其他单元格。

要求:

1. 解析并解决单元格间的依赖关系。

2. 处理运算符优先级(*/高于+-)。

3. 检测循环依赖并抛出 ValueError("Cycle detected at

4. 不得使用eval,只可使用Python内置库。

Gemini 2.5 Flash正式上线

当前,Gemini 2.5 Flash预览版API在Google AI Studio和Vertex AI中上线,可通过Gemini应用专用下拉菜单找到它。

谷歌强烈建议尝试thinking_budget(思考预算)参数,看看可控推理如何去解决更复杂的问题。

参考资料:

https://developers.googleblog.com/en/start-building-with-gemini-25-flash/

本文来自微信公众号“新智元”,作者:新智元,编辑:桃子 好困,36氪经授权发布。

相关推荐

JPA实体类注解,看这篇就全会了

基本注解@Entity标注于实体类声明语句之前,指出该Java类为实体类,将映射到指定的数据库表。name(可选):实体名称。缺省为实体类的非限定名称。该名称用于引用查询中的实体。不与@Tab...

Dify教程02 - Dify+Deepseek零代码赋能,普通人也能开发AI应用

开始今天的教程之前,先解决昨天遇到的一个问题,docker安装Dify的时候有个报错,进入Dify面板的时候会出现“InternalServerError”的提示,log日志报错:S3_USE_A...

用离散标记重塑人体姿态:VQ-VAE实现关键点组合关系编码

在人体姿态估计领域,传统方法通常将关键点作为基本处理单元,这些关键点在人体骨架结构上代表关节位置(如肘部、膝盖和头部)的空间坐标。现有模型对这些关键点的预测主要采用两种范式:直接通过坐标回归或间接通过...

B 客户端流RPC (clientstream Client Stream)

客户端编写一系列消息并将其发送到服务器,同样使用提供的流。一旦客户端写完消息,它就等待服务器读取消息并返回响应gRPC再次保证了单个RPC调用中的消息排序在客户端流RPC模式中,客户端会发送多个请...

我的模型我做主02——训练自己的大模型:简易入门指南

模型训练往往需要较高的配置,为了满足友友们的好奇心,这里我们不要内存,不要gpu,用最简单的方式,让大家感受一下什么是模型训练。基于你的硬件配置,我们可以设计一个完全在CPU上运行的简易模型训练方案。...

开源项目MessageNest打造个性化消息推送平台多种通知方式

今天介绍一个开源项目,MessageNest-可以打造个性化消息推送平台,整合邮件、钉钉、企业微信等多种通知方式。定制你的消息,让通知方式更灵活多样。开源地址:https://github.c...

使用投机规则API加快页面加载速度

当今的网络用户要求快速导航,从一个页面移动到另一个页面时应尽量减少延迟。投机规则应用程序接口(SpeculationRulesAPI)的出现改变了网络应用程序接口(WebAPI)领域的游戏规则。...

JSONP安全攻防技术

关于JSONPJSONP全称是JSONwithPadding,是基于JSON格式的为解决跨域请求资源而产生的解决方案。它的基本原理是利用HTML的元素标签,远程调用JSON文件来实现数据传递。如果...

大数据Doris(六):编译 Doris遇到的问题

编译Doris遇到的问题一、js_generator.cc:(.text+0xfc3c):undefinedreferenceto`well_known_types_js’查找Doris...

网页内嵌PDF获取的办法

最近女王大人为了通过某认证考试,交了2000RMB,官方居然没有给线下教材资料,直接给的是在线教材,教材是PDF的但是是内嵌在网页内,可惜却没有给具体的PDF地址,无法下载,看到女王大人一点点的截图保...

印度女孩被邻居家客人性骚扰,父亲上门警告,反被围殴致死

微信的规则进行了调整希望大家看完故事多点“在看”,喜欢的话也点个分享和赞这样事儿君的推送才能继续出现在你的订阅列表里才能继续跟大家分享每个开怀大笑或拍案惊奇的好故事啦~话说只要稍微关注新闻的人,应该...

下周重要财经数据日程一览 (1229-0103)

下周焦点全球制造业PMI美国消费者信心指数美国首申失业救济人数值得注意的是,下周一希腊还将举行第三轮总统选举需要谷歌日历同步及部分智能手机(安卓,iPhone)同步日历功能的朋友请点击此链接,数据公布...

PyTorch 深度学习实战(38):注意力机制全面解析

在上一篇文章中,我们探讨了分布式训练实战。本文将深入解析注意力机制的完整发展历程,从最初的Seq2Seq模型到革命性的Transformer架构。我们将使用PyTorch实现2个关键阶段的注意力机制变...

聊聊Spring AI的EmbeddingModel

序本文主要研究一下SpringAI的EmbeddingModelEmbeddingModelspring-ai-core/src/main/java/org/springframework/ai/e...

前端分享-少年了解过iframe么

iframe就像是HTML的「内嵌画布」,允许在页面中加载独立网页,如同在画布上叠加另一幅动态画卷。核心特性包括:独立上下文:每个iframe都拥有独立的DOM/CSS/JS环境(类似浏...