您的当前位置:首页 > 百科 > 全球权威评测榜单BIRD:蚂蚁数科超越谷歌等公司位居第一 正文
时间:2026-10-03 00:12:34 来源:网络整理 编辑:百科
9月26日,据全球权威评测基准BIRD-Bech官网,蚂蚁数科的数据分析智能体Agentar-SQL超越AT&T美国电话电报公司)、谷歌云、腾讯云、阿里云等诸多国内外厂商,位居全球第一。这也是
9月26日,全球权威据全球权威评测基准BIRD-Bech官网,评测蚂蚁数科的榜单数据分析智能体Agentar-SQL超越AT&T(美国电话电报公司)、谷歌云、蚂蚁腾讯云、数科司位阿里云等诸多国内外厂商,谷歌位居全球第一。居第这也是全球权威中国公司在该榜单上取得的最高成绩。

BIRD-Bench是公认的全球最具权威性的自然语言转SQL评测基准,要求AI大模型将自然语言查询转换为结构化查询语言(SQL),榜单并且在真实复杂的蚂蚁大规模生产级数据库中稳定执行。BIRD--Bench数据集覆盖金融、数科司位电力、谷歌医疗等37个行业场景,居第总量33GB,全球权威包含超过1万条高复杂度查询任务,是全球顶级AI团队展示技术实力的权威平台。
值得一提的是,蚂蚁数科Agentar-SQL在BIRD榜单的执行准确率排行榜(81.67分)以及执行效率榜上(77分)上均取得第一的成绩。这意味着蚂蚁数科在智能问数领域的技术创新实现全球领先。
据介绍,Agentar-SQL智能体基于蚂蚁数科的SQL大模型Agentar-Scale-SQL构建,旨在让用户可以通过自然语言轻松完成复杂的数据查询任务。它通过GSPO(组序列策略优化)强化学习训练方法,能够增强SQL内在推理,让大模型在推理阶段,深度思考SQL框架,避免潜在的逻辑错误,提升SQL逻辑准确性;此外,Agentar-SQL具备多轮反思修正的能力,让模型对生成的SQL进行多轮次的审视和修正,提升SQL语言的精准性;Agentar-SQL还通过独创的两阶段生成法,让大模型生成多个SQL候选,再对SQL进行两两PK的“锦标赛”,筛选出最优的SQL。
蚂蚁数科持续深耕AI大模型技术与应用,此前其自研的金融推理大模型Agentar-Fin-R1,在多项主流金融基准测试实现领先。专为新能源行业定制的能源电力垂类时序大模型在行业评测集上的发电量预测准确率超越谷歌(TimesFM-V2.0)、亚马逊(Chronos-Large)等行业主流的通用时序模型。
汽车做玻璃镀膜有用吗 汽车玻璃镀晶镀花了怎么办,行业资讯2026-10-03 00:10
徐工:卷油耗?G2没在怕的!这份“节油王”榜单,看看有你认识的吗?2026-10-02 23:53
2026年泉州市海内外中小学生灯谜大会落幕2026-10-02 23:53
石头G30S Pro正式发布:首创底盘升降3.0AI轮足系统2026-10-02 23:19
守护创新火种 点亮“知产”明灯_2026-10-02 22:56
苹果iPhone Fold折叠屏开始试产 12月全球开售2026-10-02 22:32
厦门鼓浪屿“猫头鹰楼”新春焕新迎客2026-10-02 21:38
前三季度我国机器人产量已超去年全年2026-10-02 21:37
玻璃沾到的油漆要怎么除 玻璃表面怎样喷漆更牢固,行业资讯2026-10-02 21:26
焦点快报!事事关心2026-10-02 21:26
豆包推出专业版,能成为你的「工作搭子」吗?2026-10-03 00:11
今年春节 厦门岛外这些地方可放烟花2026-10-02 23:14
中国消费市场趋势年度观察(三):中国消费的问题与对策2026-10-02 23:12
春节假期 厦门“菜篮子”稳稳的2026-10-02 23:07
张展硕泛太平洋游泳锦标赛200米自由泳摘铜2026-10-02 22:42
“最忙”春运启动 高速行车需谨慎2026-10-02 22:32
全国一线城市房租价格被曝普涨 郑州基本维持原状2026-10-02 22:19
室内圆柱子装修效果图片2026-10-02 22:00
担心影响观众心理 《无声之物》预告被BAFTA撤下2026-10-02 21:51
长9米宽3米房间装修图2026-10-02 21:48