分享好友 最新动态首页 最新动态分类 切换频道
GPT-4单项仅得7.1分,揭露大模型代码能力三大短板,最新基准测试来了
2024-12-26 15:58
DevBench团队 投稿
量子位 | 公众号 QbitAI

首个AI软件工程师Devin正式亮相,立即引爆了整个技术界。

GPT-4单项仅得7.1分,揭露大模型代码能力三大短板,最新基准测试来了

Devin不仅能够轻松解决编码任务,更可以自主完成软件开发的整个周期——从项目规划到部署,涵盖但不限于构建网站、自主寻找并修复 BUG、训练以及微调AI模型等。

这种 “强到逆天” 的软件开发能力,让一众码农纷纷绝望,直呼“程序员的末日真来了?”

在一众测试成绩中,Devin在SWE-Bench基准测试中的表现尤为引人注目。

SWE-Bench是一个评估AI软件工程能力的测试,重点考察大模型解决实际 GitHub 问题的能力。

Devin以独立解决13.86%的问题率高居榜首,“秒杀”了GPT-4仅有的 1.74%得分,将一众AI大模型远远甩在后面。

这强大的性能让人不禁浮想联翩“未来的软件开发中,AI将扮演怎样的角色?”

上海人工智能实验室联合字节跳动SE Lab的研究人员以及SWE-Bench团队,提出了一个新测试基准DevBench,首次揭秘大模型在多大程度上可以从PRD出发完成一个完整项目的设计、开发、测试

具体地说,DevBench首次对大模型进行了从产品需求文档(PRD)到完整项目开发各阶段表现的评测,包括软件设计、依赖环境搭建、代码库级别代码生成、集成测试和单元测试。

实验证明,DevBench可以揭露GPT、CodeLlama、DeepSeek-Coder 等大语言模型在软件研发不同阶段的能力短板,如面向对象编程能力不足无法编写较为复杂的构建脚本(build script,以及函数调用参数不匹配等问题。

大语言模型距离可以独立完成一个中小规模的软件项目开发还有一段路要走。

传统的编程基准测试往往关注代码生成的某个单一方面,无法全面反映现实世界编程任务的复杂性。

DevBench的出现,打破了这一局限,它通过一系列精心设计的任务,模拟软件开发的各个阶段,从而提供了一个全面评估LLM能力的平台。

DevBench围绕五个关键任务构建,每个任务都关注软件开发生命周期的一个关键阶段,模块化的设计允许对每个任务进行独立的测试和评估。

软件设计利用产品需求文档PRD创建UML图和架构设计,展示类、属性、关系,以及软件的结构布局。该任务参考MT-Bench,采用LLM-as-a-Judge的评测方式。评测主要依据两个主要指标:软件设计一般原则(如高内聚低耦合等)和忠实度(faithfulness)。

环境设置根据提供的需求文档,生成初始化开发环境所需的依赖文件。在评测过程中,该依赖文件将在给定的基础隔离环境(docker container)内通过基准指令进行依赖环境搭建。随后在这个模型搭建的依赖环境中,该任务通过执行代码仓的基准示例使用代码(example usage,评估执行基准代码的成功率。

代码实现依据需求文档和架构设计,模型需要完成整个代码库的代码文件生成。DevBench开发了一个自动化测试框架,并针对所使用的具体编程语言进行了定制,集成了Python的PyTest、C++的GTest、Java的JUnit和JavaScript的Jest。该任务评估模型生成代码库在基准环境中执行基准集成测试和单元测试的通过率。

集成测试模型根据需求,生成集成测试代码,验证代码库的对外接口功能。该任务在基准实现代码上运行生成的集成测试,并报告测试的通过率。

单元测试模型根据需求,生成单元测试代码。同样,该任务在基准实现代码上运行生成的单元测试。除了通过率指标外,该任务还引入了语句覆盖率评价指标,对测试全面性的进行定量评估。

DevBench数据准备过程包括三个阶段:仓库准备、代码清理和文档准备。

  • 在准备阶段,研究人员从GitHub中选择高质量的仓库,确保它们的复杂性可管理。

  • 在代码清理阶段,标注人员验证代码的功能性,对其进行精炼,并补充和运行测试以确保质量。

  • 文档准备阶段涉及为仓库创建需求文档、 UML图和架构设计。

最终,DevBench的数据集包含4个编程语言,多个领域,共22个代码库。这些代码仓库的复杂性和所使用编程范式的多样性为语言模型设置了巨大的挑战。

几个有趣的例子

TextCNN

大模型能完整地写一个TextCNN做文本二分类的模型吗?能够自己把数据集从HF拉下来,把训练跑起来是基本要求。还需模型按照文档的需求定制超参数、记录log、存储checkpoint、同时保证实验可复现性。

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/python/TextCNN

Registration & Login

前端项目往往依赖较多的组件库和前端框架,模型是否能够在可能出现版本冲突的前端项目中应对自如

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/javascript/login-registration

People Management

模型对SQLite数据库的创建和管理掌握的怎么样?除了基本的增删改查操作,模型能否将校园人员信息和关系数据库的管理和操作封装成易用的命令行工具

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/cpp/people_management

Actor Relationship Game

“六度分隔理论”在影视圈的猜想验证?模型需要从TMDB API获取数据,并构建流行演员们之间通过合作电影进行连接的人际连系网。

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/java/Actor_relationship_game)

ArXiv digest

ArXiv论文检索小工具也被轻松拿捏了?ArXiv的API并不支持“筛选最近N天的论文”的功能,但却可以“按发表时间排序”,模型能够以此开发一个好用的论文查找工具吗

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/python/ArXiv_digest)

研究团队利用DevBench对当前流行的LLMs,包括GPT-4-Turbo进行了全面测试。结果显示,尽管这些模型在简单的编程任务中表现出色,但在面对复杂的、真实世界的软件开发挑战时,它们仍然遇到了重大困难。特别是在处理复杂的代码结构和逻辑时,模型的性能还有待提高。

DevBench不仅揭示了现有LLMs在软件开发中的局限性,也为未来模型的改进提供了宝贵的洞见。通过这一基准测试,研究人员可以更好地理解 LLMs的强项和弱点,从而有针对性地优化它们,推动AI在软件工程领域的进一步发展。

此外,DevBench 框架的开放性和可扩展性意味着它可以持续适配不同的编程语言和开发场景。DevBench 还在发展过程中,非常欢迎社区的朋友参与共建。

Devin 在 SWE-Bench 上一路领先,它的优异表现可以扩展到其他评测场景吗?随着 AI 软件开发能力的持续发展,这场码农和 AI 的较量让人倍感期待。

DevBench现已加入OpenCompass司南大模型能力评测体系,OpenCompass是上海人工智能实验室研发推出的面向大语言模型、多模态大模型等各类模型的一站式评测平台。

OpenCompass具有可复现、全面的能力维度、丰富的模型支持、分布式高效评测、多样化评测范式以及灵活化拓展等特点。基于高质量、多层次的能力体系和工具链,OpenCompass 创新了多项能力评测方法,支持各类高质量的中英文双语评测基准,涵盖语言与理解、常识与逻辑推理、数学计算与应用、多编程语言代码能力、智能体、创作与对话等多个方面,能够实现对大模型真实能力的全面诊断。DevBench更是拓宽了 OpenCompass 在智能体领域的评测能力。

DevBench论文:https://arxiv.org/abs/2403.08604
GitHub:https://github.com/open-compass/devBench/
OpenCompass https://github.com/open-compass/opencompass

评选报名即将截止

2024年值得关注的AIGC企业&产品

中国AIGC产业峰会「你好,新应用!」已开启报名点击报名参会 同时,峰会将进行线上直播 ⬇️

最新文章
非常有用的搜索引擎提交入口汇总
网站建设完成之后,第一件事情就是向各大搜索引擎提交新网站。文中收集了常见的搜索引擎提交入口地址,方便以后查询使用。  常用的中文搜索引擎提交入口  提交之后可通过“site:域名”的方式查看收录情况,比如site&
邀世界见证强农兴农新武器,北京数字农业与灌溉展全球首发新技术新产
  2025年3月31日-4月2日,润景智灌阀·第11届北京国际数字农业与灌溉技术博览会暨世界灌溉科技大会,将于北京·国家会议中心举行。展会面积达3万平方米,届时来自国内外800余家知名展商齐聚大会。同期举办第三届北京国际水利科技博览会。
百度广告位搜索词_百度广告搜索关键词大全
赢在广告少!必应取代百度成国内桌面搜索引擎第一可能的原因应该是微软必应在搜索结果展示页面上,会尽量减少广告的数量和干扰,只展示与用户搜索意图最相关的信息。此外,必应还会对搜索结果进行严格的质量和可信度审核,过滤掉那些虚假、
管理信息系统复习总结(保姆级)
1.管理信息系统的新变化: 信息技术创新新的业务模式电子商务扩张管理变革公司和组织变革 2.信息系统如何改变企业: ①新兴移动数字平台 ②利用信息系统来改善客户体验,相应客户需求,降低库存 ③在线报纸的读者人数在不
高清美女写真生成利器:探索搜狐简单AI的魅力与使用攻略
在当今这个数字化的时代,生成超逼真的美女写真不再是只有专业摄影师能够做到的事情。想象一下,急需一张高质量的美女写真,却又不想花费时间去寻找模特与拍摄场地,那么你可能会好奇,有没有什么简单又高效的工具可以助手你。其实,答案就
高清Windows免费版网站存在吗?如何安全获取并使用?
随着科技的不断发展,许多用户对于Windows操作系统的需求也日益增长。但有些人可能希望在网站上寻找高清的Windows免费版,以节省购买成本。那么,这样的网站真的存在吗?如何安全获取并使用呢?接下来将为你一一解答。目前网络上确实存在一
观察 | 内购流水2.5亿,这家北京厂商真的一发就爆
编译 | 手游那点事 | 欧苟12月3日,海彼的休闲新作《冒险者日记》正式在国内上线。该游戏将休闲玩法及RPG要素结合起来,以文字冒险的形式进行呈现,在游戏中,玩家将扮演一只水豚,与其他动物伙伴一起踏上冒险的旅途。截至目前,游戏稳居国
直通车关键词推广添加关键词_直通车关键词推广怎么设置关键词
ˋ^ˊ 拼多多直通车应该怎么开在所有的电商平台里就属拼多多的直通车最简单了。简单到什么程度呢?这样说吧,我刚把关键词自定义玩会,他就给我整下线了,留下我一个人在风中凌乱。好歹自定义还有点技术含量,你把这个砍掉了,未来只留一
网友亲身经历!恒泰福彩App是做任务诈骗软件!被骗提现不了怎么办
恒泰福彩App是做任务诈骗软件!被骗提现不了怎么办技术出嘿《溦:9836356》(一)希望阅读此文的读者能够及时采取措施以减少损失;请及时与团队联系提供解决方案(文章下面图片有咨询方式)若想追回损失资产,务必仔细阅读以下内容。【JFHHERYE
骶骨骨折司法鉴定等级是几级,能享受什么待遇
  一、申请仲裁时效  劳动争议申请仲裁的时效期间为一年。仲裁时效期间从当事人知道或者应当知道其权利被侵害之日起计算。  二、申请仲裁提交的材料  (一)申请人是劳动者的,请提交下列材料:  (1)《劳动仲裁申请书》(详细陈述申
相关文章
推荐文章
发表评论
0评