当前位置:   article > 正文

再见了!程序员

再见了!程序员

你好,我是坚持分享干货的 EarlGrey,翻译出版过《Python编程无师自通》、《Python并行计算手册》等技术书籍。

如果我的分享对你有帮助,请关注我,一起向上进击。

3f51a4c963f48488558aa30644f8ec42.jpeg

来源:量子位

首个AI程序员Devin,现身明星创业公司内部群。

为解决一个技术问题,Devin借用了其创造者的账号,与客户公司的CTO交流,并根据回复调整了代码方案。

对话之专业,围观者看了直呼这个世界太疯狂。

a0f5e732484adcdba999077157c04d4e.png

事情发生在办公软件Slack,截图中的akshat是AI基础设施创业公司Modal LabsCTO Akshat Bubna

Modal Labs也是Devin开发商Cognition的首批客户之一。

此时Devin正披着他的创造者之一、IOI金牌得主Steven Hao的马甲。

91042c965070a44c7315d28d2848da32.png

对话的开始,AI程序员Devin正在询问有关Modal Lab平台的密钥的生命周期问题,特别是密钥更新后传播到正在运行的应用程序所需的时间。

Devin表示自己已经查阅了文档,包括密钥和环境变量指南、CLI命令参考、API参考以及容器生命周期钩子和参数,但依旧没有找到关于密钥传播时间的明确信息

Devin询问了更新的密钥通常需要多长时间才能被运行中的应用程序使用,因为这对于他们的运营至关重要,了解这一点将有助于管理他们的部署流程

3a7a777b6057c975c2d87eb62c4871ef.png

人类CTO解释说,当密钥更新时,他们不会使已经运行的Modal容器失效,但是新启动的容器将会读取更新后的值。

Devin对此表示感谢,并决定暂时采用手动方法来管理Modal中的密钥,即在需要时调用modal deploy命令来触发相关应用程序容器的重启

aa68e639cc69288c803201832076700d.png

看完整个过程后,同样是AI创业者的Raunak Chowdhuri评价到:

发现问题、创建工单、调整代码,最好的人类开发者就是这么工作的。

a38029c5640dee41f6af323c261ac267.png

Devin更多实测结果

拿到Devin早期测试资格的人和公司并不多,不过还是陆陆续续有人晒出实测结果。

热衷AI的沃顿商学院教授Ethan Molick试过后,认为其新颖的实时交互方式是最值得关注的。

您可以随时与它“交谈”,就像与人交谈一样,它会在后台不断地执行和调试您的想法。

3cb19420f80fce4fa08f0519c1569645.gif

在测试中,Ethan Mollick要求Devin开发一个解释“创业公司融资中的股权稀释”的网站。

不过他透露,AI还无法在没有任何帮助的情况下,自主且无差错地完成这项工作。

要想把一个重大项目交给人工智能来完成,还有很长的路要走,但这仍然是一个令人着迷的开始。

4a54247fb9497e35aa2bf2a9aab35b2e.png

另一位晒出测试过程的创业者Mckay Wrigley更激动一些。

94f8f9bf30310de786a208fd16083f57.png

在他晒出的27分钟测试中,只发了一个GitHub连接,让Devin部署来自开源项目的代码。

2f93b202386cd2db75c4db140072d991.png

Devin自主把任务拆解成一系列子步骤,并一步步开始执行。

c1bd895f8a2db35082dbb7abee636353.png

执行过程中,Devin在安装Supabase数据库时遇到了障碍,自己打开了对应的Github仓库开始查阅文档……

9f1f1795336e511abc8849986901d355.png

从后续终端反馈中可以看出,Devin查到了运行Supabase所需的各种端口和密匙都应该填什么。

(装过的都知道,雀食挺麻烦……)

7bbcfb9dfd791ae5bcfada548096c730.png

与此同时,Devin还在根据实际情况不断修改自己的后续计划

cbd895d9262bc261a5eaf68c96f69cea.png

一段时间过后,一个本地的聊天机器人程序就跑起来了。

79278698aa0de15b39762f687f1d1906.png

测试一段时间后Mckay Wrigley认为,Devin已经可以算Agent的ChatGPT时刻。

8702399a6e6bd379c367a82ffd768df9.png

复现Devin计划ing

Devin这边大伙还在接连测试,另一边开源“复现”方案也在进行中……

这不,GitHub三万Star项目MetaGPT就上新了“开源版Devin”

1fe3f8adc173543560c53db329c84e0d.png

名为数据解释器(Data Interpreter):

90e5f0a07489818f9b2c5af59e360a99.png

同Devin一样,Data Interpreter也能实现自主编程,能迭代式观察数据,预测分析病情进展、机器运行状态;还能构建机器学习模型、进行数学推理、自动回复电子邮件、仿写网站……

比如从英伟达股价数据中分析收盘价格趋势:

2e6bd444700aae0450ee0f76ab2bc3b2.gif

分析数据预测葡萄酒质量:

66fdace75d24790c1b6959fc6629ba38.gif

除此以外,阿里Qwen成员Binyan Hui等人开启了OpenDevin项目,刚刚起步已获得1.2k Star。

79cdaf9eb40602da37ecb890bec82a96.png

Binyan Hui发推文表示,已有一个初步的路线图和一群优秀的人在努力工作,在很短的时间内就完成了前端原型。

同时项目团队也在招新成员:

e197326d9168502be3c85e23136fd27b.png

另外,还一个名为Maisa AI的团队推出了Maisa KPU(Knowledge Processing Unit),被网友认为与Devin有一些竞争。

a6908998d079dbe140480c5d3cb2aa4a.png

目前Maisa KPU处于测试阶段,它可以解决复杂问题和推理,团队发布的基准测试结果如下:

275856abbc6d5714336699671f5177d8.png

根据demo展示,KPU可以成为“智能客服”,在客户没有正确写好订单号的情况下,帮助客户解决订单未送达的问题:

3a47d9dd49ad7e29b71f7ac6c1e801ec.gif

Devin基准测试技术报告发布

最近,Devin创始团队Cognition还发布关于SWE-bench测试的技术报告。

除了之前已公布的测试结果之外,团队还透露了一些新消息。

677349c1f101b01de832545efcd22c68.png

比如,Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功地为大型、复杂的代码库贡献代码。

选择在SWE-bench上端到端运行智能体,也是考虑了它更接近现实世界的软件开发。

此外,研发团队还透露,为了防止Devin在测试中作弊,比如查找外部的pull requests信息,测试已做相关设置,确保Devin无法访问相关信息,并且在此过程中也已人工手动检查了Devin运行情况。

d070069f66d06a7519f755d7ecbea506.png

最后团队强调Devin仍处于起步阶段,还有很大改进空间:

69abb8f9e86974aa882b30369a07759d.png

更多细节感兴趣的家人们可查看报告详情。

Devin发布不到一周,网友们的讨论已十分热烈。

比如,这位大兄弟表示自己一年前担心的事儿终究还是发生了。

以后Stack Overflow上都是各种Devin在提问,人,就只能被挤出去(Stack Overflow危!!!):

820b622369ead781e816702bf5cfa92b.png

有网友回应(手动狗头):

它们可以互相回答问题。

84773441f32ab3c2adc4593551f4c9e0.png

还有网友发现Devin背后团队Cognition正在招全职软件工程师,于是缓缓打出一个问号:

Devin不是应该填补这些职位空缺来为他们省钱吗?

635a73e3871ab8c79d7d1f350dd4a53e.png

最后,若Devin公开你会想用它干点啥?

参考链接:
[1]https://www.cognition-labs.com/post/swe-bench-technical-report
[2]https://x.com/raunakdoesdev/status/1769066769786757375
[3]https://twitter.com/emollick/status/1768742585122558063
[4]https://x.com/mckaywrigley/status/1767985840448516343
[5]https://x.com/maisaAI_/status/1768657114669429103?s=20

- EOF -

文章已经看到这了,别忘了在右下角点个“赞”和“在看”鼓励哦~

推荐阅读  点击标题可跳转

1、Python 项目工程化最佳实践

2、Python 可以比 C 还要快!

3、streamlit,一个超强的 Python 库

4、豆瓣8.9分的C++经典之作,免费送!

5、Python 3.12 版本有什么变化?

回复下方「关键词」,获取优质资源

回复关键词「 pybook03」,领取进击的Grey与小伙伴一起翻译的《Think Python 2e》电子版

回复关键词「书单02」,领取进击的Grey整理的 10 本 Python 入门书的电子版

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/小小林熬夜学编程/article/detail/425096
推荐阅读
相关标签