亚图小说网
首页 > 都市言情 > 重生2010:开局做空棉花期货 >

第417章 “女娲时刻”降临,美股惨遭血洗!(万字)

章节目录

  尽管女娲1.0伴随着无数的质疑和非议,全世界仍有成百上千万的用户排队等待测试这个人类历史上第一个拥有“智能”的生成式大模型。

  有人等了几个小时,进去以后只问了一句“在吗”,还有人拿出早就准备好的问题,一口气往对话框里塞了几千字。

  普通用户大多图个新鲜,真正把女娲当成测试对象的,是各个平台上的技术爱好者。

  国内最先火起来的是一个名叫“小杨写代码”的博主。

  他原本是杭城一家互联网公司的高级工程师,在论坛里混了很多年,平时专门评测各种开发工具。

  女娲上线前,他就在微博上发过预告,说要准备一套完整测试。

  有人问他打算测什么,他只回了一句:“先看看这东西到底会不会写代码。”

  4月2号凌晨,小杨总算排进了免费通道。

  他先让女娲用C语言写一个简单的学生成绩管理程序,要求支持录入、查询、修改和删除,数据还要保存到本地文件。

  这个题目不算难,大学计算机专业的学生花上半天也能写出来。

  女娲用了十几秒便给出完整代码,还顺手把程序拆成了数据结构、文件读写和菜单交互三个模块,代码末尾附着一段说明,提醒用户输入学生姓名时要限制长度,否则可能出现缓冲区溢出。

  小杨把代码贴进编辑器,编译一次通过。

  他随后故意输入超长字符串,程序没有崩溃,女娲提前加上的长度检查确实起了作用。

  小杨有点不服气,又把需求改得复杂了一些。

  “改成多线程服务器,支持多个客户端同时查询,通信协议你自己设计,要求兼容Linux和Windows。”

  女娲没有马上给代码,而是先问了他几个问题。

  “预计同时在线人数是多少?”

  “是否需要身份认证?”

  “服务端数据由单机文件保存,还是允许使用数据库?”

  小杨看到这几个问题,坐在电脑前愣了一会儿。

  以前他试过不少自动编程工具,那些工具拿到需求就开始堆代码,很少会反过来确认使用场景。

  他故意回道:“你自己决定,按一个小型学校管理系统来做。”

  女娲很快给出方案,建议采用TCP长连接、线程池和SQLite数据库,同时将协议设计为带长度头的JSON消息格式。

  代码比较长,女娲分成了服务端、客户端和公共协议三个部分。

  小杨一边复制一边检查,很快发现客户端重连逻辑里有个小问题,他没有直接指出错误,只说:“网络断开以后偶尔连不上,你查一下。”

  女娲重新检查代码,很快定位到套接字关闭后状态没有完全重置。

  它没有把全部代码再贴一遍,只给出需要修改的函数和原因,还补了一段重连次数限制,避免网络异常时程序无限循环。

  小杨继续找麻烦。

  他把一段自己以前写的烂代码贴了进去,里面混着内存泄漏、数组越界、重复锁和一个很隐蔽的死锁。

  “这段程序跑久了会卡死,帮我看看。”

  女娲先指出数组下标可能越界,又发现两处没有释放的内存,最后顺着加锁顺序找到了死锁。

  最让小杨意外的是,女娲没有只说“锁的顺序不一致”,还画出了一条文字版的等待关系!

  线程A持有用户锁,等待日志锁;

  线程B持有日志锁,等待用户锁。

  两个线程互相等着,程序自然会卡住。

  女娲给出的修改方案也很直接,统一加锁顺序,或者使用一次性获取多把锁的封装函数。

  小杨把修改应用到程序里,跑了半个小时的压力测试,再也没有出现卡死。

  凌晨3点多,他发出第一篇长微博:

  “我原本想找女娲的笑话,结果它先把我两年前写的代码骂了一遍!”

  微博下面附着完整测试记录,连女娲犯过的那个重连错误也没有删。

  最开始只有一些程序员关注,很快便有人把测试转到了几个技术论坛。

  “编译通过没什么稀奇的,网上现成代码多得是!”

  “你再看看死锁那一段,这可不是复制代码能解决的。”

  “它可能在训练数据里见过同样的程序。”

  “小杨那份代码是公司内部项目改的,之前根本没公开过!”

  “别吹了,让它写个操作系统试试!”

  小杨看到最后一条评论,当场回复:“你让一个工程师一天写操作系统,他也得叫你滚!”

  这条回复被转发了几千次。

  争论并没有停下来,反而引来了更多程序员。

  有人把女娲接进一个开源项目,让它阅读近20万行代码,再询问某个功能的调用路径。

  女娲花了几分钟分析文件,最后从入口函数一路追到数据库层,中间列出了17个关键调用点。

  项目维护者按照它给的路径检查,发现女娲漏掉了一处异步回调,却找到了一个存在半年多的缓存错误。

  还有人拿一段没有任何注释的汇编代码测试。

  女娲判断那是一段图片压缩程序,并将其中几个核心循环还原成了接近C语言的伪代码。

  测试者又故意把寄存器名称改乱,女娲很快提醒他,这段代码无法在指定架构上运行。

  “我服了,这玩意儿连假代码都能看出来!”

  “别急着服,它刚才把一个排序算法认错了。”

  “认错以后呢?”

  “我提醒了一句,它自己改过来了。”

  “人写代码还天天出bug呢,你要求它一次不错?”

  “问题是它改bug比我快!”

  技术圈吵了整整一天。

  小杨又开了一场直播,在线人数居然从最初的100人不到涨到20多万,远超那些热门的游戏主播!

  直播开始后,他没有继续做那些常见的小程序,而是从零搭建一个电商网站。

  他只给女娲一句需求:“给小区附近的水果店做个线上商城。”

  女娲先列出商品、库存、订单、支付和配送范围等功能,又提醒生鲜商品存在重量浮动,不能完全按照普通商品的固定数量结算。

  小杨看到这条提醒,忍不住说了一句:“行啊,这都能想到!”

  直播间立刻飘过一片弹幕。

  “我都没想到!”

  “水果按斤卖,最后称重确实会变!”

  “别光看需求分析,让它写!”

  “赶紧上强度!”

  小杨让女娲自己选择技术方案。

  女娲建议后端使用成熟的Web框架,数据库使用MySQL,前端先做普通网页,等业务稳定后再考虑手机应用。

  它还特意解释,小店刚开始没必要追求复杂架构,单机部署够支撑早期订单。

  这句话让直播间里的程序员笑了起来。

  “大厂出来的架构师看了想哭。”

  “终于有ai知道小店用不上百台服务器了!”

  “我们公司日活800人,领导非要上微服务。”

  “前面的别说了,我已经开始难受了。”

  女娲很快搭出项目结构。

  商品页、购物车和订单页面看着有些简陋,基本功能却都能正常使用。

  小杨临时提出满减、优惠券和会员折扣叠加的需求,想看它会不会把价格算乱。

  女娲先问清优惠顺序,随后把结算规则单独做成模块,还生成了30多条测试用例。

  小杨连续改了几次条件,程序始终能算出正确价格。

  后来他故意设定了一组互相冲突的优惠规则,女娲没有硬写,直接提醒:“当前规则存在歧义,同一订单可能出现两个不同结果,请先确定优先级。”

  直播间安静了一会儿,弹幕突然爆发了:

  “这比我们产品经理靠谱!”

  “它居然知道需求有冲突!”

  “完了,我的工作真要没了!”

  “别慌,它替你写代码,你可以替它背锅!”

  “前面的太真实了!”

  直播持续了四个多小时。

  结束时,水果店商城已经能正常下单,虽然离真正上线还有不少工作,但基础框架确实搭出来了。

  小杨最后给出评价:“女娲离一个能独立干活的高级工程师还有距离,可它已经能顶一个基础扎实、精力又特别好的初级工程师。”

  他顿了顿,又补充道:“最麻烦的是,它还在继续变强!”

  这段直播录像很快传到海外。

  不少外国程序员使用英文版女娲重复测试,得到的结果大致相同。

  女娲在常见编程语言上的表现最好,遇到冷门语言时偶尔会编造不存在的函数。

  只要用户指出错误,它通常能在一两轮对话内改正。

  真正让程序员们觉得意外的,是女娲能够连续处理一个项目!

  以前的智能编程软件只能补全几行代码,或者根据简单描述生成一个函数。

  女娲却能记住前面的设计,继续修改几十个文件。

  即使对话太长,它偶尔会忘掉某些细节,用户也可以让它重新读取项目资料。

  “这已经不只是代码补全了。”

  一名硅谷工程师在论坛里写道:“它像个刚入职的新人,能力有高有低,需要有人盯着,但确实能干活。”

  下面很快有人回复:“新人要工资,它只要电费和VIP订阅费。”

  另一人跟着说道:“你最好祈祷老板没看到这句话。”

  ……

  程序员还在争论的时候,数学圈也有人盯上了女娲。

  最先出手的是国内一个以讲竞赛题出名的大学生博主,网名叫“纸上算兵”。

  他准备了50道题,里面有中学竞赛题、大学高等数学、概率论和几道自己改编的问题。

  为了防止女娲背答案,他把题目里的数字和条件全换了。

  第一道题是一道几何证明。

  女娲没有直接给结论,而是先补了一条辅助线,再用相似三角形证明比例关系。

  步骤没问题,可写得稍微有点绕。

  纸上算兵让它换一种方法,女娲又用坐标法算了一遍。

  第二道题是数列。

  女娲很快找出递推关系,却在最后化简时算错了一个符号。

  纸上算兵没有提示哪里错,只说答案不对。

  女娲重新检查一遍,主动指出符号错误,并给出修正后的答案。

  直播间有人立刻开嘲讽。

  “就这?小学加减法都能错!”

  “你做50道题一次不算错?”

  “ai还会粗心?”

  “它没有粗心,只是推理过程不稳定。”

  “别吵了,继续看后面的题!”

  到了概率论部分,女娲的表现明显更好。

  它不仅给出结果,还会解释随机变量之间是否独立,为什么不能直接把概率相乘。

  纸上算兵故意把一道条件概率题写得很像常见模板,真正条件却少了一项。

  女娲没有贸然计算,而是提醒现有信息不足,只能给出一个范围。

  这一次,直播间里很久没人说话。

  纸上算兵笑道:“这题我拿去问过同学,十个人里有七个直接套公式,它倒是没上当。”

  最难的一道题来自他正在做的研究方向。

  题目并没有标准答案,他只要求女娲提出证明思路。

  女娲给出的第一条路走不通,推到一半时自己承认缺少关键条件。

  第二条思路用到了一个比较冷门的定理,虽然没能完成证明,却把问题缩小到了一个更容易处理的特殊情况。

  纸上算兵对着屏幕想了很久。

  “这条路我以前没试过。”

  弹幕有人问:“能证明吗?”

  “现在还不知道,但值得试!”

  第二天,他把测试结果整理出来。

  50道题中,女娲直接答对了41道,经过提醒后又改对了6道,剩下3道没有得到正确答案。

  单看准确率不算完美,真正可怕的是它能把思路讲给普通人听。

  一名高三学生把自己做错的试卷拍照上传。

  女娲识别出手写内容后,没有直接给答案,而是从他出错的那一步开始解释。

  学生还是没懂,女娲便换成更简单的数字举例。

  连续换了三种说法以后,那名学生终于在评论区留言:“我老师讲了两遍都没听明白,它给我讲懂了!”

  这条评论很快被顶到最前面。

  有人兴奋,也有人开始担心。

  “以后还要补习班干什么?”

  “别想太多,它难题照样会错。”

  “老师也会讲错啊!”

  “老师能看出学生是不是真懂,女娲可以吗?”

  “刚才那个学生说没懂,它不是换方法了吗?”

  “一个月VIP多少钱,我先给孩子买了再说!”

  家长们的讨论很快盖过技术争论。

  有人让女娲替孩子出练习题,还有人要求它根据错题总结薄弱知识点。

  女娲能把相同类型的题换个问法,也会根据学生的回答调整难度。

  有个家长测试了两天,发现孩子开始主动问问题了。

  原因很简单,孩子怕在老师和同学面前显得笨,却不怕被女娲笑话。

  “它不会不耐烦。”

  那名家长在微博上写道:“同一道题问五遍,它会讲五遍,而且每次都换个思路!”

  教育机构很快坐不住了。

  几家线上教育公司连夜组织团队研究女娲,还有公司要求员工测试它能不能批改作文。

  语文作文的结果没有数学那么稳定。

  女娲能找出病句,也能调整结构,可它写出来的范文常常太工整,看几篇以后就能摸出套路。

  一名语文老师评价:“改基础错误很好用,真要谈感情和个人经历,它替不了学生。”

  网友们对这个结论倒没有太大意见。

  “它要是连我的童年都能替我写,那才吓人。”

  “放心吧,它编的童年比你的精彩!”

  “我让它写了一篇《我的父亲》,看完差点想给它爸上香!”

  “你这话也太损了!”

  相比作文,女娲在外语学习上的表现更让人吃惊。

  用户可以直接和它用英语聊天,也可以让它纠正语法和用词。

  有人故意混用中文、英文和日文,女娲仍能理解大意,并提醒其中一句日文不太自然。

  某个在东京留学的学生让女娲模拟租房中介,两边聊了十几轮,女娲不仅问了预算和通勤距离,还提醒外国留学生租房可能需要担保人。

  学生把记录发到论坛,下面一片惊叹:

  “这比我第一次找房时懂得多!”

  “它要是早点上线,我就不会被中介坑了。”

  “能不能让它替我打电话?”

  “暂时只能文字和简单语音,等以后吧。”

  “简单语音已经很离谱了!”

  ……

  女娲在医学方面的测试也在同步进行。

  上线第二天,国内便出现了大量让女娲看病的用户。

  有人上传化验单,有人描述自己的症状,还有人拍下药盒,问几种药能不能一起吃。

  女娲每次都会先提醒,线上回答不能代替医生诊断。

  遇到胸痛、呼吸困难和意识模糊这类情况,它会直接建议用户尽快前往医院。

  一名急诊科医生注意到后,专门做了一套测试。

  他的网名叫“急诊老韩”,平时经常在网上做医学科普。

  老韩从过去几年的病例里挑了20份,删掉姓名和隐私信息,再把症状按患者口述的方式重新整理。

  第一例是普通胃肠炎。

  女娲给出几个可能原因,询问患者有没有发热、脱水和持续腹痛,并提醒不要随便使用抗生素。

  第二例表面上像胃病,实际却是心肌梗死。

  患者的主要症状只有上腹部不适和恶心,很容易被忽略。

  女娲没有直接判断为心梗,却把急性冠脉综合征列在了需要优先排除的位置。

  它建议患者立即做心电图和心肌酶检查,不要自己在家观察。

  老韩看到这里,表情明显认真了不少。

  “这一条很重要。”

  他对直播间说道:“急诊最怕漏掉要命的病,它不一定能诊断准,但知道先排除什么,已经有用了。”

  第三例是儿童发热。

  女娲先问年龄、体温和精神状态,又提醒三个月以内的婴儿发热需要尽快就医。

  老韩故意回答说孩子身上出现红点,按压后不褪色。

  女娲立刻提高警告级别,建议马上去急诊,途中注意意识状态和呼吸变化。

  直播间里有人问:“真有这么严重吗?”

  老韩回答:“这种情况可能和严重感染有关,宁可跑一趟医院,也不能在家拖!”

  20份病例测完,女娲没有一次直接声称自己已经确诊。

  它在常见病上给出的判断比较准,面对复杂病例时则会列出几种可能,并说明哪些情况最危险。

  其中有三例,它给出的优先顺序不够合理。

  还有一例罕见病,它完全走错了方向。

  老韩没有因为这些错误否定女娲。

  “拿它当医生肯定不行,拿它做分诊和提醒,价值很大!”

  他在总结中写道:“很多患者连该挂什么科都不知道,女娲至少能告诉你这事能不能拖。”

  评论区很快出现一个真实案例。

  一名用户说自己父亲连续两天胸口发闷,以为只是最近太累。

  他随手问了女娲,女娲建议立即去医院检查。

  家里人原本还觉得小题大做,最后还是把老人送去了急诊。

  检查结果显示冠状动脉严重狭窄,再晚一些很可能出大问题。

  用户把病历上的隐私信息遮住,发了一条长微博。

  “我不知道女娲算不算救了我爸,但如果没有它那句‘不要继续等待’,我们当天不会去医院!”

  这条微博在几个小时内便冲上了热门。

  灵境科技的客服很快联系对方,确认事情经过。

  公司没有借机宣传,只在官方账号下回复:“祝老人早日康复,也请大家遇到紧急症状时及时就医!”

  这种克制反而让更多人开始讨论女娲的医疗价值。

  乡镇医生、社区诊所和急救中心都可能用它做辅助判断;偏远地区缺少专科医生,女娲至少能帮基层人员快速查找方向。

  医学界的担忧也很现实。

  一旦女娲判断错误,责任该由谁承担?

  用户隐瞒病史,模型根据错误信息给出建议,又该怎么算?

  还有人担心患者过度相信女娲,反而拒绝去医院。

  老韩在直播结束前反复提醒:“它能帮忙,但别把命全交给一段程序!”

  这句话也被灵境官方转发。

  陈平看到医疗测试结果后,当晚就给季铭打了电话。

  “医疗类回答再加一道提示,现在已经有免责声明了,但这还不够。”

  “碰到可能危及生命的症状,别只在结尾提醒,要在开头直接告诉用户去医院!”

  季铭很快明白他的意思。

  第二天,女娲更新了医疗回答规则。

  只要用户提到高危症状,对话顶部就会出现醒目的就医提醒。

  有人觉得这种提示太频繁,更多医生却认为灵境做得对。

  ……

  连续几天的高强度测试,让女娲的能力在公众面前彻底展现无遗。

  4月4号,彭博社率先发布了安德鲁的专访和一篇长篇报道,标题非常直白明了:

  《超亿次下载之后,女娲证明人工智能已经开始工作》

  报道没有把重点放在下载纪录上,而是整理了女娲上线三天以来最有代表性的测试。

  安德鲁详细写了小杨的编程直播。

  他在文章里指出,自动生成一段能运行的代码并不算真正突破,女娲最值得注意的是持续修改项目的能力。

  用户可以指出错误、增加需求,甚至只描述一个模糊的故障,女娲会回到前面的代码,重新检查相关模块,再给出修正方案。

  这意味着它已经能够参与完整的工作流程。

  彭博社还请三名软件工程师重新检查小杨公开的全部代码。

  三人一致认为,女娲的代码质量达不到大型企业直接上线的标准,但足以完成大量基础开发。

  其中一名工程师算了一笔账。

  一个五人团队使用女娲以后,原本需要两周完成的原型,可能三四天就能做出来!

  产品最终仍要由人负责,早期试错成本却会大幅下降。

  报道随后分析了医疗和教育测试。

  安德鲁没有把女娲写成“全能医生”或者“超级教师”,反而列出了它答错的病例和数学题。

  他认为这些错误恰恰说明,女娲还不能独自承担高风险工作。

  可另一方面,一个会犯错的工具不代表没有价值。

  搜索引擎也会返回错误信息,医生和教师同样可能判断失误。

  真正需要观察的是,女娲能否提高普通人的信息处理能力,以及人工复核能不能把风险控制住。

  报道中有一段话被大量转载。

  “女娲最惊人的地方,不在于它每次都能给出正确答案,因为它显然做不到;真正的变化在于,一个此前没有编程、法律或医学知识的普通人,如今可以用日常语言,得到过去很难获得的专业帮助!”

  彭博社还专门研究了灵境的企业价值。

  女娲处理客服记录、合同和内部文档的能力,可能直接改变软件服务行业。

  过去,企业要为不同需求购买多套软件。

  客服有客服系统,合同有合同系统,数据分析又是另一套系统。

  女娲却可以用同一个对话入口处理不同任务。

  它不一定替代全部专业软件,却可能挤掉大量功能简单、价格昂贵的中间产品。

  安德鲁在报道结尾写道:“市场此前把女娲当成一款更聪明的聊天软件,现在看来,这个判断可能从一开始就错了。”

  文章发出后,彭博终端上的相关公司讨论量迅速上升。

  投资机构最关心的不是女娲会不会做数学题,而是它会抢走谁的收入。

  企业软件、在线教育、外包客服、翻译服务和传统搜索,全都出现在分析名单里。

  不少基金经理连夜要求团队重新评估持仓。

  ……

  第二篇引起巨大反响的报道来自《华尔街日报》。

  它没有重复彭博社的产品测试,而是把女娲和美国现有的人工智能公司放在一起比较。

  由于陈平的介入,前世那家后来走出GPT路线的公司并未出现,所谓GPT模型自然也没有诞生。

  美国的人工智能企业主要押注专家系统、搜索问答、企业知识库和语音助手,几个方向各自发展,却始终没能连成一体。

  其中估值最高的三家公司,分别擅长企业文本分析、自动客服和代码辅助。

  单独看,每一家都有成熟产品。

  可女娲上线以后,用户发现它一个产品就覆盖了这三类能力。

  《华尔街日报》安排记者同时测试四款产品。

  在企业文本分析上,美国公司的准确率仍略高,尤其是处理固定格式的财务文件时,规则更稳定。

  到了混合文档和自然语言提问,女娲明显更灵活。

  用户不需要提前设置字段,也不必学习复杂操作。

  上传文件以后,直接问“这份合同里哪些条款对我不利”就行。

  在自动客服测试中,专业客服软件对标准问题回答得很快,遇到超出知识库的追问就容易卡住。

  女娲会根据上下文继续解释,也能听懂用户换一种说法后的问题。

  代码辅助公司的产品可以补全代码,速度很快。

  女娲生成单行代码的效率未必更高,却能分析项目结构、解释错误,再跟用户讨论设计方案。

  报道给出的结论非常尖锐。

  “美国人工智能公司花了数年时间,把能力拆成一个个可以收费的功能,而灵境把这些功能重新装进了同一个产品里!”

  文章没有把原因简单归结为算法差距。

  《华尔街日报》认为,灵境真正领先的是算力、模型和产品的同步推进。

  美国创业公司通常只做其中一环。

  有的公司拥有算法,却买不到足够多的高端计算卡;有的公司拿到大量融资,却缺少能覆盖全球的数据中心;还有公司技术不错,产品却只能服务少数大企业。

  灵境的情况完全不同。

  它有自己的人工智能研究院,也提前锁定了大批高端计算卡。

  姑苏、黔省和海外数据中心共同提供算力,灵境旗下的支付体系又能直接向全球用户收费。

  《华尔街日报》把这套体系称为“灵境闭环”。

  报道随后提到一个更让美国投资者不安的问题。

章节目录
书友推荐: 黄泉逆行 道种修仙,从斩仙葫芦开始 从海湾风暴开始 咸鱼重生 我刚满级,你们让我当傀儡皇帝? 我的女友死在了过去 双穿大唐:遇上可爱小兕子 北美驱魔:在芝加哥当道士的日子 喧嚣未及之处 星辰大远航 我在漫威肝属性 罗汉伏魔从倚天屠龙开始 从趋吉避凶开始顺势成神 人在战锤,游骑兵出动! 虎贲郎 重生破案,从抓捕白月光开始 大炮巨舰不相信末日怪兽 人在现实,我的武道宗师女友 火热年代:从娶女知青开始 绑定打卡系统,我成了悠闲旅行家