八零小说网

字:
关灯 护眼
八零小说网 > 法师归来,速通地球! > 第4章 你来自哪?

第4章 你来自哪?

    注册推特账号Light_Chen。
    然后找到对应的人,逐一在他们的推特下面发送:
    “AlphaCode的采样-过滤策略低估了候选解之间的结构同质性。看起来生成了一百万个候选,实际仍然会归结为少数几类解法的表面变体,相同的不变式、相同的错误假设、相同的失效边界...”
    “代码生成对于评估规模而言是一个有用的预警信号。模型可以在探索出乎意料的狭窄潜在策略集的同时...。”
    “我同意LLM并非世界模型。但有一点似乎讨论不足...”
    饵已经放下,就等人来联系自己了,陈曦心想。
    他找了十来个当下ai领域的明星科学家,这些明星科学家属于典型的关注人数很多,但留言很少。
    因为他们发的推特太专业了,专业到外行压根看不懂,内行也要花时间来思考。
    在一个碎片化内容也碎片化表达的平台,很少有人有心思和精力去琢磨然后进行探讨。
    陈曦的留言很有针对性,短短一两句话就指出了对方的不足,并且一眼就知道这家伙很专业。
    只要有一个和他多聊上两句,陈曦有十足把握能获得对方的信任背书,进而前往硅谷获得第一桶金。
    至于为什么不在华国,一方面硅谷的科技企业们开的价码更高,另外一方面,他在获得第一桶金之后就打算去东南亚和北美建立自己的领地。
    法师怎么能没有自己的领地呢?华国早就不能成精了。
    另外大量的生物样本,在东南亚干这事才能毫无心理压力。
    华国会是自己的大后方,自己父母在这,这条线就永远在。
    ......
    饵已经放下,远在万里之外硅谷的伊戈尔·巴布什金起床后,像往常一样,打开电脑,看邮件,回邮件。
    然后打开推特,私信里的名字说出来能让业界震动——Elon musk。
    这个名字也就还好,让业界震动的是这件事。
    作为Deepmind的核心成员,他最开始的时候负责Alphastar,一个和人对战星际的人工智能,最近负责Alphacode,一个用于编写代码的人工智能。
    两者都含金量十足。
    这让对人工智能野心勃勃的埃隆·马斯克很是眼馋。
    两人自从建立联系后,马斯克天天要发推特私信给伊戈尔,试图撬谷歌的墙角。
    马斯克试图挖角谷歌,这会让业界震动。
    伊戈尔按照惯例回复了马斯克,他一直都没想好。
    然后注意到自己的推特有条回复,他顺势点开。
    “...低估了候选解之间的结构同质性...”
    伊戈尔·巴布什金看到之后第一反应就是不虞。
    Alphacode项目刚才Science发表,DeepMind和谷歌对它的评价极高。
    能在Codeforces竞赛中达到人类选手中位数的水平。
    在这个Cude还没有声名鹊起的时候,毫无疑问,Alphacode就是ai编程领域的No.1
    推特的回复居然指出了这个项目的不足,伊戈尔顿时抱着我倒是要看看你在说什么的想法。
    他点进了Light_Chen的主页,账号是新注册的,头像用的是推特注册自带的头像。
    关注者是零。
    这两天才开始更新内容。
    没有机构背书,也没有过往履历,至于论文和Github star更是天方夜谭。
    也许是某个人的马甲,也可能是初生牛犊。
    伊戈尔·巴布什金抱着这样的想法挨个看了下来,发现有点东西。
    对方的回复有点东西啊。
    伊戈尔·巴布什金再回过头去看,Light_Chen在他推特下的回复,他皱了皱眉,思索片刻后敲了一段回复在底下:
    “详细说说你会基于什么进行聚类?抽象语法树距离和执行轨迹已经涵盖了部分信息。你的观点听起来不错,但你该如何将其付诸实践呢?”
    陈曦的回复总结起来就一个意思,你们输出的方案看似多,实际上都是一个方案,不过换了个表现形式罢了。
    交好谷歌的媒体把AlphaCode吹成能生成真正理解题意、展开多种算法路线、再从中择优的编程选手。
    内部人士很清楚,它的智能很大一部分来自采样规模和过滤机制。
    纽约大学计算机系的戴维斯教授就批评过,这玩意本质上还是猴子打字机。
    打的字够多,总能敲出莎士比亚。
    过滤和选择缺乏真正的结构探索。
    对谷歌不满的媒体,就会引用戴维斯教授的批评。
    陈曦则在此基础上更进了一步,把这玩意真正的弱点给点了出来。
    这建立在AlphaCode从未真正对外开放过。
    DeepMind开源了训练和评估模型,发布了演示网站,外界能查看AlphaCode在具体编程问题上的生成解决方案、解释和可视化,却不能像使用 ChatGPT那样输入一个新问题,让系统实时生成代码。
    不到两分钟,回复出现了。
    “AST距离捕捉的是程序如何被写出来。
    执行轨迹捕捉的是程序在采样输入上的行为。
    我说的是稍微不同的东西:推断是哪一类反例生成器杀死了哪些候选程序。
    如果两个程序需要同一种对抗性输入才会失败,那么即便它们的语法和普通执行轨迹不同,它们也属于同一个潜在解法家族。”
    伊戈尔端着咖啡回到桌前,想了想,又问:
    “这需要知道反例分布。在编程竞赛里,隐藏测试是不可见的。你怎么避免只是发明出一套带有自己偏差的基准测试?”
    这次Light_Chen没有马上回复。
    过了大约五分钟,他发来一段更长的回答。
    “我们只需要用一组根据题目描述和候选程序行为生成的探针。
    对每个候选程序,提取它隐含的假设,然后生成小规模的对抗性探针族,专门攻击这些假设。
    在最终过滤之前,估计候选解的多样性是否真实存在。如果80%的候选程序都死在同一类探针族上,那么就可以顺利掩盖一个已经坍缩的策略空间。”
    伊戈尔开始认真起来。
    他回复:“假设我们接受这个观点。那么指标应该长什么样?原始聚类数量?失败家族上的熵?还是别的什么?”
    “我会定义三个数字。
    原始采样数:生成了多少个程序。
    行为幸存数:有多少程序通过了可见测试或样例测试。
    语义有效样本量:在自适应探针下,还剩下多少个不同的失败吸引域。
    有用的比率增加语义有效样本量/原始采样数和语义有效样本量/行为幸存数。
    如果第一个比率很小,说明模型采样到的只是风格。
    如果第二个比率很小,说明过滤器选出来的只是同一个想法的不同变体。
    如果两个比率都会随着规模提高而提高,那么模型确实在学习真正的策略多样性。”
    伊戈尔靠在椅背上,仔细一想,卧槽大佬啊,对方给的策略有点可行性。
    他看出价值了,没有再继续在推特上继续和对方聊天,而是选择切换到推特私信里。
    先给Light_Chen点了个关注,然后接着问道:“你认为这是代码生成特有的问题,还是语言模型的一般性限制?”
    “一般性限制,但代码把它暴露出来。”
    “在语言里,表面多样性甚至更具有欺骗性。十个答案看起来可以完全不同,却共享同一个隐藏框架。”
    “代码有用,是因为失败可以被运行给判断出来。”
    “如果我们能做到如何在代码里测量坍缩的策略空间,就能得到一种更广泛诊断推理系统的方法。”
    伊戈尔想了想,问了个有点尖锐的问题:“如果没有AlphaCode的内部访问权限,你怎么测试这一点?”
    他想看看对方能不能在没有AlphaCode的内部权限的情况下设计出近似验证方法。
    过了一会儿,Light_Chen回复:
    “使用演示题目里的公开样例足够做一次合理性检查。”
    “选择那些演示中展示了多个生成解法或解释的题目。”
    “手动重构解法家族。”
    “围绕可能的不变量生成对抗性变体。”
    “比较这些不同的解法是否会一起失败。”
    “哪怕只有5到10个例子,也足以判断这个测量方法是否值得放大。”
    伊戈尔内心已经在为对方鼓掌了。
    “你在OpenAI工作,还是微软?或者META的人工智能实验室?”
    他已经冒出想要挖人的想法了。
    21世纪什么最重要?当然是人才最重要。
    自己有可能要为马斯克工作,一个人孤掌难鸣,那么带越多的人一起去越好。
    开除一个人太容易了,开除一群人有点难。
    这也是为什么,在硅谷,印度人在抱团,华国人也在抱团,大家都在抱团。
    来了一个就来两,来了两个就来一串。
    你想开除我,先掂量掂量,我们走了,你的业务还能不能运转。
    “我还在上学。”
    “哦,斯坦福还是MIT?”
    “江城大学。”
『加入书签,方便阅读』
内容有问题?点击>>>邮件反馈
热门推荐
少年啊宾全文 少年阿宾H小说 短篇辣文合集 青春性事:一个八零后的情欲往事 绯色官途 猎艳天庭风流