第13章 空手套白狼

3个月前 作者: 没想好吃啥
    第13章空手套白狼


    如果是匿名的话,这笔生意好像有搞头啊。


    无论是继续在deepmind,还是去推特,这都会是自己的资粮。


    在谷歌,摸一摸首席人工智能专家也不是梦。


    去推特,自己要掏多少钱给这个华国年轻人,那马斯克给自己开的薪水包起码翻倍。


    怎么想都不亏。


    “成交,我会喊人去做小规模验证的。”巴布什金说道。


    陈曦说:“成交。”


    为什么要自己来?


    为什么要有卡?


    空手套白狼不好吗?


    ......


    伊戈尔·巴布什金先是把文档再重新好好看了一遍。


    然后接着把里面一些措辞进行了修改,数据的格式也做了修改,改成更符合自己习惯的命名方式。


    然后才把小实验要用到的东西,通过自己的私人邮箱发给自己的心腹。


    他给陈曦留的也是私人邮箱,不是谷歌的工作邮箱。


    尼克·沃尔什,他招来的手下,在团队里存在感不强,长着一张看上去就睡眠不足的脸,习惯穿着旧卫衣在办公室溜达。


    有能力又忠诚,如果自己要去推特,伊戈尔·巴布什金第一个带的就是尼克。


    “尼克,我发了个邮件给你,你看看,先做个实验,隔离做,不进主仓库,也不用项目名称,你可以把这看成是我的私活。”


    尼克接到电话的时候,正在家里的餐桌旁吃昨天晚上派对带回来的披萨。


    听到后,他丝毫没有感到意外。


    在他看来,伊戈尔老是这样,冷不丁地丢来一段想法,让他做个验证,或者干个别的事情。


    他们的团队每周都会冒出很多有价值的想法,只是最后能落地的少之又少。


    因此他回了个:“好的,巴布什金先生。”


    话音落下,那边挂断了电话,他继续吃披萨。


    吃完才把mac搬到餐桌上,打开电脑,打开邮箱,打开文档。


    “...候选程序数量、可见测试通过率和策略覆盖度是三件不同的事。模型可以通过大规模采样制造出数量上的繁荣,却仍然在少数失败族里打转...”


    这是直指alphacode的漏洞啊,尼克思忖。


    他继续往下看,数据格式写得很具体。


    每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。


    尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。


    他开始按文档搭最小验证环境。


    伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动alphacode主流程,只用公开题目和小规模候选程序集。


    伊戈尔之所以会这样选,是因为他不想被谷歌发现。


    他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。


    尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。


    一开始他还有点不耐烦,因为这东西过于手工。


    指标漂亮当然是好事。


    但前提是,漂亮的指标得是模型自发生成的。


    而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。


    (本章未完,请点击下一页继续阅读)第13章空手套白狼(第2/2页)


    为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。


    就是因为针对测试的指标,进行的人工修剪成分过多了。


    来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。


    如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。


    第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。


    按照常规方法看,模型给出了不少不同方案。


    一旦用反例探针重新测试,候选程序开始成片成片倒下。


    变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。


    尼克盯着结果,又跑了一遍。


    结果差不多。


    他开始兴奋起来。


    隐隐约约的感觉被程序给证实。


    原本模糊的现象突然被测出来了。


    团队里很多人都知道大规模采样会制造虚假的多样性,也知道候选程序之间存在同质化。


    知道是一回事,能把它测出来是另一回事。


    他接着按照文档里的方法训练了一个很小的策略判别器。


    模型粗糙,数据不大。


    它不能和alphacode相提并论,更谈不上对外发布。


    但在这批小样本上,它已经能比语法聚类更稳定地把看起来不同、实则同源的候选程序归到一起。


    当他把反例生成器加入筛选流程后,最终留下的候选解法数量少了,策略互补性明显变高。


    他把结果导出成表格,又跑了三组不同随机种子。


    提升幅度有波动,趋势没有消失。


    语法多样性和策略多样性之间的差距,被这个小实验找到了命门。


    哪怕已经到了深夜,尼克也忍不住要给巴布什金打个电话。


    电话接通后,巴布什金没有寒暄:“结果怎样?”


    尼克说:“结果很惊艳,我隐约觉得它找到了那条路,老板,你做到了!”


    能从尼克语气里听到兴奋,显然这个小的验证效果好到出乎伊戈尔·巴布什金的预料。


    他没有回答,在思考。


    尼克见电话那头没有回复,于是继续说道:“在小规模验证里,这套东西确实测出了普通聚类测不到的策略坍缩。反例探针对候选程序的杀伤不是随机的。测试方案里语义有效样本量指标很有效。”


    “而且,加入策略判别器之后,留下来的候选解法更接近真正不同的思路,他们之间有时候甚至能形成隐形的互补。”


    伊戈尔·巴布什金说:“好,我知道了。”


    说完,他挂断了电话。


    伊戈尔·巴布什金陷入了两难的境地。


    如果做模型的正式训练,那么无论是算力的使用还是日志记录、数据流,都没办法瞒过deepmind和背后的谷歌。


    风险会大到爆炸。


    最后只能老老实实上报给谷歌的董事会。


    另外一条路就是找马斯克,用推特的卡来训练。


    但这同样有问题,那就没办法待价而沽了,只能拿来和马斯克抬价了,自己回不去谷歌了。


    谷歌还是推特?这是一个问题。
关闭
最近阅读