请关闭浏览器的阅读/畅读/小说模式并且关闭广告屏蔽过滤功能,避免出现内容无法显示或者段落错乱。
不过也正是这幅离谱的画面,让李东突然灵光一闪。
他也顾不上眼前的诺维格教授了,而是直直的看着休息室里的三位巨头,脸上浮现出一个和蔼的笑容。
“几位。”
“咱们也别绕圈子了。”
“我对ai的底层架构有兴趣,你们对我手里的降维算法有兴趣,这一点,大家心知肚明。”
休息室里安静了下来。
凯利三人交换了一个眼神……
来了。
“但我也实话实说。”
“我那套内部闭源的21算法,是不可能放出来的。”
“因为它存在理论缺陷。”
“拿来跑一跑黎曼zeta函数的非平凡零点还行,可真要把它泛化到具体的工程级项目上,目前是不可行的。”
这话李东说得脸不红心不跳,缺陷?你问问黎曼他答应吗?
它不可能开源的原因,从头到尾只有一个……
华夏现在还用着呢。
听完这番话,对面三人眼明显露出了失望的神色。
不过就在这时,李东话锋一转。
“但是。”
“我已经公开出去的那套10算法,其实是能够无缝桥接到大模型方向上的。”
三个人失望的眼中爆发出精光。
要知道,10那套基底开源这么些年,各家私底下其实都在偷偷跑消融实验做适配。
底层的数学红利或多或少吃到了一些,可“无缝桥接”这四个字,那还没有人能做到。
而现在算法的主人在他们面前,亲口说能嫁接。
斯——
凯利轻轻的吸了一口气说道。
“李东教授,您……有什么条件?”
李东摆了摆手。
“哎,要什么条件啊。”
“我觉得,学术这个东西,本来就是属于全人类的。”
“你们有什么跑不通的地方,都可以问,最好是关于pre-trag(预训练)、底层通信网络、工程收敛这些方向的,越底层越好,都可以尽量问我。”
这下对面三个人是彻底呆住了。
唐杰也傻了。
他甚至咳嗽了两声,想提醒一下李东。
兄弟,你知道自己在说什么吗?
李东则是不动声色地,冲他眨了眨眼。
唐杰到了嘴边的话,又咽了回去。
而此时,对面那三位,反倒有点拿不定主意了。
这是什么情况?
李东,是这么好的一个人吗?
天上掉馅饼,还是请君入瓮?
可三人在脑子里把利害关系飞快地推演了一遍,愣是没算出李东这么做能图他们什么。
倒是数学圈里一直流传的那句话,不约而同地浮上了三个人的心头。
李东,是一个纯粹的学者。
看来,并不是空穴来风。
于是三人齐齐地冲李东点了点头,凯利的声音里,带上了几分真诚的感激。
“谢谢您,李东教授,人类ai范式的跃迁,离不开您的贡献。”
“不过,请您稍等我们一下,具体到底层算子和分布式架构的东西,我们还需要把公司的chiefstist(首席科学家)叫过来同您面谈。”
朗和哈特也跟着点头。
这种硬核的局,带商务vp团队来纯属白给,必须把各自家里真正控盘预训练、手搓cuda算子的大牛请过来才行。
“那行。”李东痛快地站起身“人到了,你们叫我,我先去和外面的同行们交流交流。”
三人一时没反应过来,下意识地问了一句。
“李东教授,您要交流什么?”
李东理所当然地说道:“当然是交流我那套降维算法的工程适配呀。”
“毕竟,这也是为了推动全人类开源生态的发展嘛。”
说完他朝三人笑了笑,推门走出了休息室。
三个人花了足足两秒钟才反应了过来。
外面的大厅里可全是竞品同行呀。
“该死!”
凯利第一个掏出手机,几乎是用吼的。
“雅各布?对,是我!你现在,立刻,马上,飞首尔!”
“什么叫没排上商业航班?让后勤直接把公司那架湾流g650推出来!当场报备航线,快!”
“我不管你卡上还挂着几个千卡集群的消融实验,天塌下来也先给我把显卡全停了!”
另一边,朗背过身去,语速快得像在抢答。
哈特那通电话表面上声调平稳,握着手机的手都鼓起了青经。
三通电话,三个号码,内容大同小异。
于是乎这一天的硅谷发生了一桩极其罕见的事情。
三家巨头公司的私人飞机,在同一个下午先后从湾区的跑道上拔地而起,它们的目的地都是……
韩国,首尔。
……
休息室外。
唐杰找了个没人的电话,拨通了一个国内的号码。
他把会场这边刚刚发生的事,原原本本复述了一遍。
电话那头沉默了几秒,然后笑了。
“唐教授,把心放肚子里。”
“你呀,还是不够了解李东教授。”
唐杰握着手机,怔了一下。
“……行,我明白了。”
挂断电话后,他抬起头。
目光穿过大厅里的人群落在那个正谈笑风生的年轻人身上,神情说不出的古怪。
……
展区的另一边,独角兽联合展台旁的咖啡台。
两个挂着参展商工牌的人,正端着咖啡闲聊。
其中一位是埃里克&183;万斯,硅谷一家ai独角兽的联合创始人,兼首席科学家。
他们家的招牌是lo与极速推理,两年前靠一手“百万级dow”的硬核绝活一战成名,估值一路狂飙过百亿美元大关,是这条细分赛道上跑得最快的黑马。
下午唐杰领着李东在大厅里寒暄的时候,万斯就排在换名片的队伍里,还很郑重地做过一番自我介绍。
此刻他正和一位欧洲基础实验室的研究员聊得起劲,余光忽然瞥见一道身影朝这边走了过来。
万斯扭头一看,整个人立刻精神了。
他连忙朝那位研究员抱歉地举了举咖啡杯,丢下一句“回头再聊”,便快步迎了上去。
“李东教授!”
“万斯博士。”李东笑着同他握了握手,连破冰的废话都懒得铺垫,开门见山。
“正好碰见你,我想问问你有没有想过,把我那套降维算法10完完全全地适配到大模型的底层架构上去?”
万斯脸上的笑容,僵住了。
随后转成了狂喜。
他不知道李东为什么忽然问起这个。
可李东都这么问了,这天下哪有不吃白食的道理?
万斯深吸了一口气说道。
“想过!李东教授,我们不光想过,还砸了真金白银进去跑过消融实验!”
“您的降维算法里的fft网格的非线性展开,本质上是在做高维流形的低秩逼近,对吧?”
“我们就把这套思路端到了长文本的kvcache上。”
“给key-vae矩阵强做低秩投影,切掉尾部的奇异值,显存开销当场砍下去七成。”
“跑常规文本的perplexity,指标很稳,ppl几乎不掉点。”
“可一上niah的精确检索评测,recall就当场崩盘。”
“后来做可视化才定位到,attention矩阵的奇异值谱,是个极其极端的重尾分布。”
“模型里那几个专司精确检索的attentionhead,要在几十万个token里捞出那根‘针’,它们学到的特征向量全挤在谱的尾巴上。”
“我们把尾巴这么一刀切,等于直接把这几个head的眼睛给挖了。”
“李东教授,您那套算法算zeta零点的时候,奇异值截断比我们猛得多,凭什么您的尖峰特征就能无损保留?”
他说的问题,信息密度高得吓人。