V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 1 页 / 共 63 页
回复总数  1247
1  2  3  4  5  6  7  8  9  10 ... 63  
@oldlamp 我虽然言语狂了点,但是态度是建立在每天都在学习提升的基础上;沉浸在整个机器学习领域的第八个年头了,从统计机器学习,到深度学习,强化学习,每个领域都摸了一个遍。基础数学公式的推导,以及前沿工程领域论文,都过了一遍的。

起码从自我反思的角度来说,学而不思则罔,思而不学则怠 的境界,虽然也陷入过,但是能自我清醒意识到并脱离。

这哥们儿自己基础薄弱,上来想当然就算了,态度还这么阴阳,我没理由惯着他。

老哥谬赞了,黄石公我肯定没那么高境界。同龄人里这个领域来说,我服 陈天奇,王树森,李沐 他们,但是这个论坛里没有能让我服的人。我也在做事,只是还没有出成果罢了。但是我做的,必然不是当前这些水准的事情。
@EliteOtaku 跳梁小丑,能回复你一句,算给你长脸了。
LLM 参数的量,最根本的矛盾在于 信息论里对于信息的压缩。

LLM 模型本身 静态参数架构的量 对于要体现的 智能 ,关系其实不大,与之影响最大的是 context kv cache 。为什么:
1 ,LLM 本身静态参数其实只需要存储 最精炼的逻辑能力即可,世界客观知识 完全可以压缩到 context kv cache ,只要 context kv cache 无限长度能够存在,就能压缩一切,那么整个模型的初始化参数量就是 O(n),常数级别。

2 ,以目前的硬件能力,context kv cache 显然做不到 无限长度,那么压缩 context kv cache 的算法就是关键,所以,你会看到 一皮条 这部分的工程创新和优化。

3 ,但是信息论里就决定了,有限的结构无法无损压缩还原无限的信息。只要压缩了,必定就有损失。信息熵增地不可逆决定的。
LLM 和人脑之间的进化差距,如同马车之于未来的宇宙飞船。


马车在工程结构上迭代 N 版,不从底层结构上搞出范式创新,依然只是 高级的马车。
@EliteOtaku 那么现在的 MOE 架构是什么呢?

思而不学则怠。
要做孩子的朋友成为自己人,而不是家长成为对立面。
7 月 29 日
回复了 sc0303 创建的主题 创业组队 诚寻创业(搞钱)合伙人(base 上海)
事你干,钱他赚,牢你坐。
7 月 28 日
回复了 ColinLi 创建的主题 职场话题 公司只有我一个开发,该离职吗
你离职之后遇到的困难,会让你觉得你当下这点儿问题,算什么问题啊。
看到这么多菜逼,心里也有底了。😂
7 月 15 日
回复了 xiaowowo 创建的主题 生活 中医税?
有意见就去卫健委投诉嘛。
1  2  3  4  5  6  7  8  9  10 ... 63  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3310 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 31ms · UTC 11:23 · PVG 19:23 · LAX 04:23 · JFK 07:23
♥ Do have faith in what you're doing.