V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  clemente  ›  全部回复第 1 页 / 共 53 页
回复总数  1060
1  2  3  4  5  6  7  8  9  10 ... 53  
每次分配给你的 gpu 资源池 又不是同一个。。。
@wwhc


对话中双方的具体错漏分析讨论角色观点/依据分析与评价 wwhc 看到 HF 文件列表总和为 167GB ,就认为只要 167GB 显存即可运行。
概念混淆:混淆了“磁盘文件体积”与“运行时显存需求”。没有考虑到 KV Cache 、并发数( Batch Size )、上下文长度以及加载精度对显存的放大效应。



clemente 提醒“满血 BF16 需求远超文件体积”、“运行显存还需考虑 KV Cache”。
思路正确:深刻理解 LLM 推理的显存瓶颈不仅在 Weight ,更在于长上下文下的 KV Cache 和计算开销。
@wwhc 体积和运行时加载 vram 消耗是两回事啊
@wwhc 你不妨吧链接和 readme 扔给 ai 解答一下吧
DeepSeek-V4-Pro with 1.6T parameters (49B activated) and DeepSeek-V4-Flash with 284B parameters (13B activated) — both supporting a context length of one million tokens.
@WWwwMMmmMMmmWWww 只能说明你没用到位。。。我 codex/claude 最高档天天用
@vandort 另外游戏显卡 没有 tensor core 或者少很多。 这才是 高性能计算需要的。
@vandort NV 或者 AMD 的 sdk kernel 库都是根据卡 sm 标号来的 你老卡上显存 120gb 也只能解决能跑的问题 速度天花板很低,因为 kernel 是按照 general 或者那个标号来写的
@wwhc 满血 bf16 dtype 应该是 160Gib * 4 以上的需求 还不考虑 kv cache 的话
@vandort 别买电子垃圾 还不如 rtx6000 呢
单张 B100 (192GB VRAM) 可以跑 NVFP4 版本的 deepseek-ai/DeepSeek-V4-Flash-0731
全国考试冠军能去获得诺贝尔奖嘛

只靠会考试这件事本身,是换不来诺贝尔奖的。
会考试≠会解决

考试 和 能力之间 有个转换效率 gap
现在的电脑不靠一种芯片包揽全部工作。不同芯片有自己擅长和不擅长的事,不要求大家能力趋同,互相配合取长补短;不管是家里普通电脑,还是大型服务器,都是这套分工思路。
现在计算都是异构的

cpu 也没必要和 gpu 一样啊
桌面电脑和专业的服务器也一样
6 天前
回复了 wtcs 创建的主题 问与答 关于妹妹要不要继续读书的咨询
学英语去澳洲 或者 学德语去德国吧

这两个国家 对 家庭一般的人是飞跃
捐了
10 欧重症儿童基金
+
5 欧 小猫咪基金
1  2  3  4  5  6  7  8  9  10 ... 53  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4824 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 553ms · UTC 03:57 · PVG 11:57 · LAX 20:57 · JFK 23:57
♥ Do have faith in what you're doing.