lelelelelelele
V2EX  ›  问与答

Kimi K3,不来个朴实无华的讨论吗?

  •  
  •   lelelelelelele · 6 days ago · 8887 views
    59 replies    2026-07-17 18:00:37 +08:00
    dingawm
        1
    dingawm  
       6 days ago   ❤️ 1
    owen800q
        2
    owen800q  
       6 days ago via iPhone
    ## Frontend Code Arena Leaderboard
    ### **Top Model: Kimi-K3 (Ranked #1)**

    | Rank | Model Name | Arena Score |
    | :---: | :--- | :---: |
    | **1** | **Kimi-K3** | **1,679** |
    | 2 | Claude Fable 5 | 1,631 |
    | 3 | GPT-5.6 Sol (xHigh)... | 1,618 |
    | 4 | GLM-5.2 (Max) | 1,587 |
    | 5 | Claude Opus 4.8 (Thinking) | 1,562 |
    | 6 | Grok-4.5 | 1,558 |
    | 7 | Claude Opus 4.7 (Thinking) | 1,558 |
    | 8 | Claude Opus 4.7 | 1,555 |
    | 9 | Claude Opus 4.6 (Thinking) | 1,542 |
    | 10 | Claude Sonnet 5 (High) | 1,542 |
    | 11 | Muse Spark 1.1 | 1,538 |
    | 12 | Claude Opus 4.6 | 1,536 |
    | 13 | Claude Opus 4.8 | 1,534 |
    | 14 | Seed-2.1 Pro | 1,534 |
    | 15 | GLM-5.1 | 1,526 |
    | 16 | Claude Sonnet 4.6 | 1,522 |
    | 17 | Qwen-3.7 Max | 1,516 |
    | 18 | Kimi-K2.6 | 1,515 |
    | 19 | GPT-5.5 (xHigh) | 1,504 |
    | 20 | MiniMax-M3 | 1,493 |

    ---

    > **Source:** Arena AI Leaderboard (`arena.ai/leaderboard/code`)
    connor123
        3
    connor123  
       6 days ago   ❤️ 1
    国产模型都一个问题,模型能力顶级,商用算力拉跨,花了钱体验也不一定好
    lelelelelelele
        6
    lelelelelelele  
    OP
       6 days ago
    服了,这图片上传🤦‍♀️一顿折腾...
    liansishen
        7
    liansishen  
       6 days ago
    看了下 opencode go 里也有了,不过价格感人
    catazshadow
        8
    catazshadow  
       6 days ago via Android
    @connor123 模型能力在特定的跑分测试里可能是顶级
    lelelelelelele
        9
    lelelelelelele  
    OP
       6 days ago
    @liansishen 看了下,确实呀。10 倍用量的区别了 ~ 但看 artificialanalysis.ai 的价格好像只是差 3 倍左右。opencode go 应该是直接转发到“自己”的订阅账号,估计他们的订阅账号不够、所以价格抬得比较高。(我为什么猜,opencode go 是转发的呢,有一次 deepseek api 寄了,我发现 opencode go 的 deepseek 也寄了)
    lelelelelelele
        10
    lelelelelelele  
    OP
       6 days ago   ❤️ 2
    @catazshadow 开源第一是肯定的了。我一般看两个榜:livebench.ai, artificialanalysis.ai 。看起来都挺靠前的
    hahiru
        11
    hahiru  
       6 days ago
    出来就冲了 99 套餐。然后发现 kimi work 的 K3 集群模式下一条命令干掉四分之一的月额度。两条命令干掉一半月额度。只能说能用,但是生产力需要加钱。另外集群模式着实有点慢,一条命令半小时。
    ebushicao
        12
    ebushicao  
       6 days ago
    用 opencodego 订阅的测试了一下,还不太好判断,但额度已经到了... 价格是 2.7 的 3 倍还多,我在考虑要不要买个官方订阅试试
    boringwheat
        13
    boringwheat  
       6 days ago
    @connor123 就是有能力,没算力?
    lelelelelelele
        14
    lelelelelelele  
    OP
       6 days ago
    @hahiru 我以前使用 99 套餐,基本不够用。可以试试 199~不过我也不确定 199 套餐的 k3 能顶多久。199 之前 k2.7 我每个月基本只用 60-70%。
    Nexora
        15
    Nexora  
       6 days ago
    @lelelelelelele #6 安装 V2EX Polish 这个浏览器插件,直接就能粘贴图片
    lelelelelelele
        16
    lelelelelelele  
    OP
       6 days ago   ❤️ 1
    点名批评 glm ,每天都调闹钟抢,根本抢不到。
    lelelelelelele
        17
    lelelelelelele  
    OP
       6 days ago
    @Nexora okk
    cat9life
        18
    cat9life  
       6 days ago
    @hahiru #11 99 的套餐是严阉割的,没有 1M 上下文?
    dingawm
        19
    dingawm  
       6 days ago
    @boringwheat #11 能力也还差一档

    审美确实不错,前端界面、样式顶级,但是真慢,后端目前还没详细测,有空弄个项目让他试试
    kimi 一贯的前端不错,其他能力一般
    xiaokaitongxue
        20
    xiaokaitongxue  
       6 days ago
    @cat9life 199 开始 CLI 可以用 1M
    ration
        21
    ration  
       6 days ago
    试用了 Qoder 的 kimi K3,隔一个请求就等待?
    colaffee
        22
    colaffee  
       6 days ago
    GLM5.2 k3 这种情况就是需要像国外大厂那样投钱,但那样就得烧钱,暂时看不到回头钱。难搞
    106npo
        23
    106npo  
       6 days ago
    价格已经和 sonnet 一致了,考虑到 claude 套餐的倍率,那是和和 opus 一个价格了
    xuhengjs
        24
    xuhengjs  
       6 days ago
    参数越多,配置越高,token 消耗越多。都是成本。
    Mar5
        25
    Mar5  
       6 days ago
    只能说跑分飞起,实际体验跟 o/a 有差距。
    ZColin
        26
    ZColin  
       6 days ago
    有人测过不 199 的话 coding plan 能用多少 token ?
    jimrok
        27
    jimrok  
       6 days ago
    发了也是象征性的,国内算力不能用的爽。现在 ai 服务程序员都不够,还说什么星辰大海。
    lelelelelelele
        28
    lelelelelelele  
    OP
       6 days ago
    @xiaokaitongxue api 也可以(同理可以配置到 opencode, zcode 等)
    lazyfighter
        29
    lazyfighter  
       6 days ago
    opencode 试了试 没感觉哪里好, 甚至出现了偷懒的情况
    lelelelelelele
        30
    lelelelelelele  
    OP
       6 days ago
    @ration opencode 测完回来啦,并不会隔一个请求等待。但回复缺失没有 k2.7 快、而且更倾向输出英文。


    @106npo 确实价格差不多了,但是“跑分” 对比 sonnet k3 会高一点(考虑到倍率说得是中转站,按 token 收费。kimi 的会员感觉是量大管饱、且 199 不怕欠费,具体倍率我参考 https://github.com/mahonzhan/awesome-coding-plan )。反正我一直不太喜欢中转站(但是我也用,哈哈哈哈)


    @Mar5 看场景。可能在你的场景、你场景适配的 harness 下,确实会 ~ (因为你之前就是用 o/a 搭建的 harness )


    @ZColin 我参考 https://github.com/mahonzhan/awesome-coding-plan


    @jimrok 算力够不够实际体验就是:限不限购(这里再次点名批评 bigmodel )、有没有 429 。反正我从 k2.6 一直过来、调用都很流畅。
    dcatfly
        31
    dcatfly  
       6 days ago
    @ZColin L 站有人算过,199 的套餐每周能用 180M 的 token ,而 20 刀的 Codex 不算重置是 200M
    另外 199 的套餐是 kimi 最划算的套餐,199 是 20x 额度,而 60x 额度是 699
    106npo
        32
    106npo  
       6 days ago
    @lelelelelelele
    我说的倍率就是套餐的倍率啊,max 20x 200 刀的套餐又不是只能用 200 刀 API 。
    你说的那个 github 就是瞎测,让他测试下缓存计费情况他当看不懂关掉了。
    实际 kimi 套餐缓存免费,但只有 4 倍价值,
    claude 我记得是 10 倍,这么算下来 kimi 的价格又要再乘 2.5 ,那就和 opus 一样了。

    真说中转站,几毛一刀的都有,那 kimi 价格都能吊打 fable 了
    106npo
        33
    106npo  
       6 days ago
    @dcatfly 你说的这个测试也太怪了,现在 kimi 后台都能看到百分点后 2 位了.
    经过几轮的差额测试,结论是缓存是不收费的.(要计算缓存输入输出的收费模式,得有几轮各种比例不一样的数据进行计算)
    而他这个 180M 肯定是带了缓存的.
    实际测出来,699 的套餐周限价格在 700 出头(缓存不计费).
    tallest
        34
    tallest  
       6 days ago
    用不起,太贵了。99 块钱的订阅,搞不到几句话 5 小时额度就没了,同时还能吃掉三分之一左右的周额度,百分之十左右的月额度。
    dcatfly
        35
    dcatfly  
       6 days ago
    @106npo #33 https://linux.do/t/topic/2599293 原贴在这里,需要登录。

    为什么说缓存是不收费的?你可以分两个会话用完两个 5 小时的额度,然后按 api 计算这两个会话的 api 价格是否一致。
    Pythoner666666
        36
    Pythoner666666  
       6 days ago
    让分析了下项目 review 还没完呢,5 小时额度已经干完了。结果都没出有出来,体验太差了
    duanxianze
        37
    duanxianze  
       6 days ago
    太贵了 比我手写代码都贵了
    longaiwp
        38
    longaiwp  
       6 days ago
    @lelelelelelele 他们家都是批量买官方,谈一个折扣价,然后加一点钱卖给你们,就是一个中间商,记得他们家没有自己的算力。
    106npo
        39
    106npo  
       6 days ago
    @dcatfly 没账号.
    全部用完 5h 也可以,只要有缓存率不同的样本.
    现在后台都能看到万分之一的精度了,那不用那么麻烦,跑几个用了百分之几的数据算下就出来了.
    m1nm13
        40
    m1nm13  
       6 days ago
    太贵了, 实测 199 的 KIMI CODE 的 K3 的量, 和 claude pro flabe 的量差不多

    跑了 1M 不到上下文直接干空了 5 小时量


    性能一不一样不知道, 起码价格是一样了
    Jlzeng
        41
    Jlzeng  
       6 days ago
    @m1nm13 #40 感谢实测,差点就去冲了,就这点完全不够用,现在 Grok+Sol 完全足够了
    xidaduo
        42
    xidaduo  
       6 days ago   ❤️ 1
    首先太贵了,其次大家对国产模型的能力已经没有那么多信任度,能力吹上天,落地成一坨。最后 Tibo 天天搞重置,我 token 都用不完了,Who cares about K3?
    Mocus
        43
    Mocus  
       6 days ago
    贵,昨天退了 99 冲了 199 ,没想到第二天就吃到了 K3
    比 K2.7 强是肯定的,跟 Claude Opus 和 Fable 一样喜欢并行,在做形式化验证
    但你要问我效果如何……只能说额度太少看不出来,只蹬了 6 小时就没了
    SayHelloHi
        44
    SayHelloHi  
       6 days ago
    K3 生成 UI 如何?

    有老铁说说么~😁
    FireKey
        45
    FireKey  
       6 days ago
    yysy,能拿来和 fable5 比较就已经很顶了.去 x 上逛了圈,除了抱怨算力问题,评价大概在 5.6 水平.感觉如果算力充足的话作为日常开发肯定是够的,现在普通用户的需求已经很难区分 ai 的代码能力差距了.
    lelelelelelele
        46
    lelelelelelele  
    OP
       6 days ago
    @FireKey 我也感觉是。我一直记得一个比喻,就是模型调用,就好像 音响,慢慢地大家就听不出所谓“最好的音响”的区别了。(就好比有人说 apple, sony, 铁三角, 曼哈顿 才是最最顶级的)

    抛开对顶尖模型的追求,我觉得 “世界就是由一群 `80` 分的玩家建造的,而不是一群 `爱因斯坦` ”,另一个比喻是:上半年 gpt-5.4 写的代码,在下半年出了 gpt-5.5/5.6 之后也不用重写。
    yvescheung
        47
    yvescheung  
       6 days ago
    推上吹得跟神一样,我还特地去买了 Kimi 会员试了试前端究竟有多牛逼,蹬了一上午也就那样,烧了半周的额度改出来的前端上来就给来了个不遵守 skills 的 UI 错误。
    fcten
        48
    fcten  
       6 days ago
    真的慢。体感只有 20 ~ 30 token/s 。而且即使这么慢的情况下,99 套餐单任务开发也只能撑 2 小时不到。已升级 199 套餐。
    效果还可以,让它帮我把项目的前端优化一下,找出来的问题基本都对,解决方案也不错。准备拿它辅助 Codex 一起用一段时间看看。
    ZhKW
        49
    ZhKW  
       6 days ago
    太贵了,有点奢侈品的感觉了。
    Rorysky
        50
    Rorysky  
       6 days ago
    从 kimi k3 能拼 opus 4.8 和 追 fable 5 看,opus 和 fable 参数量估计也就是在 4T-6T 左右,kimi 这次一下子啊干到 2.8T ,2T 以下的闭源模型直接被斩杀了
    seansong
        51
    seansong  
       6 days ago
    这两天刷到了很多无脑的宣传,使劲吹碾压 Fable5 和 GPT sol ,瞬间就没有好感了
    AIgogo
        52
    AIgogo  
       6 days ago
    @seansong 都是自媒体吸引眼球的手段罢了,实际还要看评测和反馈
    Rickkkkkkk
        53
    Rickkkkkkk  
       6 days ago
    说比 fable 还强得给出点强有力的证据才行呀...
    duluosheng
        54
    duluosheng  
       6 days ago
    @connor123 #3 这样看是算力不足导致的
    qiaobeier
        55
    qiaobeier  
       6 days ago
    @ZhKW 而且付款方案太恶心了,要用 API 必须买 199 一个月的套餐。还是 DeepSeek 好,随买随用,希望他们下一个版本支棱起来,现在的版本还是差的有点远。
    MaiGe
        56
    MaiGe  
       6 days ago
    whyso
        57
    whyso  
       6 days ago
    99 套餐,用 kimi code for vs code ,一个任务跑十几分钟断了,控制台一看 5 小时额度 100%,周额度 21%
    mooyo
        58
    mooyo  
       6 days ago
    慢是没算力,贵是因为大。

    没有黑魔法。
    whyso
        59
    whyso  
       6 days ago
    @whyso 使用记录 83 条,其中 4 条 403
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3090 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 132ms · UTC 13:23 · PVG 21:23 · LAX 06:23 · JFK 09:23
    ♥ Do have faith in what you're doing.