• 请不要在回答技术问题时复制粘贴 AI 生成的内容
fankcoder
V2EX  ›  程序员

大模型排行榜到底哪个权威?

  •  
  •   fankcoder ·
    fankcoder · 16h 8m ago · 5588 views

    Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?

    1. 排行第 4 https://arena.ai/leaderboard/code/webdev
    2. 排行第 7 https://llm-stats.com/
    3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models
    42 replies    2026-08-05 00:57:00 +08:00
    vzextreme
        1
    vzextreme  
       16h 3m ago
    看厂商对哪家测评机构特调🐶
    cowcomic
        3
    cowcomic  
       15h 55m ago
    arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
    其他数据集评测的主要还是看测试数据分布和泄露情况了

    中文也有榜单
    https://www.superclueai.com/homepage
    tcper
        4
    tcper  
       15h 54m ago   ❤️ 5
    看评分标准,
    arena 就是通过匿名选择喜好,体现用户体验
    llm-stats 是多个评分集的聚合
    AA 自建评测集,这些集体现大模型对未知问题的推理能力

    不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。
    lel020
        5
    lel020  
       15h 53m ago
    牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
    Bootis
        6
    Bootis  
       15h 39m ago
    arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
    fankcoder
        7
    fankcoder  
    OP
       15h 38m ago
    @tcper 感谢
    opeth
        8
    opeth  
       15h 37m ago
    我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
    wang93wei
        9
    wang93wei  
       15h 35m ago
    我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
    klion
        10
    klion  
       15h 32m ago   ❤️ 1
    https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能

    Terminal-Bench Hard

    AA-Omniscience Accuracy

    Humanity’s Last Exam

    GPQA Diamond
    xiaoxixi
        11
    xiaoxixi  
       15h 13m ago
    好多排行站,之前都没关注过
    soulflysimple123
        12
    soulflysimple123  
       14h 55m ago
    https://artificialanalysis.ai/
    我看 Qwen3.8-max 里面还没有
    sillydaddy
        13
    sillydaddy  
       14h 34m ago
    我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
    rich1e
        14
    rich1e  
       13h 45m ago
    排行榜上的权威与真实体验,一些情况下并不相符合

    就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作

    - 视频分析时,可能会用到 claude vision
    - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet )

    以上这些,如果模型没有适配,CC 就无法工作

    所以,大模型排行榜看看就好,权威也改变不了真实体验

    推荐这个,https://x.com/karpathy/status/2083749667410727319
    nakun233
        15
    nakun233  
       13h 37m ago
    当然是 DeepSWE 1.1
    kuhung
        16
    kuhung  
       13h 18m ago
    我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
    sxbaixing
        17
    sxbaixing  
       13h 12m ago
    千问向来是跑分高,体验差
    mmdsun
        18
    mmdsun  
       13h 5m ago via iPhone
    论知名度还是 arena 靠谱
    OumaeKumiko
        19
    OumaeKumiko  
       12h 59m ago
    竟然还没有人发东山奈央的😂 俺也不知道是否权威
    [toyama nao - 知乎]( https://www.zhihu.com/people/toyama)
    uncleroot
        20
    uncleroot  
       12h 55m ago
    不知道有没有各种语言的“人味”排行。机器味太重了
    wakarimasen
        21
    wakarimasen  
       12h 50m ago via Android
    权威这两个字令人困惑。

    如果你要权威数据应该看厂商发布的第一方数据
    Wcowin
        22
    Wcowin  
       12h 47m ago
    具体场景具体分析吧,适合自己就是最强的。
    jonsmith
        23
    jonsmith  
       11h 26m ago
    编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
    cabudad
        24
    cabudad  
       11h 11m ago
    什么排行榜都没有自己亲身使用权威,好不好用了才知道
    SeleiXi
        25
    SeleiXi  
       11h 7m ago
    让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
    ybybwdwd
        26
    ybybwdwd  
       9h 44m ago
    @cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
    levn
        27
    levn  
       9h 34m ago
    普通人类评价早就已经没用了在大多数时候
    jark006
        28
    jark006  
       9h 31m ago
    我比较信 DeepSWE
    Bootis
        29
    Bootis  
       9h 26m ago
    escapefear
        30
    escapefear  
       8h 24m ago
    我奉行对标谁就用谁的原则
    LK996
        31
    LK996  
       8h 18m ago
    和手机评测一样,都是给够前就上的婊子,没有干净的
    Znemo
        32
    Znemo  
       8h 5m ago   ❤️ 1
    哪个 Gemini 排名最低相信哪个。
    William337
        33
    William337  
       8h 5m ago
    没有,需要自行判断,仅供参考
    Haku
        34
    Haku  
       8h 0m ago via Android
    arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
    aes114514gcm
        35
    aes114514gcm  
       7h 12m ago
    @OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
    JerryZhi
        36
    JerryZhi  
       6h 59m ago
    目前普遍思路是采集十几个排行榜求平均(或者加权)
    cellsyx
        37
    cellsyx  
       6h 42m ago
    比较符合个人体验的是 DeepSWE (不包括前端设计能力)
    FlashEcho
        38
    FlashEcho  
       6h 17m ago
    根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
    Glauben
        39
    Glauben  
       5h 32m ago
    我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
    Mandelo
        40
    Mandelo  
       4h 49m ago
    没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
    mingtdlb
        41
    mingtdlb  
       3h 30m ago
    arena 的 side-by-side 不是一样可以选哪个更好,但这个结果是否参与排名不懂得,如果参与,那就可以刷了。。。

    我认为实际还是要自己测试,给一个任务,看哪个模型做的最合你意。排行榜随便看一个就行,一般都相差不会太多,比如 ds 在排行榜 1 是第十,在排行榜 2 就不会跑到第 30 去
    NQ
        42
    NQ  
       40 mins ago
    那种修开源项目 PR 的可以看看,好歹能测出来一点工程能力,纯聊天或者写玩具项目的就算了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1212 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 92ms · UTC 17:37 · PVG 01:37 · LAX 10:37 · JFK 13:37
    ♥ Do have faith in what you're doing.