$V2EX
Solana
Give SOL to Copy Address
使用 SOL 向 feeeei 打赏,数额会 100% 进入 feeeei 的钱包。
 feeeei's recent timeline updates
feeeei

feeeei

🏢  Golang
V2EX member #87408, joined on 2014-12-19 14:31:24 +08:00
Today's activity rank 24308
feeeei's recent replies
作者问题,你换个赛道看看,你看看 OpenClaw/Hermes ,不过这俩比较极端,一天 800 个 commit...

稍微正常一点儿的,比如 sub2api ,平均一天几十个 PR ,人工肯定 Review 不过来,都是 AI 写、AI Review
@owen800q 要不就是每个员工自己订阅,要不还是买外面的中转站吧,很多号池技术还是有点儿猛...

我帮一个中转站老板修 BUG ,人家机器都是直接拉满的双路 EPYC 7702 + 1T 内存 + 10G 无限流量的配置,羡慕死了
默认是看不到的,sub2api 也不会记录会话数据,只会记录用量是为了拿来做计费用的

不过有一个 SUB2API_DEBUG_GATEWAY_BODY 的开关(默认关闭),打开这个开关之后会落盘数据,是方便 DEBUG 用的,除非还有一个外挂系统来消化处理重新汇总成会话,否则这玩意儿不会开的。

因为每次对话都是带着这个会话的全部上下文的,等于 sub2api 的网络 IO 数据全落盘,巨大...

打开 SUB2API_DEBUG_GATEWAY_BODY 开关之后,数据记录大概长这样:
========== [2026-07-29 14:03:21.482] CLIENT_ORIGINAL ==========
--- context ---
account: 12(账户名)
account_type: anthropic
model: claude-opus-4-20250514
stream: true
--- headers ---
Host: api.anthropic.com
User-Agent: claude-cli/1.0.x (external, cli)
authorization: Bearer [redacted]
anthropic-beta: oauth-2025-04-20,...
--- body ---
{
"model": "...",
"messages": [ ... ]
}
@honjow 哎,算了,我再苦口婆心地给你解释一遍吧。上面蒙娜丽莎其实已经讲得很清楚了,看来你还是理解不了

如果面对的是一个 GUI 客户端,大模型通常无法直接调用它的内部接口,只能通过“识别屏幕画面+模拟鼠标键盘操作”的方式进行交互,效率上就天差地别

然后这其中的图像识别就是多模态能力了啊,比如 GUI 里面有一张日志链路图表,ZCode 现在的处理方式是先调用一个 GLM-5V-Turbo 这样的支持多模态的小模型,把这张图片识别完毕之后翻译成文字,翻译成文字必然是丢失数据失真,比如:
他总结出来的内容是“这是一张日志链路追踪图,第一个节点是 xx ,第二个节点是 xxx ,每个节点分别日志是 xxx ,xxxx ,耗时 xxms”。但是有可能图片中的连线粗细表达了权重关系、线条颜色深重表达了 SLA 质量,Z 轴高度表达了调用次数等等,有可能这些信息他在翻译成文字的过程中就都丢掉了,没识别出的内容,要不就是后面的文字模型永远看不到,要不就是后续会反复一遍遍再调用 OCR 图片识别。

如果他是一个原生多模态模型,图片被存储成了图像 token 就不会有这个问题,明白了没?
@honjow 好的好的,你都说了“那智谱没有多模态”了,你几斤几两、什么水平已经显而易见了

无需多言,再讲什么都是在招笑话了
@honjow “那智谱没有多模态”这句话是谁说的,上来就说"那智谱没有多模态",还嘴这么硬... 我想问问你,你这种情况,持续多久了?
@honjow 你到底用没用过啊.... 啥都不懂就开始人身攻击,你不怕打脸给你打肿?!?!?

1. “那智谱没有多模态”,谁说智谱没有多模态,GLM-5V-Turbo 不知道?
2. “Zcode 是怎么用”,你到底用没用过,你没发现你上传图片他会单独调用 analyze_image tools ?你但凡用过一次看到输出就不会有这么蠢的问题,你没发现他是把图片先分析成文本再开始处理?明显就是先调用了一次 GLM-5V-Turbo 做图片识别,把输出的文字内容丢到主会话中继续处理

所以 Zcode 是通过嫁接的方式实现的图片识别,问题是很多图片通过文字表述就严重失真了,比如不管你怎么文字描述蒙娜丽莎的图片,AI 都没办法给你画出蒙娜丽莎,只有原生多模态直接图片输入的才能保持图片信息不失真,懂?

不懂就多查查,别肚子没几滴墨水就开始攻击,被打脸不尴尬吗
GUI 是图形化界面,考验大模型多模态识图能力
CLI 是命令行,纯文字,属于是 raw 级别交互,在所有大模型都在卷 agent 能力的今天,命令行交互属于是 AI 最基础的能力之一了
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   954 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 28ms · UTC 21:41 · PVG 05:41 · LAX 14:41 · JFK 17:41
♥ Do have faith in what you're doing.