 |
|
irvinghua
V2EX member #221520, joined on 2017-03-17 13:41:01 +08:00Today's activity rank 7684
|
irvinghua's recent replies
我的意见是,如果你数据格式是固定的,并且筛选、统计的逻辑也是固定且清晰的,那就 vibe coding 写程序按照固定流程来干完这活。这种情况下别把 ai 掺活进来。
如果你的数据格式不固定(非结构化),或者处理数据的逻辑也不固定。你此时引入 ai 来自动化处理数据,那你就得接受 ai 总有小概率会给你一个错误的统计数据。这是目前 ai 娘胎里带出来的毛病,此缺点无解。
这不就是智能取数或者说 text2sql 做的事情?
1.看你描述,都有固定的列名,那说明是结构化数据。既然是结构化数据,取到数据后为啥不存数据库?为啥是写文件? sqlite 或者 MySQL 应付这种量级数据都绰绰有余。
2.智能取数/text2sql 就是个研究型概念,没有哪家公司说有完整可靠的方案。假设 AI 统计数据有 5%或者 3%的概率出现幻觉,导致汇总的数据就错的,你如何发现并校验改正?
楼主可以翻一翻《软件工程》教科书
你说的是软件工程里面的瀑布模式和快速原型模式优劣之争,不是啥新鲜事
openspec 不就是专门解决你这种场景问题而诞生的
这个工作感觉我很胜任,但我人不在上海。
我干过医疗领域里的爬虫编写、非结构化数据解析、清洗,也用过 neo4j 、PostgreSQL 、ClickHouse 、doris ,更做过 BERT 模型微调来进行生物医药实体识别,甚至还做过埋点。
但是这是我 6 年前的工作经验,AI 大模型出来后,感觉这套技术框架完全落后了。我后面调到其他项目组去了,就没有关注和继续架构升级了。
我比较好奇的是,现在大模型这么厉害了,为啥还要 bert 模型进行 fine tune ?我当年做 bert fine tune 是苦于 gpt-3.5 等大模型还没问世。到 2026 了,本地部署一套国产大模型如 deepseek ,或者网络允许的话,使用在线顶尖大模型,它的实体识别的召回率,比你们 bert fine tune 的效果还要差很多吗?
codex 传统手艺了。
上周我手上有个 7000 条数据的 json 需要读取关键字段做数据清洗,因为量太大,我选了便宜模型 haiku 处理一遍,处理结果放在了 A 目录下,我查看了下,数据质量很糟糕。
于是我又让 codex gpt5.5 按照我数据清洗要求处理一遍,结果这小鬼扫描到了我 A 目录下已经有现成处理结果,直接把它复制粘贴到了 B 目录下,然后告诉我完成了,去 B 目录下查看结果。
跟你这有异曲同工之妙。
有这么夸张吗?昨天用 fable 5 写 plan ,没见到比 opus4.8 多花销多少啊。我写的还是几万字那种长篇 plan
All work and no play makes jack a dull boy 。
All work and no play makes jack a dull boy
All work and no play makes jack a dull boy 。
All work and no play makes jack a dull boy 。
All work and no play makes jack a dull boy 。
All work and no play makes jack a dull boy 。
要是 AI 一直打印这个,楼主会不会被吓尿?
All work and no play makes jack a dull boy
All work and no play makes jack a dull boy
ES 的应用场景其实很窄,就只擅长文档检索。OLAP 这行业发展很缓慢,导致 ES 和 Hive 这种狭窄领域的特长生,被很多人拿来当 OLAP 领域的通才用。直到最近 7 、8 年才百花齐放,出现了很多很好用的 OLAP 工具。你这种是属于典型的日志型分析数据,应该交给日志数据专长生 clickhouse 来做。其实更推荐 Doris 这个真正的通才,做日志查询,点查,聚合查,ads 报表查,文档查询,一个工具全搞定。
不过说实话,你这个机器配置太寒碜了(估计 CPU 核数也不太多),直接上 clickhouse 或者 Doris ,跑起来很艰难,再说你这数据已经非常小了。没必要上这么重型工具。1 亿数据 mysql 就完全能搞定。把你设备上报的数据先接入 MQ ,再写个工具消费 mq 数据后,在 redis 里维护这几百台设备位置信息的 list 队列,你的程序只负责维护每个队列直接 LPUSH ,加 LTRIM 。redis 查询,那基本就是 ms 级别查询。