有些软件自带下水道味
很多组织想要水电大坝级别的业务产出,可现实往往只是数据下水道里一堆漏水管子。每天只要我被迫使用某个专用 SQL 池,我都会开始反省上辈子到底造了什么孽,才会这辈子遇上一个这样的专用 SQL 服务:
-
不允许你给数据库改名
-
在上面跑 Python 脚本有 20 MB 限制
-
你说你想跨数据库复制表,甚至在同一个数据库里复制表?你不知道你的表有不同的列索引存储方式,复制的时候还得自己定义吗?
-
你想在 Get Metadata 上套过滤条件?不存在的
-
想在 for each 里面写 if?不存在的
-
想在循环里拿到当前正在迭代的那个项目?不如试试去抓一把仙尘
那些忽悠别人用这套东西、最后也不知道便宜了哪位神仙或为了什么目的的顾问,在地狱里应该有个专属座位。好了,抱怨够了。这也就是为什么我最近开始对把试卷当数据集来玩产生兴趣。
把考试当数据
想想看,还有比标准化考试更结构化、更一致、更干净的数据集吗!?!?!?它们永远有同样数量的题目、题型,落在定义好的考试大纲之内,等等。简直就是每个数据科学家的春梦……直到你开始处理 PDF。我也觉得这件事特别有意思:生成练习用试卷,让 LLM 去打败它,然后也许再做一个人人可用的 AI 导师。因为对我来说,重点很简单:考试本来就不是给人类设计的。它对智力的衡量糟糕得很,只是对行政管理和文书流程来说极其方便而已。通往 AGI 的路上,世界真正缺的似乎是一个能衡量通用智能到底是什么的好标准;如果 LLM 与考试之间这种双向拉扯,最终能把我们带到一个用更好东西取代标准化考试的未来,那已经算是为人类立了一大功。
微调 GPT 3.5 生成 IB 试卷,仅供演示用途
在地狱里紧挨着那些顾问的,是把 PDF 和 Excel 表格当数据集丢给你的人。事实证明,Document AI 把文本解析出来的效果还不错,但我不想花一分钱(现在回头看,不直接付钱用 API 可能反而更浪费),于是我在键盘上痛苦挣扎了很久之后,只拿 44 个样本去微调 GPT 3.5。结果很有意思:
-
它忠实复现了我文字里一些莫名其妙的空格,所以它真的是照着喂进去的数据分布在学舌
-
有时候它就是一团纯粹的乱码;而事实证明,PDF 是一种必须认真对付的恶魔力量,因为里面有多到离谱的隐形 Unicode 字符
微调 GPT 3.5 生成 IB 试卷
但总的来说,我只是很惊讶这件事竟然这么容易,也已经等不及拿我那台 M2 Max 上从来没真正用过的 64 GB VRAM 去微调一些模型了。我尤其对中国公务员考试很感兴趣,因为那些中立、乖巧、道德模范式的 LLM 实在太无聊、太无害,几乎也就没什么用。我觉得把模型合并起来,看看能不能把中国国家治理逻辑的某种内部表征捕捉为一个先验,会非常有意思。谁知道呢,这东西说不定最后会变成一个极有价值的行为预测器!?
原载于 PubPub:erniesg.pubpub.org/pub/jqeeg1f8。