引用Andrej Karpathy@karpathy
顺便说一句,这真的非常有效:在你的查询末尾让你的 LLM“将你的回答结构化为 HTML”,然后在浏览器中查看生成的文件。我也曾成功让 LLM 把输出呈现为幻灯片等形式。
更一般地说,在我看来,音频是人类偏好的 AI 输入,而视觉(图像/动画/视频)则是他们偏好的输出。我们大脑中大约三分之一是一个专用于视觉的大规模并行处理器,它是信息进入大脑的十车道超级高速公路。随着 AI 的进步,我认为我们会看到一个利用这一点的演进过程:
1) 原始文本(阅读起来困难/费力)
2) markdown(粗体、斜体、标题、表格,稍微更护眼一些)<-- 当前默认
3) HTML(仍然带有底层代码的过程式形式,但在图形、布局甚至交互性上灵活得多)<-- 尚处早期,但正在形成新的良好默认
...4,5,6,...
n) 交互式神经视频/模拟
在我看来,这种外推(尽管相关技术目前还不存在)最终会走向某种由扩散神经网络直接生成的交互式视频。关于如何将精确/过程式的“软件 1.0”产物(例如交互式模拟)与神经产物(扩散网格)编织在一起,还有许多未解问题,但总体方向类似于最近爆火的 https://x.com/zan2434/status/2046982383430496444
在输入端也有必要的、尚待完成的改进。音频、文本或视频单独都不够,例如,我觉得需要指向和比划屏幕上的东西,就像你与一个实际坐在你身旁、和你共用电脑屏幕的人会做的所有事情一样。
TLDR 人类与 AI 之间的输入/输出心智融合正在进行中,还有很多工作要做,也有重大进展有待取得,远在我们一路跳到类似 neuralink 的脑机接口之类的东西之前。就当前阶段值得探索的东西而言,小贴士:试试要求 HTML。