
股票配资那家好
你有没有试过照着YouTube视频学折纸?
那种感觉大概是这样的:主播的手一晃,一张方纸忽然就变成了三角形,你按下暂停,倒回去三秒,还是没看清楚到底是往哪个方向折的。人类尚且如此,那计算机呢?
这正是以色列魏茨曼科学研究所和MIT的一组研究者盯上的问题。他们做了一个叫FoldingAgent的系统,目标很直接:给它一段折纸教学视频的关键帧,它要自己推理出每一步到底做了什么折叠动作,并且把整个折纸过程变成一段可以被计算机执行、可以重新渲染、可以编辑的程序代码。
这事听起来简单,做起来却牵扯出一堆有意思的麻烦。
折纸的"两种语言",谁也不懂谁
先说说这个问题到底难在哪。
折纸这门手艺,自古以来靠的都是"演示"来传承。一本折纸教程,一段视频,靠的是分步图解或者真人示范。可计算机科学里研究折纸,靠的却完全是另一套东西:一种叫做**crease pattern**的表示法。
crease pattern(折痕图):把一张纸完全展开后,上面所有折痕的位置和类型(山折还是谷折)画成的一张图,是折纸的"设计图纸",不含时间顺序信息。
问题就出在这里。折痕图是静态的、和顺序无关的,它告诉你"这张纸上有哪些折痕",却不告诉你"应该先折哪一条,后折哪一条"。而人类看视频学折纸,靠的恰恰是那个先后顺序,是那双手在纸上移动的轨迹。
这就好比你拿到一份宜家家具的爆炸图,上面画满了每个零件最终该待在哪个位置,可你完全不知道该先拧哪颗螺丝、先装哪块板子。零件位置对了,但你照着装十有八九会卡壳,因为家具组装这件事,本质上是有先后依赖关系的过程,不是一张静态快照能表达完的。
折纸恰恰也是这样一个过程。这也是为什么,此前所有做计算折纸的工作,无论是分析折痕图能不能折平,还是从折痕图反推设计方案,全都默认"折痕图已经给你了",没有人真正解决过"怎么从一段视频里把这个折痕图连带折叠顺序一起提取出来"这个问题。
这篇论文要做的,恰恰是把这道鸿沟填上。
为什么不能直接让AI"看图猜答案"
那能不能简单粗暴一点,直接把视频帧丢给一个视觉语言模型(VLM),让它输出折痕图呢?
VLM:Vision-Language Model,视觉语言模型,能同时理解图片和文字、进行跨模态推理的AI模型,比如GPT-4V、Gemini这类。
研究者们确实先试了这条路,作为对照组(后面会看到具体数据)。结果惨不忍睹:直接预测折痕图的方式,最终生成的几何结构里,只有8%能被专业的折纸编译器成功处理,其余92%要么自相矛盾、要么存在几何上的自相交、根本就是"叠不起来"的假折纸。
这个数字值得多说两句。8%是什么概念?相当于你让一个从没学过木工的人照着效果图打家具,十件里九件都是散架的。VLM虽然见过大量图片和文字,但它对"折纸必须遵守的物理规则"完全没有概念,比如一张纸展开后必须严格是个正方形,比如每个内部顶点周围的折痕角度必须满足某些数学定理(后面会讲到)。让它凭空生成一整张折痕图,就是让它在没有物理常识的情况下硬猜一个复杂的三维结构,猜错是必然的,猜对反而是运气。
这也是整篇论文最核心的设计判断:不能指望VLM一步到位地"想明白"整个折纸方案,得把这件事拆成一步一步的小任务,每一步都有工具帮它验证对不对。
用五个动作,拼出整个折纸世界
那怎么拆呢?研究者们首先要解决的是给折纸动作"定规矩"。
他们把研究范围限定在**Pureland origami**(纯粹折纸)这个子类别里。
Pureland origami:一种折纸风格的正式术语,规定所有折叠必须是沿一条直线的平面折叠(山折或谷折),不涉及斜切、曲面折等复杂技法,是入门折纸教程里最常见的类型。
选择Pureland不是偷懒,而是精明的取舍。它的表现力足够覆盖真实世界里绝大多数教学视频(研究者从一个折纸网站上找到60个模型,其中40个都是Pureland),但它把动作空间压缩到了极小的几个基本操作,这样AI才有可能学会。
具体来说,整套动作只有五种:
add_vertex(在某条边上按比例插入一个新顶点,方便沿着不经过原有顶点的位置折叠)、fold(沿某条边折叠,并指定往哪个方向折)、unfold(撤销之前的折叠,留下折痕标记)、rotate(整体旋转纸张)、flip(把纸翻面)。
这五个动作可以像搭积木一样组合起来,表达从简单三角形折叠到复杂多层花瓣折的各种效果。这里有个细节值得注意:为什么fold操作要用"边"来指定,而不是用一条抽象的直线?因为同一根几何直线,在不同的纸张状态下可能对应完全不同的折法(涉及哪些面、哪些层),用边来锚定,能确保命令精确对应当前的拓扑结构,不会产生歧义。
光有动作词汇表还不够,还得有个东西记住纸此刻长什么样。研究者设计了一套状态表示法,本质上是一个包含顶点、边、面的平面图,还额外加了两个字段:每个面朝上的是正面还是反面,以及所有共面的面之间"谁压着谁"的层叠顺序。这套表示法建立在**FOLD格式**基础上做了扩展。
FOLD:一种基于JSON的标准折纸数据格式,被多种折纸设计工具和模拟器广泛采用,用来描述顶点、边、面以及每条边的折叠属性(山折/谷折/平边/边界)。
有了这套精细的语言,接下来的问题就变成了:谁来把视频里的画面翻译成这套语言?
不让AI"一个人扛下所有股票配资那家好
文章为作者独立观点,不代表联华证券实盘配资_实盘炒股配资_正规配资公司观点