AwareLiquid 受生物学启发的长文本和动态任务LLM架构
M1(AwareLiquid / MT-LNN) 是一个前沿的开源小型语言模型(SLM)项目,旨在打造一种受生物学启发的长文本和动态任务网络架构。它是原型项目“O1”的改进继任者,其核心理念是将彭罗斯-哈默罗夫(Penrose-Hameroff)的Orch-OR(客观还原微管意识理论)与 Liquid AI 的液态神经网络(LNN)概念进行工程化融合。
该项目试图打破传统 Transformer 架构的局限,将深度学习的演进方向从单纯的“算力扩展”拉回到符合神经科学和物理学方程的轨道上。
伟大的发现与核心设计
-
13通道平行微管网络 (Microtubule LNN)
摒弃了传统大模型前馈网络(FFN)静态、离散的计算方式,采用连续时间的微分方程($dh/dt = -h/\tau + f(input)$)来管理隐藏状态。该设计复刻了生物微管的 13 根原纤维(protofilaments)结构。网络中的每个通道同时运行 5 种不同的时间常数($\tau$),能像大脑皮层神经元一样,同时捕捉毫秒级的局部波动和长周期的宏观趋势。
-
多尺度预测编码 (Multi-Scale Predictive Coding)
通过内部架构强制模型进行“预测编码”:高层抽象通道不断向下层感知通道广播预测信号,并计算内部的均方误差(MSE)。这种机制迫使模型在物理层面上构建出一个连贯的世界模型(World Model),而不仅仅是做字面上的“下一个词概率预测”。
-
内源性计算跳过 (Endogenous Compute Skipping / Dynamic $\kappa$-gating)
模拟人类大脑在处理常规信息时“不激活整个皮层”的节能机制。当上下文具有高度可预测性时,动态 $\kappa$ 门控会自动让闲置的通道“休眠”,在不降低表征能力的前提下,呈指数级节省 GPU 的计算消耗。
-
全局工作空间与生物启发模块 (GWTB & Bio-inspired Modules)
引入了基于全局工作空间理论(GWT)的瓶颈竞争机制,信息需要经过多源竞标才能获得全局广播权。此外,项目中还设计了因果一致性检查器、预测状态头以及基于赫布(Hebbian)理论的神经元联合激活正则化。
-
量子启发式的横向耦合 (Quantum-Inspired Lateral Coupling)
在协议通道之间实现了隐式的 RMC 式(关系记忆核心)隐藏状态交叉,模拟了微管内的量子纠缠与信息传递。
颠覆式创新在哪里?
M1 的颠覆性在于它从底层数学和物理结构上挑战了当前大语言模型(LLM)的几大固有瓶颈:
-
记忆矩阵彻底粉碎“内存墙”(Memory Wall)
在传统 Transformer 中,随着上下文的变长,KV Cache 会吞噬海量的显存($O(T)$ 复杂度)。M1 的核心创新之一是引入了衰减工作记忆数组,利用连续的指数移动平均(EMA),将源源不断的新 Token 自然地融合到一个固定大小的 $O(1)$ 状态中,从根本上解决了长文本推理的显存爆炸问题。
-
从“静态离散预测”跃升为“连续液态流动”
传统的网络处理每个 Token 都是独立的瞬间映射,没有“时间流逝”的概念。而在 M1 中,状态不会瞬间跳变,而是呈现出具有物理惯性的“流动”。这种自带 RNN 累积特性的记忆机制,让网络对动态信息的处理具备了极高的细腻度。
更多推荐
所有评论(0)