RecodeX 重构消息,一项名为OntoPrune的LLM上下文剪枝方案公布,称可剪除85%的上下文token,并在CPU环境下将首token延迟(TTFT)提升至6.7倍。该方案聚焦大模型推理阶段的上下文压缩,以降低算力与内存开销。