随着模型参数量和上下文长度的增加,其在推理过程中对于内存容量的要求也在不断提升。目前AI的大规模部署有以下两个特点:模型权重越来越大,上下文越来越长,推理的速度挑战越来越大,推理成本越来越高。模型推理过程中处理的数据越来越大,包括RAG过程中涉及企业或者用户私有的、专业的知识库构建,以及随着用户需求的不断提升,未来可能会实现永久记忆,这就需要记录用户过往的问题和使用习惯,并按照一定的规则进行本体编排,以便日后推理过程中更快速的调用。前述两个已经是很大的数据集了,而目前深度思考和深度研究的推理范式以及多模态的数据的趋势又进一步导致数据集的几何级膨胀。对数据处理的效率要求在提高。