本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题,提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组,并从每个簇中选取演示样本,以增强序列内多样性并保持语义一致性,从而减少高相似演示带来的归纳偏置,使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。
本文提出一种名为 Task Navigator 的框架,利用大语言模型作为导航器,将复杂多模态任务逐步分解为更易处理的子问题,并引导多模态大语言模型按步骤求解。该方法无需重新训练模型,而是系统化地调用 MLLM 已有的多种能力,如 OCR、识别、推理等,从而提升复杂任务的处理效果。作者还构建了包含数学推理、嵌入式文本问答和视觉规划等任务的基准,验证了框架的有效性。