
<aside> 🔬
BandAI 致力于探索抖音电商、生活服务、广告的下一代产品和技术以及大语言模型领域最具挑战的长期关键问题,通过技术变革为用户带来前所未有的体验。
研究方向涵盖:
加入我们,ensure AI creates real-world utility.
</aside>
目录
现实工作流中的很多知识并不是以干净文本的形式存在,而是分散在 Excel、PDF、Word 和 PPT 等真实文件里;这些文件往往包含多 sheet 表格、复杂版式、合并单元格、公式、层级标题和嵌入对象,仅靠“先简单解析文本内容再推理”的方式很容易丢失关键结构信息。针对这一问题,我们提出 File Reasoning 这一任务设定,要求智能体在持久化 sandbox 中直接与原始文件交互,通过 Python 或 Shell 等工具自主探索文件结构、执行中间操作、利用反馈修正错误,并最终完成可验证的文件问答任务。基于这一设定,我们构建了覆盖 XLSX、PDF、DOCX 和 PPTX 的高难度 benchmark,并进一步提出 FIRE 训练框架:先通过 SFT 让模型掌握基本工具调用,再通过状态化强化学习让模型从真实执行反馈中学习更有效的长期规划和错误恢复策略。实验结果表明,FIRE 显著提升了开源模型在真实文件推理任务上的表现,其中 Qwen3-32B-FIRE 在同规模开源模型中取得最佳效果,说明面向真实文件环境的状态化训练是提升 agent 能力的一条有效路径。
海报生成是一项复杂任务,需要协调融合视觉美学与信息层级。尽管近年来的文本到图像模型显著提升了视觉内容合成能力,但其生成结果通常不可编辑,并且难以准确渲染文本。相比之下,现有的布局生成方法虽然能够提供结构化设计,但通常依赖静态的单次预测,缺乏专业设计所必需的自我纠正机制。受人类设计师迭代式工作流程的启发,我们提出 PosterAgent,一种新颖的智能体框架,将海报创作重新表述为由初始草稿生成和后续迭代优化组成的智能体式工作流程。为了有效训练这种多轮交互能力,我们进一步提出 阶段感知强化学习(Stage-Aware Reinforcement Learning,SARL)。该方法将优化过程解耦为面向草稿生成和面向迭代优化的两个阶段,从而分别对初始设计行为和增量式优化行为进行更精确的信用分配。大量实验表明,PosterAgent 显著优于多种强基线方法,验证了智能体系统在图形设计任务中的应用潜力。
在现实世界的软件工程任务中,实现卓越性能的核心瓶颈在于大规模、高质量训练数据的匮乏。由于环境搭建、单元测试生成以及问题描述提取的复杂性,这类数据的规模化一直受到限制。
在本文中,我们提出了 ScaleSWE:一个自动化的、基于沙盒的多智能体工作流,旨在规模化地构建高质量软件工程(SWE)数据。该系统通过协调三个专门的智能体(分别负责环境配置、测试创建以及问题描述合成),对 5200 个代码库中的 600 万个拉取请求(Pull Requests)进行了处理,最终产出了 ScaleSWE Data。该数据集包含 10 万个经过验证的 SWE 实例,是迄今为止同类数据中规模最大的。它在代码库多样性上大幅超越了现有数据集,并反映了真实的任务复杂度。 我们通过蒸馏得到 71,498 条高质量轨迹(Trajectories),并微调 Qwen-30B-A3B-Instruct 模型,进一步证明了该数据集在训练中的实用性,最终产出了 ScaleSWE Agent。我们的智能体在 SWE-bench Verified 基准测试上实现了 64% 的解决率,较基础模型提升了近三倍。ScaleSWE 为数据构建提供了一种可扩展且可复现的方法,旨在推动基于大语言模型的软件工程发展。ScaleSWE 将向公众开放。
强化学习(Reinforcement Learning, RL)已赋予大型语言模型(Large Language Models, LLMs)强大的推理能力,但传统的RL方法主要聚焦于生成能力的提升,其训练仅依赖于一阶展开(即针对一个问题生成多条回复)。我们认为,该途径因忽视了对批判(Critique)能力的训练,未能充分挖掘训练数据的潜在价值。针对此问题,我们进一步引入二阶展开的概念(即针对一条回复生成多条批判性评价),并提出一个统一的框架,以同时训练生成能力与批判能力。在数学数据集上针对多种模型的广泛实验表明,与传统的RL相比,我们的方法能够更有效地利用训练数据,并在相同训练数据条件下取得更优性能。此外,我们还揭示了关于二阶展开与批判训练的多项启发性发现,例如批判训练中标签平衡的重要性,以及基于结果奖励的噪声问题。本工作对强化学习中动态数据增强与生成-批判联合训练进行了初步探索,为RL训练的进一步发展提供了有意义的启示。
大语言模型(LLMs)在充当教学助手方面展现出潜力,但其教学能力仍缺乏充分评估。现有基准主要关注解题能力或题目层面的指导,对以知识点为中心的教学评测相对不足。我们提出一个以教学大纲为基础的评测框架,通过多轮教学互动后学生模型成绩的提升来衡量大语言模型的教学能力。通过将教师智能体的教学内容限制在结构化知识点与例题范围内,该框架能够避免信息泄露,并支持复用现有基准数据集。
我们在跨多学科的高考数据上实例化该框架。实验结果显示,不同模型与不同学科的教学效果差异显著:部分模型在数学上表现较好,而在物理与化学上的教学仍然较为困难。我们还发现,引入例题并不一定带来更好的教学效果,因为模型往往会从概念讲解转向针对例题的纠错与答案评判。我们的结果表明,教学能力是大语言模型行为中一个独立且可衡量的维度。
思维链是增强大语言模型推理能力的关键技术之一,而“隐式推理”在此基础上进一步被提出,用以加速推理链的低效逐token生成过程。我们观察到,现有的隐式推理方法通常需要对模型结构进行大量改动并进行大规模的训练,这限制了它们的应用场景。在本文中,我们提出了CoLT模型,它是一个将隐式推理以“工具调用”的形式实现的新颖框架。与完全在隐式空间中进行推理不同,CoLT会生成包含推理子步骤信息的“种子token”。当一次隐式工具调用被触发时,一个较小的外部模型将接收种子token的隐藏状态作为输入,并将其“解包”回完整的推理步骤。通过这种方式,我们可以确保主模型在显式token上下文空间中进行推理,在保持其推理能力的同时提高效率。在四个数学数据集上的实验结果表明,与基准隐式推理模型相比,CoLT拥有更高的准确率和更短的推理长度,并且能够兼容强化学习算法和不同的解码器结构。