论文标题:BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

作者单位:浙江大学脑机智能国家重点实验室等

核心价值:用 LLM 驱动的多智能体系统,把自然语言意图自动落地为可执行的、端到端脑信号分析流水线,从而降低 BCI/EEG 分析的技术门槛。

一、研究背景与动机

脑机接口(BCI)与脑信号理解是临床健康与下一代人机交互的关键技术。EEG 因非侵入、高时间分辨率,在睡眠分期、疲劳监测、认知负荷评估、情绪识别等场景应用广泛。

脑信号分析范式经历了两次演进:

当前“解码为中心”的范式仍缺乏 agentic intelligence(智能体能力),阻碍真实部署:

  • 技术门槛高:需要编程、信号处理等专业知识,临床医生和普通研究者难以参与。

  • 静态且任务特定:真实场景需要长程、多步流水线(如睡眠诊断:加载 → 预处理 → 分期 → 报告),现有方法难以自主编排。

LLM 具备规划与工具调用能力,可将人类意图翻译为可执行分析流程。已有工作如 EEGAgent、ChatBCI、NeuroChat 等,但多停留在预定义、相对僵化的流程,且缺乏系统 benchmark。

BrainAgent 的目标: 用分层多智能体架构,把自然语言指令 ground 到严格、可执行、端到端的脑信号处理流水线,实现“民主化”的脑信号理解。

二、BrainAgent框架

1. 整体架构

图片

<span leaf="">用户查询&nbsp;<span>Q</span>&nbsp;+ 脑信号文件 D</span>

共享状态 V_shared:管理工具输入参数与中间产物,保证层级间数据流一致。

2. Supervisor(调度器)

  • 职责:高层意图推理,不做低层执行。

  • 策略:

    - 若上下文足够,直接回答,减少计算开销。

    - 需要外部执行时,严格无工具,仅用语言推理分解任务并分派给子智能体。

    - 子任务完成后,从“调度者”转为“综合者”:跨域推理、识别因果关系(如将 EmotionAgent 的焦虑指标与 SleepAgent 的睡眠碎片化关联,诊断“焦虑诱发失眠”)。

  • 设计原则:关注点分离,Supervisor 保持与用户意图的全局对齐。

3. Sub-Agents(执行者)

当前实现两个代表性子智能体:

两大机制:

  • 分层资源访问:共享基础工具(EEGFileLoader、EEGPreprocessor 等)+ 领域专属工具(SleepStager、EmotionFAAAnalyzer 等)+ 通用/领域知识库(如 AASM 手册)。

  • 上下文隔离:子智能体看不到全局对话历史,只接收具体任务指令与前序执行输出,避免 scope creep,降低幻觉与 token 消耗。

三阶段执行流程:

  • Supervisor 分解并分派子任务

  • 各 Sub-Agent 规划工具序列、执行、生成子报告

  • Supervisor 聚合子报告,生成最终响应

三、工具与知识库体系

1. 通用工具(所有子智能体可用)

  • EEGFileLoader:加载 .edf/.bdf 等格式

  • EEGPreprocessor:滤波、重采样、重参考、ICA 等(仅在用户明确要求时执行)

  • EEGPloter:raw / PSD / connectivity 等可视化

  • EEGFeatureAnalysis:时域、频域、非线性、 connectivity 特征

  • EEGQualityAssessor:通道质量、伪迹检测

  • EEGSaver:保存处理结果

2. SleepAgent 专属工具

SleepStager、SleepHypnogramsPloter、SleepReportGenerator、SleepSpindleDetector、SleepKComplexDetector、SleepSlowWaveDetector、SleepArousalDetector、SleepSpectrogramPloter、SleepDisorderRiskAssessor 等,工具间有明确依赖(如报告生成需先 SleepStager)。

3. EmotionAgent 专属工具

EmotionFAAAnalyzer、EmotionBiomarkerExtractor(BAR/TBR/TAR/APF)、EmotionStabilityAnalyzer、MentalWorkloadCalculator、MentalHealthRiskAssessor 等。

4. RAG知识库

  • 通用层:频带定义、10-20 电极系统、基础伪迹等

  • 领域层:SleepAgent 用 AASM 标准;EmotionAgent 用情绪计算 biomarker 文献

  • 两阶段检索:Bi-Encoder 粗检索(MiniLM + FAISS)→ Cross-Encoder 精排(ms-marco),Top-K 注入上下文

四、分层评测基准(Benchmark)

为弥补 agentic BCI 系统缺乏系统评测的空白,作者建立 三层难度 的 benchmark:

1. 评测指标

  • TCR (Task Completion Rate):端到端无运行时错误完成的比例

  • R-ACC (Routing Accuracy):Supervisor 分派智能体集合与 ground truth 一致的比例

  • TCE (Tool Call Efficiency):成功任务中“必要工具数 / 总调用工具数”的均值(越高越精简)

Ground truth 含 routing(OR/AND 逻辑)与 must_have_tools(关键路径工具集)。

2. 实验设置

  • 数据:ISRUC Subgroup-1(6 受试者)+ HMC(4 受试者),共 10 人

  • 任务:60 个(L1/L2/L3 各 20)

  • 重复:每 subject-task 对独立运行 5 次 → 共 3000 条执行轨迹

  • LLM 骨干:闭源 Qwen-Flash/Plus/Max、GPT-4o;开源 Qwen3-8B/30B/122B、Llama 3.3 70B、DeepSeek-v3.2

五、主要实验结果

1. 总体性能

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

  • 最强综合:Qwen-Max:平均 TCR 0.90(L1: 0.95, L2: 0.97, L3: 0.77)

  • L3 推理:DeepSeek-v3.2 L3 TCR 0.79,超过所有闭源模型,但延迟最高(L3 约 4.06 min)

  • 规模效应:Qwen 系列随参数量单调提升;8B → 30B 增益明显

  • 复杂度鸿沟:Qwen3-8B 在 L3 仅 0.34 TCR,L1 仍有 0.56;大模型在 L3 仍较稳定

  • 路由 vs 执行:多数模型 R-ACC、TCE 较高(常 >0.9),瓶颈多在任务完成(规划/依赖/格式)

2. 异构架构(强 Supervisor + 弱 Sub-Agent)

用 Qwen-Max 作 universal Supervisor,子智能体换小模型:

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

  • 小模型瓶颈在高层任务分解,而非原子工具执行;异构部署是成本与精度兼顾的策略。

3. 多智能体 vs 单智能体(L3 压力测试)

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

  • SingleAgent:拥有全局工具集;注入 1×~5× 干扰工具(功能无关但描述 plausible)

  • BrainAgent:子智能体仅见领域相关工具

结果:工具集扩至 5× 时,SingleAgent TCR 跌至 0.40,token 约 27.5k;BrainAgent 保持稳定且 TCR 优于未扰动 Single-1×。资源解耦有效缓解工具过载与注意力分散。

4. 输出质量评测

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

在 ISRUC 上 5 受试者、9 类任务(数值特征、排序、分类、文件生成)与独立 reference pipeline 对比:

  • 高度一致:Alpha 相对功率、ABR/TBR、Hjorth、SEF95、全局同步、主导频带、Top-1 通道对

  • 主要误差:睡眠效率(SE)估计、Top-3 通道对排序、1 例文件生成失败

  • 启示:直接信号特征计算较可靠;依赖标注的指标、排序输出、文件产物更难

六、失败模式分析

1. 小模型能力缺陷

  • JSON 语法脆弱:Markdown 包裹、括号/引号错误导致解析失败

  • 工具幻觉:调用不存在的 SleepQualityAssessor 等“超级工具”

  • 参数幻觉:用 l_freq/h_freq 替代 schema 定义的 bandpass_range(预训练库习惯覆盖 in-context 定义)

2. 前沿模型推理异常

  • Implicit Dependency Neglect(隐式依赖忽略):用户要求“可视化 Alpha 频段 PSD”,Qwen-Max 规划了 Load → Plot → Analyze,但未插入 8–13 Hz 带通滤波(EEGPreprocessor)。模型将“visualize”直接映射到绘图工具,未补全领域必需的预处理步骤。

![图片](data:image/svg+xml,%3C%3Fxml version=‘1.0’ encoding=‘UTF-8’%3F%3E%3Csvg width=‘1px’ height=‘1px’ viewBox=‘0 0 1 1’ version=‘1.1’ xmlns=‘http://www.w3.org/2000/svg' xmlns:xlink=‘http://www.w3.org/1999/xlink'%3E%3Ctitle%3E%3C/title%3E%3Cg stroke=‘none’ stroke-width=‘1’ fill=‘none’ fill-rule=‘evenodd’ fill-opacity=‘0’%3E%3Cg transform=‘translate(-249.000000, -126.000000)’ fill=’%23FFFFFF’%3E%3Crect x=‘249’ y=‘126’ width=‘1’ height=‘1’%3E%3C/rect%3E%3C/g%3E%3C/g%3E%3C/svg%3E)

七、结论

  • BrainAgent 框架:LLM 驱动的分层多智能体,将自然语言意图 ground 为可执行脑信号流水线,降低技术门槛。

  • 分层 benchmark:L1–L3 + TCR/R-ACC/TCE,覆盖原子执行到跨域协作。

  • 可扩展设计:Supervisor/Sub-Agent 解耦、工具与知识库插件化,便于新领域与新模态接入。

仅用于学术分享,若侵权请留言。