TRIBE v2是什么:Meta开源多模态脑响应预测基础模型一文读懂
【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2
TRIBE v2是 Meta 开源的一个多模态脑响应预测基础模型(brain encoding model):输入一段视频、音频或文本,它就能预测人脑 fMRI 信号会如何响应。它把 LLaMA 3.2(文本)、V-JEPA2(视频)、Wav2Vec-BERT(音频)三大前沿模型统一到一个 Transformer 中,将多模态表征映射到皮层表面(fsaverage5 网格,约 2 万个顶点),是"计算神经科学(in-silico neuroscience)"方向的基础模型。
本文带你一文读懂:TRIBE v2 能做什么、架构原理、如何安装运行推理、以及项目结构与训练流程,零基础也能跟上 🧠
一、TRIBE v2 能做什么?
传统 fMRI 脑解码研究往往针对单一模态(只预测文字、或只看图像)。TRIBE v2 的突破在于统一多模态:
| 输入模态 | 特征提取器 | 自动处理流程 |
|---|---|---|
| 🎬 视频 | V-JEPA2 视频模型 | 自动抽取音轨 → 语音转写为带时间戳的词事件 |
| 🔊 音频 | Wav2Vec-BERT | 直接转写为词级事件 |
| 📝 文本 | LLaMA 3.2 | 先合成语音(TTS),再转写获得词级时间轴 |
核心能力一览:
- 预测"平均被试"的皮层活动:输出形状为
(n_timesteps, n_vertices),即每个时间步上大脑表面约 2 万个点的 BOLD 活动; - 自动补偿血流动力学延迟:预测结果整体向过去偏移 5 秒,对齐 fMRI 的 HRF 延迟;
- 大脑 3D 可视化:内置
PlotBrain工具,可把预测活动渲染到皮层表面,还支持导出动画视频(plot_timesteps_mp4)。
二、工作原理:多模态特征如何映射到大脑
模型主体是FmriEncoder(定义在 tribev2/model.py),流程可以概括为三步:
- 多模态特征提取:文本、视频、音频各自过对应的编码器,抽取多层特征后拼接(
layer_aggregation="cat"); - 投影与 Transformer 编码:每种模态经一个 MLP projector 投影到统一维度(hidden=256),再送入带时间位置编码的 TransformerEncoder;
- 映射到皮层网格:输出通过池化与时间平滑(
TemporalSmoothing高斯卷积核)对齐到 fMRI 的时间分辨率(fsaverage5 皮层网格)。
💡 细节:fMRI 数据会先通过
SurfaceProjector(见 tribev2/utils_fmri.py)从体素空间投影到皮层表面,支持 MNI / fsaverage 两种坐标系。
推理入口是 tribev2/demo_utils.py 中的TribeModel类,它封装了从原始文件到事件数据框(events DataFrame)再到预测结果的完整链路。
三、快速上手:如何运行 TRIBE v2 预测脑响应
1. 环境要求
- Python3.11+
- 依赖定义在 pyproject.toml:torch 2.5+、transformers、neuralset 等
2. 获取代码并安装
git clone https://gitcode.com/gh_mirrors/tr/tribev2 cd tribev2 # 仅推理 pip install -e . # 需要大脑可视化 pip install -e ".[plotting]"3. 三行代码预测大脑活动
from tribev2 import TribeModel model = TribeModel.from_pretrained("facebook/tribev2", cache_folder="./cache") df = model.get_events_dataframe(video_path="path/to/video.mp4") preds, segments = model.predict(events=df) print(preds.shape) # (n_timesteps, n_vertices)把video_path换成audio_path或text_path即可预测音频/文本对应的脑活动——文本会自动转成语音再转写,因此时间轴与真实聆听体验一致。首次运行会从模型仓库下载约 1GB 的预训练权重,之后走本地缓存。
📓 完整交互演示(含 3D 大脑可视化)见官方 demo notebook:tribe_demo.ipynb,它会演示视频与莎士比亚独白文本两种输入下的皮层活动预测。
四、项目结构导读
| 目录/文件 | 作用 |
|---|---|
| tribev2/main.py | 实验流水线:Data配置数据集与特征提取器,TribeExperiment编排训练/评估 |
| tribev2/model.py | FmriEncoder:Transformer 多模态 → fMRI 模型 |
| tribev2/pl_module.py | PyTorch Lightning 训练模块 |
| tribev2/demo_utils.py | TribeModel推理接口与事件数据框工具 |
| tribev2/grids/ | Slurm 网格搜索:run_cortical.py(皮层)与run_subcortical.py(皮层下) |
| tribev2/plotting/ | 大脑可视化(PyVista & Nilearn 双后端) |
| tribev2/studies/ | 支持的公开数据集定义 |
内置支持的 fMRI 数据集
studies/目录内置了多个经典公开数据集,覆盖视频与听觉两种范式:
- Algonauts 2025 Challenge(studies/algonauts2025.py):观看《老友记》7 季 + 4 部电影的 fMRI 数据,Schaefer-1000 分区图,TR=1.49s;
- BOLD Moments / Lahner 2024(studies/lahner2024bold.py):10 名被试观看 1000 段 3 秒自然视频,测试集含 10 次重复,适合信度分析;
- Lebel 2023(studies/lebel2023bold.py):被动聆听自然口语叙事,带词级与音素级标注;
- Wen 2017(studies/wen2017.py):经典自然语言 fMRI 数据集。
跨数据集加载与合并逻辑(多研究数据混合训练、被试加权)见 tribev2/utils.py。
五、如何从零训练 TRIBE v2
面向科研用户的训练流程同样开箱即用(默认配置见 tribev2/grids/defaults.py):
# 1. 设置数据与输出路径 export DATAPATH="/path/to/studies" export SAVEPATH="/path/to/output" # 2. 本地快速测试 python -m tribev2.grids.test_run # 3. Slurm 集群网格搜索 python -m tribev2.grids.run_cortical python -m tribev2.grids.run_subcortical训练依赖(lightning、wandb、torchmetrics)通过pip install -e ".[training]"安装。特征提取器(文本/视频/音频)的超参数——如 LLaMA 3.2 取用哪几层、V-JEPA2 的 clip 时长——都在defaults.py中集中配置,改一处即可跑通整个网格实验。
六、常见问题 FAQ
Q1:TRIBE v2 预测的是真实个体的大脑吗?目前输出针对"平均被试",预测落在 fsaverage5 平均皮层网格上。代码中保留了subject_layers(被试个性化层)接口,个体化建模是后续研究方向。
Q2:为什么预测要偏移 5 秒?fMRI 的 BOLD 信号存在约数秒的血流动力学延迟(HRF),模型按过去 5 秒补偿,使"看到的画面"与"测到的脑活动"在时间上对齐。
Q3:授权范围是什么?项目采用CC-BY-NC-4.0协议(见 LICENSE),即非商业用途。用于学术研究请引用论文:
d'Ascoli et al.,A foundation model of vision, audition, and language for in-silico neuroscience, arXiv:2605.04326 (2026)
七、总结:为什么值得关注 TRIBE v2
✅统一多模态:视频、音频、文本一个模型全搞定 ✅皮层级精度:约 2 万顶点的 fsaverage5 表面预测,而非粗略的体素块 ✅开箱即用:HuggingFace 预训练权重 + 三行代码推理 + 3D 可视化 ✅面向科研:内置 4 个公开 fMRI 数据集、完整的 Slurm 训练网格 🧩生态完善:基于 neuralset/neuraltrain/exca 构建,特征缓存与集群调度成熟
TRIBE v2 代表了"用基础模型做硅基神经科学"的新范式——不扫描真人,直接预测大脑。对神经影像、脑机接口与认知科学方向的入门者和研究者来说,这是一个值得放进工具箱的开源项目 🔬
【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考