十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何用 gsutil 批量下载 23 TiB 完整 AlphaFold Protein Structure Database 并处理解压后的文件数量

如何用 gsutil 批量下载 23 TiB 完整 AlphaFold Protein Structure Database 并处理解压后的文件数量 如何用 gsutil 批量下载 23 TiB 完整 AlphaFold Protein Structure Database 并处理解压后的文件数量【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold这篇文章解决一个具体的资源下载任务把完整的 AlphaFold Protein Structure Database(AFDB,214M 条蛋白质结构预测,总规模 23 TiB,每条预测提供 3 个文件)落到本地磁盘上。操作路径是:准备 Google Cloud 账户并安装gsutil,按官方推荐方式批量下载全部 1,015,797 个 sharded proteome tar 分片,再在本地 un-tar 与 un-gzip,并处理解压后约 644M 个文件的文件系统问题。下文步骤与数字均来自仓库内的官方下载指南 afdb/README.md。开始之前:确认确实需要完整数据集官方文档明确表示:除非需要用本地计算资源处理(例如学术高性能计算中心),否则不推荐下载完整数据集。如果你只需要部分蛋白质或部分物种,文档提供了预置子集(覆盖重要物种 / Swiss-Prot)、按物种 proteome 下载、以及通过 manifest 文件清单或 BigQuery 自定义子集等替代路径——这些是独立任务,本文不展开。在开始下载前,先记下文档给出的两个规模事实:完整数据集为23 TiB、3 × 214M 个文件,文档明确警告difficult to manipulate without significant computational resources,需要预先准备至少同量级的磁盘空间,并确认文件系统能力;文档估算:1 Gbps 网络下下载完整数据库大约需要 2.5 天。准备 Google Cloud 账户并安装 gsutil从 Google Cloud Public Datasets 下载数据需要 Google Cloud 账户(数据本身在 CC-BY-4.0 许可下免费下载使用)。按文档的步骤准备:创建账户:文档指引到 cloud.google.com/datasets 页面,点击 get started for free 开始免费账户流程并同意服务条款。注意注册时需要填写支付方式,但文档说明在启用计费前不会使用它。设置项目:在 Cloud overview - Dashboard 页面选择或新建一个项目。安装gsutil:文档指引到 Google Cloud 官方的 gsutil 安装文档执行。文档中关于费用边界的说明,开始下载前必须读清:Public Datasets 存储桶的访问始终免费,免费账户包含 free tier 访问权限;90 天试用期结束后,需要升级到计费账户才能继续使用。免费层访问(包括 Public Datasets 存储桶)继续期间,超出免费层的用量会产生费用——文档要求用户熟悉所使用服务的定价,避免意外扣费。完整数据库存放在 GCS 桶gs://public-datasets-deepmind-alphafold-v4。用 gsutil 批量下载全部 1,015,797 个 proteome 分片官方推荐的整体下载方式,是下载proteomes/目录下全部 1,015,797 个 sharded proteome tar 文件,而不是逐条下载 6 亿多个单独文件。文档解释原因:单个文件存在较大的固定延迟,分片 tar 方式显著更快。每个 proteome 被分片,使每个 shard 至多包含 10,000 个蛋白质(即每 shard 30,000 个文件,因为每个蛋白质有 3 个文件)。先cd到预留了 23 TiB 级空间的目标目录,再执行文档原命令:gsutil -m cp -r gs://public-datasets-deepmind-alphafold-v4/proteomes/ .该命令会把整个proteomes/目录递归下载到当前目录.,下载约 23 TiB 内容,请确认目录位置与磁盘余量后再执行。tar 文件的命名模式为proteome-tax_id-[TAX ID]-[SHARD ID]_v4.tar,其中 TAX ID 是 NCBI taxonomy ID,SHARD ID 是分片编号。下载完成后的规模核对以文档给出的数字为准:本地应有1,015,797 个 tar 文件。可选分支:Storage Transfer Service部分用户可能改用 Google Cloud 的 Storage Transfer Service,在源桶与另一个桶或其他云服务之间建立传输。文档明确警告:使用该服务可能产生费用,需要到官方定价页查看详情,尤其是传输到其他云服务的情况。这是替代传输路径,不是文档的默认推荐。解压并评估文件数量官方文档对下载后的步骤描述为:un-tar 所有 proteome,再 un-gzip 所有单个文件。文档没有给出这一步的具体命令;下面给出对应文档命名模式的tar操作示例,方括号内需替换为实际文件名中的对应值:tar -xf proteome-tax_id-[TAX ID]-[SHARD ID]_v4.tar对每个已下载的 tar 分片重复该操作。解压前,文档给出了一条必须落实的警告:解压后将出现约 644M 个文件,文档原文要求make sure your filesystem can handle this——即文件系统能否容纳数亿个小文件是解压前的前置条件;每条预测展开为 3 个文件:model_v4.cif(预测结构的原子坐标及元数据)、confidence_v4.json(逐残基 pLDDT 置信度)、predicted_aligned_error_v4.json(残基对 PAE 置信度)。文档没有提供专门的验证命令;判断下载与解压规模是否到位,以文档给出的数字为参照:解压前 1,015,797 个 tar 分片,解压后约 644M 个文件(数据集整体构成按文档记为 3 × 214M 文件)。边界说明耗时:文档的估算值为 1 Gbps 网络下约 2.5 天,这是文档给出的估计,不是固定承诺;桶内另有accession_ids.csv与sequences.fasta两个附加文件,它们不属于proteomes/分片,不在上述批量下载命令的覆盖范围内;下载过程中遇到问题时,文档提供的联系渠道是 alphafolddeepmind.com;若最终只需要某个物种或某个置信度条件筛出的子集,应回到 afdb/README.md 的 Downloading subsets of the data 一节,使用按物种 proteome 的gsutil命令、manifest 清单(gsutil -m cp -I)或 BigQuery 生成文件列表的路径,而不是完整下载。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表