
15 分钟上手 Apache DolphinScheduler分布式任务调度平台从部署到跑通第一条可视化工作流【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler凌晨两点定时批处理炸了上游脚本跑完了下游那个脚本却没被拉起。靠 cron 手动串了 8 个脚本数据仓库每天一跑脚本之间的依赖关系已经没人敢动。Apache DolphinScheduler 就是为这种场景做的分布式任务调度平台——把任务依赖画成可视化工作流按 CRON 定时调度执行状态和日志一目了然。接下来这篇上手指南会带你从拉起服务一路走到看到第一条执行日志。Apache DolphinScheduler 擅长什么 一句话定位低代码方式的现代数据编排平台专门处理数据流水线里的复杂任务依赖。你可以先记住这几件事可视化 DAG 编排拖拽节点、拉箭头连线就能描述任务依赖从入度为零的节点开始执行无需手写调度代码开箱即用的任务类型Shell、SQL、Spark、Flink、Python、HTTP 等 20 多种任务类型内置覆盖了数仓 ETL 和大数据 pipeline 的常见动作灵活的调度策略CRON 定时、补数web 端原生支持、跨工作流依赖三种方式可以混着用多租户执行任务以真实的 Linux 用户身份运行Worker 节点资源隔离去中心化高可用多 Master、多 Worker 无主架构节点横向扩容Master/Worker 均支持故障转移先把服务跑起来三种路径 根据你的环境挑一条就够了都不需要装 Hadoop 全家桶。源码构建 Standalone功能最全适合想把功能摸全的新手。Standalone 把 API、Master、Worker、Alert 全部塞进一个进程元数据用内存 H2 存储重启即清空——所以它只用来体验别上生产git clone https://gitcode.com/GitHub_Trending/dol/dolphinscheduler cd dolphinscheduler ./mvnw clean package -DskipTests cd dolphinscheduler-dist/target/apache-dolphinscheduler-*-bin bash ./bin/dolphinscheduler-daemon.sh start standalone-server构建耗时较长可以先去泡杯咖啡。想换任务类型时注意 3.3.0 起二进制包不再自带插件依赖执行bash ./bin/install-plugins.sh并按 Standalone 部署文档 的说明在conf/plugins_config里声明需要的插件即可。Docker 单容器最快体验只要体验核心功能一条命令拉起独立容器docker run --name dolphinscheduler-standalone-server -p 12345:12345 -p 25333:25333 -d apache/dolphinscheduler-standalone-server:version同样基于 H2 内存库定位和 Standalone 一致快速体验不承载生产流量。Docker Compose / Helm更接近生产Compose 方式会把 API、Master、Worker、Alert 拆成独立容器并顺带起 PostgreSQL 和 ZooKeeper元数据重启不丢cd deploy/docker docker-compose --profile schema up -d # 初始化数据库结构 docker-compose --profile all up -d # 启动全部服务Kubernetes 生产环境则直接用仓库里内置的 Helm Chartcd deploy/kubernetes/dolphinscheduler helm install dolphinscheduler .。更完整的参数说明在 Docker 部署教程。从登录页到第一条执行日志 ️服务起来后浏览器打开http://localhost:12345/dolphinscheduler/ui默认账号admin/dolphinscheduler123。租户任务真正的执行者先别急着建工作流花一分钟理解租户Tenant。用户是登录 web 界面的人租户才是 Worker 运行任务时使用的 Linux 用户——到安全中心 - 租户管理新建一个租户比如dev再到安全中心 - 用户管理把它分配给 admin。如果什么都不配系统会落到默认租户default以程序启动用户执行任务体验时能跑通但生产环境建议显式配置。画第一条 DAG 工作流一切工作流必须属于某个项目所以先在项目管理页点击创建项目。进入项目后在工作流定义页点击创建工作流你会看到一个空白画布。从左侧工具栏把一个 Shell 任务拖到画布上节点名称填task-1脚本内容写一句echo Hello DolphinScheduler就够再拖一个task-2。然后按住task-1上的箭头连到task-2一条带方向的依赖边就建好了——这就是 DAG 编排的全部手势拖节点、拉连线、点保存。上线运行然后看日志工作流画完还不能直接跑。回到工作流定义列表先点上线再点运行。切到工作流实例页能看到状态为执行中的实例点进实例右键任意任务选查看日志就能看到Hello DolphinScheduler的输出。至此最小可用的分布式调度链路已经完整跑通调度触发 → Master 分发 → Worker 执行 → 日志回收。跑通之后值得延伸的方向 ⚙️任务与告警插件Shell 之外还有 Spark、Flink、DataX、Sqoop 等任务类型邮件、钉钉、企业微信、飞书等告警渠道也是插件均按 SPI 机制加载。想加新任务类型照着 任务插件目录 里任意一个模块抄结构即可。高可用与故障转移生产部署让 Master 和 Worker 各上两个实例以上配合 ZK 集群与数据库主从。节点宕机后未完成任务会按 集群部署文档 描述的机制自动漂移。跨工作流依赖用依赖类型任务引用其他工作流的执行状态就能把上游数仓跑完再触发报表这类跨流程逻辑表达出来。补数与状态控制补数在 web 端原生支持工作流实例运行中也可以随时暂停、停止、恢复。接下来往哪深入 文档入口看 官方中文文档其中 快速上手教程 和这一节的顺序一致。想读源码的话调度状态机在dolphinscheduler-master/任务执行框架在dolphinscheduler-task-executor/REST 层在dolphinscheduler-api/每个模块根目录下的CLAUDE.md都有结构导读。Apache DolphinScheduler 的价值在于把靠记忆维护的脚本依赖变成一张可执行、可调度、可追溯的可视化 DAG。打开官方文档深入任务插件开发和集群部署两章你就能把单机体验升级成生产级的分布式任务调度平台。【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考