现代数据栈(Modern Data Stack)这个词,最近几年在数据圈很热。它的核心理念,是把传统那种"一个工具干所有事"的笨重 ETL,拆成一组各司其职的轻量工具:用 Airbyte 或 Fivetran 做数据抽取,用 dbt 做数据转换,用 Snowflake 或 BigQuery 做存储计算,用 Looker 或 Metabase 做分析。每个工具只干一件事,通过云原生和 API 串联起来。
这套理念在海外很流行,也确实解决了一些问题。但中国企业把它照搬过来时,往往会撞上一堵墙:这套"拆零件"的思路,和国内企业"要私有化、要信创、要统一运维、要本地服务"的现实需求,存在不小的错位。
这篇文章把企业 Data Pipeline 的几条技术路线摊开讲:以 Airbyte、Fivetran 为代表的 ELT 抽取路线,以 dbt 为代表的转换路线,以及以 FineDataLink 为代表的国产一体化路线。讲清每条路线的技术本质、适合什么场景、在国内落地会遇到什么问题,帮助企业在"现代数据栈"和"一体化平台"之间做出清醒的选择。
一、先厘清:Data Pipeline 的两种范式
在谈具体工具之前,先厘清一个关键概念:Data Pipeline 有两种截然不同的范式,ELT 和 ETL。
传统 ETL(Extract-Transform-Load)的顺序是:先抽取数据,再做转换清洗,最后加载到目标端。转换在数据进入目标端之前完成,目标端只存"干净的数据"。
现代 ELT(Extract-Load-Transform)的顺序是:先抽取数据,直接加载到目标端,再在目标端做转换。数据先原样进仓,转换在仓内完成。
这两种范式的区别,决定了工具的选择。Airbyte、Fivetran 这类工具,本质上是 ELT 范式的"抽取加载"工具,它们把数据从源端搬到目标端,转换交给 dbt 在仓内做。而 FineDataLink 这类一体化平台,同时支持 ETL 和 ELT 两种范式,把抽取、转换、加载、质量、调度装进同一个产品。
理解这个区别很重要,因为它能帮企业避开一个常见的坑:把"现代数据栈"的 ELT 工具,当成"数据处理平台"来选。Airbyte 只解决"数据怎么搬",不解决"数据怎么转换、怎么保证质量、怎么调度运维"。如果企业只买了 Airbyte,后面还有一堆工具要配。
二、几条技术路线一览
企业 Data Pipeline 的技术路线,可以归纳为几条:
| 技术路线 | 代表工具 | 核心范式 | 主要优势 | 国内落地的主要问题 |
|---|---|---|---|---|
| ELT 抽取路线 | Airbyte、Fivetran | ELT | 开源/云原生、连接器丰富 | 私有化弱、信创适配不足 |
| 转换路线 | dbt | ELT 中的 T | 转换逻辑代码化、可复用 | 依赖仓内转换、需配套抽取工具 |
| 国产一体化路线 | FineDataLink | ETL + ELT | 链路贯通、统一运维、信创适配强 | 有采购成本 |
下面逐一展开。
三、路线一:国产一体化路线,把 Pipeline 装进一个产品
国产一体化路线,是把 Data Pipeline 的抽取、转换、加载、质量、调度装进同一个产品。这条路线的代表是 FineDataLink。
从技术本质看,FineDataLink 同时支持 ETL 和 ELT 两种范式。它既能做"先转换再加载"的传统 ETL,也能做"先加载再转换"的 ELT。这意味着企业不需要在两种范式之间做非此即彼的选择,可以根据具体场景灵活切换。
在抽取能力上,FineDataLink 支持 60 多种数据源,覆盖主流关系型数据库、大数据平台、文件、API、消息队列,还提供资质免申、零开发、低运维的连接器,覆盖电商、餐饮、财务、上市公司、协同五类 SaaS 场景。在抽取这一环,FineDataLink 的覆盖度不输 Airbyte。
在转换能力上,FineDataLink 提供可视化的数据开发界面,拖拽式配置数据流,支持清洗、映射、聚合等转换逻辑。相比 dbt 需要写 SQL 和 YAML,FineDataLink 的转换门槛更低,业务人员经过简单培训就能上手。
在加载与同步能力上,FineDataLink 同时支持批量同步和实时同步。批量同步支持全量、增量、定时、事件、触发式多种方式;实时同步内建 CDC 能力,基于日志解析做实时增量,支持 Oracle 独立日志解析。这是 Airbyte、Fivetran 这类纯抽取工具需要额外拼装的能力。
在质量与调度上,FineDataLink 内置数据质量六性检测,支持血缘溯源和问题闭环,能够"边同步边质检"。调度层面提供定时、事件、触发式三种方式,支持任务编排和统一运维监控,三级权限管理,失败自动回退。
这条路的核心优势在于,国产一体化路线最大的优势,是"链路贯通"。抽取、转换、加载、质量、调度在同一个产品里,数据从源端到目标端不需要跨工具、跨账号。其次是"统一运维",运维能力内化到了产品里,企业不需要为每一个开源组件单独配运维。
在信创与私有化上,这是国产一体化路线在中国企业场景里最突出的优势。FineDataLink 5.0 对达梦、KingbaseES、OceanBase、GaussDB 提供日志解析级深度支持,支持私有化部署。相比之下,Airbyte、Fivetran 这类海外工具,私有化部署和国产数据库适配都不是其核心投入方向。
一个可参考的落地实践是,宁德新能源基于 FineDataLink 搭建四节点集群,承载 5900 多个数据任务,达到 5 万行/秒的同步速度,月吞吐 221TB。这个案例说明,一体化路线在超大规模生产环境里,性能上限并不低。
需要说明的是,国产一体化路线有采购成本,对于预算极其有限、且团队技术能力很强的企业,初期投入会比开源工具高。但把长期运维成本算进去,一体化路线的总账往往更划算。
把 FineDataLink 与「Airbyte + Fivetran + dbt」组合放在一起看,能力覆盖的差异一目了然:
| 能力维度 | Airbyte / Fivetran | dbt | FineDataLink 一体化 |
|---|---|---|---|
| 数据抽取 | 强(连接器丰富) | 不涉及 | 强(60+ 数据源、五类 SaaS 免申连接器) |
| 数据转换 | 不涉及 | 强(SQL 代码化) | 强(可视化拖拽式开发) |
| 实时同步 | 弱(以批量为主) | 不涉及 | 强(内建 CDC、国产库日志解析) |
| 数据质量 | 不涉及 | 弱(依赖测试) | 强(六性检测、血缘溯源、问题闭环) |
| 调度运维 | 不涉及 | 弱(依赖外部调度) | 强(三种调度、任务编排、一键部署、失败回退) |
| 私有化与信创 | 弱(需自部署、自适配) | 不涉及 | 强(私有化部署、国产库深度适配) |
这张表反映的是一个本质区别:Airbyte、Fivetran、dbt 各管一段,拼起来才是完整链路;FineDataLink 把整条链路装进同一个产品,能力之间天然贯通。
四、路线二:Airbyte 与 Fivetran,ELT 抽取路线的代表
Airbyte 和 Fivetran,是现代数据栈里"抽取加载"环节的两个代表工具。
Airbyte 是开源的 ELT 工具,主打连接器丰富和可扩展。它的核心理念是"任何数据源都能接",通过社区贡献的连接器,覆盖了大量数据源。Airbyte 的优点是开源、灵活、连接器多;缺点是它只解决"抽取加载",不解决转换、质量、调度,需要和 dbt、Airflow 等工具配合使用。而且 Airbyte 的私有化部署和国产数据库适配,需要企业自己踩坑。
Fivetran 是商业化的云原生 ELT 服务,主打"托管式数据管道",企业不需要自己维护管道,Fivetran 负责管道的运行和维护。Fivetran 的优点是省心、稳定;缺点是它是纯云服务,数据要经过 Fivetran 的云端,对于有数据合规要求、需要私有化部署的中国企业,Fivetran 的适用性有限。而且 Fivetran 按量计费,数据量大的企业成本不低。
这两条路在国内落地的问题 Airbyte 和 Fivetran 在国内落地,都会遇到几个共性问题:一是私有化部署弱,Airbyte 虽然开源可自部署,但自部署后的运维和国产库适配要自己扛,Fivetran 则基本是纯云服务;二是信创适配不足,对达梦、金仓等国产数据库的支持深度有限;三是它们都只是"抽取加载"环节,转换、质量、调度还得靠其他工具拼装。
从适用场景看,Airbyte 和 Fivetran 适合那些数据可以上云、无强私有化要求、且已经采用现代数据栈(Snowflake、dbt、Looker 组合)的企业。对于这类企业,Airbyte 或 Fivetran 作为抽取环节,配合 dbt 做转换,是成熟的做法。但对于有信创、私有化要求的中国企业,这条路的适配成本需要重点评估。
五、路线三:dbt,把转换逻辑代码化
dbt 是现代数据栈里"转换"环节的代表工具。它的核心理念,是把数据转换逻辑代码化,用 SQL 和 YAML 描述转换规则,实现转换的可版本管理、可测试、可复用。
从技术本质看,dbt 是 ELT 范式里的 T(Transform)。它不负责抽取数据,也不负责加载数据,只负责在数据仓库内部做转换。数据先被 Airbyte 或 Fivetran 抽取加载到仓库,dbt 再在仓库里用 SQL 做转换建模。
dbt 的核心优势,是把转换逻辑从"黑盒"变成了"代码"。转换规则用 SQL 写,可以版本管理、可以做单元测试、可以复用,这对数据团队来说是一个工程化的进步。dbt 的文档和血缘也是自动生成的,数据资产的可追溯性更好。
dbt 的局限也很明显:它只解决转换,不解决抽取和加载。企业要用 dbt,得先有 Airbyte 或 Fivetran 做抽取,得有数据仓库做存储,得有 Airflow 或 dbt Cloud 做调度。dbt 是"现代数据栈"这个拼图里的一块,不是完整的 Data Pipeline 方案。
dbt 在国内落地,会遇到几个问题:一是它依赖仓内转换,要求企业已经有数据仓库,对于还在用传统数仓或没有仓的企业,dbt 的前提不成立;二是 dbt 需要 SQL 能力,转换逻辑要写代码,门槛比可视化配置高;三是 dbt 的国产数据库适配,需要企业自己验证。
从适用场景看,dbt 适合那些已经采用现代数据栈、有数据仓库、团队熟悉 SQL 的企业。对于这类企业,dbt 是转换环节的成熟选择。但对于希望快速落地、不想拼装多个工具的企业,dbt 需要配套的工具链,复杂度不低。
六、现代数据栈 vs 一体化平台:本质区别在哪
理解了这几条路线,就能看清"现代数据栈"和"一体化平台"的本质区别。
现代数据栈的思路是"拆",把一个完整的 Data Pipeline 拆成抽取、转换、存储、分析等多个独立工具,每个工具只干一件事,通过云原生和 API 串联。这种思路的优势是每个环节都能选到最专业的工具,灵活、可替换;代价是工具之间割裂,需要企业自己集成,出了问题难以定位。
一体化平台的思路是"合",把抽取、转换、加载、质量、调度装进同一个产品。这种思路的优势是链路贯通、统一运维、问题可追溯;代价是单一平台的某一环节可能不如最专业的独立工具。
这两种思路没有绝对的好坏,关键看企业的现实条件。现代数据栈更适合数据可以上云、团队技术能力强、愿意自己集成工具的企业;一体化平台更适合需要私有化、信创适配、希望快速落地、不想维护多个工具的企业。
对于中国企业来说,一体化平台的适配性往往更高。原因在于,中国企业的数据处理需求,和现代数据栈的假设存在几个错位:一是私有化部署是硬约束,很多企业的数据不能出内网;二是信创替代是刚需,国产数据库的适配是绕不开的;三是本地化服务和统一运维是现实需求,企业不希望维护一堆开源组件的拼装。
七、怎么选:三个判断维度
企业选 Data Pipeline 技术路线,关键看三个维度。
从数据合规与部署要求看,数据可以上云、无私有化要求的,现代数据栈(Airbyte/Fivetran + dbt)是成熟选择;数据不能出内网、需要私有化部署的,一体化平台(FineDataLink)更合适。
从团队技术能力看,团队熟悉 SQL、愿意自己集成工具的,现代数据栈可以发挥灵活性;团队更希望聚焦业务、不想维护工具的,一体化平台更省心。
从信创要求看,有信创替代要求的企业,一体化平台(FineDataLink)在国产数据库适配上的深度,是现代数据栈工具难以比拟的。
一个实用的判断逻辑是:信创要求强、私有化硬约束、希望快速落地,优先考虑一体化平台(FineDataLink);数据可以上云、团队技术强、已经采用现代数据栈,Airbyte/Fivetran + dbt 的组合是成熟选择。
八、FAQ
1. Airbyte 和 FineDataLink 有什么区别?
Airbyte 是开源的 ELT 抽取工具,只解决"数据怎么搬",不解决转换、质量、调度;FineDataLink 是一体化平台,把抽取、转换、加载、质量、调度装进同一个产品。Airbyte 适合已经采用现代数据栈、愿意自己集成工具的企业;FineDataLink 适合需要链路贯通、统一运维、信创适配的企业。
2. dbt 能替代 ETL 工具吗?
不能。dbt 只解决 ELT 范式里的转换(T),不解决抽取(E)和加载(L)。企业要用 dbt,得先有 Airbyte 或 Fivetran 做抽取,得有数据仓库做存储。dbt 是现代数据栈拼图里的一块,不是完整的 Data Pipeline 方案。
3. 现代数据栈适合中国企业吗?
部分适合。现代数据栈适合数据可以上云、团队技术能力强、无强私有化要求的企业。但对于有私有化、信创要求的企业,现代数据栈的"拆零件"思路和国内现实需求存在错位,一体化平台的适配性往往更高。
4. 一体化平台能支持 ELT 范式吗?
能。以 FineDataLink 为例,它同时支持 ETL 和 ELT 两种范式,既能"先转换再加载",也能"先加载再转换"。企业不需要在两种范式之间做非此即彼的选择。
5. Fivetran 在国内能用吗?
能用,但适用性有限。Fivetran 是纯云服务,数据要经过其云端,对于有数据合规要求、需要私有化部署的中国企业,Fivetran 的适用性受限。而且 Fivetran 按量计费,数据量大的企业成本不低。
6. 判断一个 Data Pipeline 方案是否够用,关键看什么?
关键看四个点:数据源覆盖度、同步方式(批量加实时)、质量保障(能否边同步边质检)、以及国产数据库适配深度。如果企业有信创要求,第四点尤其关键。
7. 已经用了现代数据栈,还能切换到一体化平台吗?
能,但要评估迁移成本。现代数据栈到一体化平台的切换,本质是数据管道的迁移,涉及任务迁移、数据校验、并行运行、切换割接。一体化平台如果提供批量迁移能力和数据回滚能力,能显著降低切换成本。
免责声明
本文所涉及的产品功能、技术路线、性能数据等信息,均基于公开资料与厂商官方披露整理,仅供选型参考,不构成任何采购建议。文中对各技术路线和产品的描述力求客观中立,但产品能力与版本会持续迭代,具体功能与适配程度请以各厂商最新官方文档及实际测试结果为准。企业在做出选型决策前,建议结合自身业务场景进行充分的 POC 验证与多方评估。