跳到正文
全部标签

# hive

共 4 篇文章

  • 把数据湖换成 Iceberg 前,先找出最值得迁的 3 张表

    把数据湖换成 Iceberg 前,先找出最值得迁的 3 张表

    Grab 把 Hive Parquet 迁往 Apache Iceberg 后,部分查询从约 70 秒降到 6 秒,部分 S3 API 成本最多下降约 95%。但普通数据开发不该先问要不要全湖迁移,而应从小文件、查询频率、元数据等待和人工补分区里找出最值得先动的 3 张表。
  • Iceberg 迁移决策表:从小文件、查询成本到回滚计划 PRO

    Iceberg 迁移决策表:从小文件、查询成本到回滚计划

    团队准备从 Hive Parquet 迁往 Apache Iceberg 时,最容易缺的不是技术介绍,而是一张能比较收益、兼容性和回滚风险的决策表。本文给数据开发一套 Pro 模板,用 6 组指标筛选候选表,并把基线、试点、双读验证和退出条件写进迁移计划。
  • 网易面试真题:Hive SQL vs Spark SQL 完整解析

    网易面试真题:Hive SQL vs Spark SQL 完整解析

    网易数据岗面试经典问题深度拆解。从技术原理到实战经验,从初级到专家级答案模板,教你如何在面试中展现深度思考和架构能力。
  • 数据开发 L2:核心构建

    数据开发 L2:核心构建

    1-3年数据开发工程师核心能力构建路线:从Hive SQL到Spark分布式计算,掌握维度建模、数仓分层(ODS/DWD/DWS/ADS)、ETL开发和数据倾斜调优4大核心技能。解决「SQL写得好但Hive跑不动」「只会写代码不会设计模型」的L2阶段典型问题。