基于Docker的hadoop容器安装hive并测试 参考Docker部署伪分布Hadoop 要在现有的 Hadoop 容器中安装 Zookeeper,我们需要执行以下步骤: 📁 目录结构规划mkdir ~/hive-docker cd ~/hive-docker hive-docker/ ├── apache-hive-3.1.3-bin.tar.gz # 本地已有的 Hive 包 大数据 2026年06月01日 185 点赞 0 评论 16250 浏览
hadoop+spark+hive空气质量预测系统 空气质量数据分析与预测系统 Hadoop 爬虫 机器学习 线性回归预测算法 1、项目介绍 技术栈: Python语言、Django框架、MySQL数据库、Echarts可视化 requests爬虫 技术、HTML、天气后报网站数据 机器学习 —线性 回归模型 大数据技术(Hadoop、Hive、Spark)机器学习—线性回归模型 ,用于根据空气质量的四个指标(PM2.5、SO₂、NO₂、O₃࿰ 大数据 2026年06月01日 151 点赞 0 评论 4684 浏览
Kafka知识点问题驱动式的回顾与复习——(一) 目录📖 前言一、Partition概念的诞生:解决热点IO问题1.1 问题背景1.2 解决方案:引入Partition二、Partition的有序性:局部有序,非全局有序2.1 Partition内部:严格有序2.2 Partition之间:无序2.3 设计权衡三、副本机制:Leade 大数据 2026年05月31日 113 点赞 0 评论 19160 浏览
Flink 日志怎么用从“找得到”到“看得懂”,再到“可检索可关联” 1、Flink 日志在哪里?怎么访问? 1.1 日志文件来自哪些进程Flink 的每个进程都会产生日志文件,例如: JobManager(包含 Dispatcher、ResourceManager 等角色) TaskManager CLI / SQL Client / Session 启动脚本(ya 大数据 2026年05月31日 86 点赞 0 评论 11545 浏览
windows下RabbitMQ的使用(1)——下载与安装 一.RabbitMQ简介RabbitMQ 是一款开源、高性能、高可靠的消息队列中间件(Message Queue, MQ),基于 AMQP 0-9-1 协议,使用 Erlang 语言开发,主要用于分布式系统中的异步通信、应用解耦与流量削峰。 1.核心组件Producer (生产者):消息的发送方, 大数据 2026年05月31日 193 点赞 0 评论 14484 浏览
基于Hadoop的网络舆情数据分析系统[python]-计算机毕业设计源码+LW文档 摘要:随着互联网的迅速发展,网络舆情数据呈现出爆炸式增长。基于Hadoop的网络舆情数据分析系统能够高效处理海量舆情数据,挖掘其中有价值的信息。本文详细阐述了该系统的设计与实现,包括系统架构、数据处理流程、功能模块等。通过实验验证,该系统在数据存储、处理速度和分析准确性方面表现出色,为网络舆情监测和分析提供了有效的 大数据 2026年05月30日 114 点赞 0 评论 10683 浏览
ODS到DWD数据清洗实战:基于Spark的高效ETL实现 ODS到DWD数据清洗实战:基于Spark的高效ETL实现 引言 一、ODS与DWD层概述 1.1 分层定义 1.2 清洗流程概览 二、核心清洗操作详解 2.1 数据过滤 2.2 数据去重 2.2.1 去重策略选择 2.2.2 去重实现 2.3 空值处理 2.3.1 空值处理策略 2.3.2 空值处理实现 2.4 格式标准化 大数据 2026年05月30日 114 点赞 0 评论 7190 浏览
【大数据技术实战】大数据典型框架解析 前言 在大数据技术飞速迭代的当下,从 Hadoop 生态到 Flink 实时计算,从离线数据仓库到实时推荐系统,技术理论与工具文档已不再稀缺,但 “如何将技术落地到真实业务”“如何解决实操中的各类坑”,仍是开发者面临的核心痛点。大数据技术实战类博客恰好填补了这一空白 —— 它以场景为锚点、以实操为核心, 大数据 2026年05月30日 102 点赞 0 评论 11736 浏览
Flink技术实践-Flink指标监控全景指南 一、引言在离线任务的世界里,一个任务失败了,大不了重跑一次。但实时任务不同:数据在源源不断地流入,任何一个环节的阻塞都可能造成数据积压、延迟飙升,甚至整个集群雪崩。一个没有监控的Flink作业,本质上是一颗定时炸弹——它今天可能每秒处理百万条消息,明天就可能静默地落在后面,直到下游消费者 大数据 2026年05月30日 67 点赞 0 评论 2371 浏览
NVIDIA DGX Spark实战指南:从开箱到部署200B参数大模型 1. 开箱与初识:当超级计算走进你的桌面还记得几年前,想要跑一个像样的AI模型,要么得去租用昂贵的云端GPU实例,忍受网络延迟和排队等待,要么就得面对一台台嗡嗡作响、占地巨大的服务器机柜。那种感觉,就像你想喝杯水,却必须去管理一个水库。但今天,当我把NVIDIA DGX Spark从那个简约的牛皮纸盒里取出来时,这种印象被彻底颠覆了。它的尺寸,150mm x 150mm x 50.5mm,比一个i 大数据 2026年05月30日 196 点赞 0 评论 18191 浏览