登录社区云,与社区用户共同成长
邀请您加入社区
电科金仓在Gitee发布了一套面向AI编程助手的KES数据库专业技能包,首批上线31个技能,覆盖安装、开发、运维、调优、迁移等全流程。用户只需向智能体描述任务,即可自动调用对应技能获取专业指导,如环境部署、应用连接配置、SQL性能分析等。该技能包将产品知识与工程实践转化为智能体可理解的指令,提升响应准确度。项目开源并持续更新,欢迎开发者共同完善KES实践经验库。
数据中台在过去十年经历了从传统数据仓库到湖仓一体化的演进,但大语言模型(LLM)的出现正在从根本上改变数据中台的定位与架构范式。本文探讨大模型如何促使数据中台从"数据供给平台"升级为"认知决策引擎",并提出一种融合大模型能力的新一代数据中台参考架构。大模型不是数据中台的替代者,而是催化其质变的触发器。当数据中台从"数据供给"走向"认知供给",其定位将从 IT 支撑系统升级为企业智能决策的核心基础设
本研究设计了一种基于LSTM的上市公司金融风险预测系统。通过挖掘金融数据,利用LSTM的时序处理能力提升预测准确性。研究详细介绍了系统架构、数据预处理和模型优化方法,实证验证了系统在风险识别和预警方面的有效性。系统为投资者和监管机构提供了决策支持,并探讨了应用中的技术经济可行性。未来将扩展数据源和优化算法以提升性能。该研究兼具理论价值与实践意义,有助于维护金融市场稳定。
房价数据分析系统整合多源房地产数据,通过清洗、整合和高级分析技术(时间序列、回归分析、机器学习等),提供实时、准确的房价趋势分析。系统具备数据收集、预处理、深度分析和可视化功能,可生成走势图、区域对比等直观报告,支持用户自定义查询。该系统为开发商、投资者和购房者提供决策支持,帮助把握市场动态,优化房地产相关决策。
SHEIN 不同部门、团队、业务线差异比较大,我不替所有团队背书。或者官网投递,填我的内推码。同一岗位也可以结合 BOSS 上的薪资来看,最终薪资、职级和 offer 结构以面试及 HR 沟通为准。如果实在不确定适合哪个方向,或者不确定简历匹配度,可以填图二岗位匹配收集表,我来帮忙判断。我是 SHEIN 员工,不是 HR ,这帖只是员工内推信息整理,不代表官方招聘口径。做过互联网、电商、广告、推荐
本研究基于深度学习和YOLOv11模型,提出了一种垃圾分类与管理系统,旨在解决传统垃圾检测中的效率低、精度不高等问题。随着垃圾问题的日益严重,传统的人工巡检和手动分类方法已经无法满足现代环境保护的需求,因此,需要一种自动化、精准的垃圾识别与管理方案。YOLOv11作为一种基于卷积神经网络的目标检测算法,具有较快的检测速度和较高的准确度,本研究通过对YOLOv11模型进行适当的调整与优化,提升了其在
本文介绍了一种基于机器学习的量化选股系统设计,该系统整合Spark分布式计算、网络爬虫和梯度提升树技术,构建高效精准的选股模型。系统通过爬虫实时采集股票行情、舆情和财务数据,利用Spark进行海量金融数据清洗与分析,采用梯度提升树算法进行特征工程和模型训练,并通过交叉验证优化参数。模型部署后可通过Spark Streaming实现实时股票推荐,同时支持从天天基金网获取基金申购状态数据(开放申购/限
数据仓库、数据湖和特征存储是企业数据架构中三个互补的层级系统,各有不同定位。数据仓库用于结构化业务分析和BI报表;数据湖存储全量原始数据,支持探索式分析;特征存储则专注于机器学习特征的全生命周期管理。三者协作形成数据流转体系:数据湖为底层数据源,数据仓库加工业务分析数据,特征存储提供模型所需特征数据。选型需根据业务需求,分别适用于传统分析、数据探索和机器学习场景。三者并非替代关系,而是共同构建完整
1234个阶段。
一个做了四年Python数据工程的程序员,在团队缩编的那天,发现数据清洗的活儿AI也能干了。
搭建一个大模型Demo只需要一个下午,但把它变成可持续的商业产品,可能需要一年甚至更久。
我写了五年Hive SQL,优化过几十张宽表,处理过上PB的数据,拿过两次季度的“数据治理标兵”。但在公司决定做行业大模型的那天,我被一句话问懵了。
先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做,以及从哪里动手。摘要:很多数据工程师以为转做大模型就是学 Python、调 LangChain。实际上,当 Demo 跑通后,真正决定项目能否上线的,是权限管控、日志追踪和异常兜底。本文复盘一个将传统数仓改造为 RAG 管道的真实案例,探讨数据治理在新架构下的核心地位,以及为何“脏活累活”才是转型的关键壁垒。---从大数据转向大模型
综合性平台通常背靠科技大厂,依托自有云服务、大模型底座与终端生态,提供从开发、部署到运营的全链路能力,适合中大型企业与复杂业务场景。
三个月后,我被自己打脸。大模型管理后台不是传统的资源管理,它管理的是一个"会变化、会出错、会消耗Token、会影响用户体验"的复杂系统。
本文记录了 Smart Assistant 从 0 开始构建,并持续借助 GPT推进 RAG 智能知识库落地的阶段性实践。项目基于 Java、Spring Boot、PostgreSQL、pgvector 与 Ollama,已打通文档解析、分块向量化、语义检索、大模型生成、SSE 流式问答及引用追溯等核心链路。文章重点分享系统架构、关键技术设计,以及大模型持续参与需求分析、编码、排障和验证迭代的真
检索增强生成(RAG)技术通过结合传统检索与神经网络生成能力,为知识库系统提供了更精准的信息获取路径。其核心原理是将文档转化为向量表示,通过语义相似度匹配实现智能检索,再经大模型生成符合语境的回答。在数据仓库领域,该技术能有效解决SQL优化、执行计划分析等专业问题,显著提升ETL调试和性能调优效率。DataPulse创新性地采用混合检索系统(BM25+向量搜索)和SQL语法树解析,确保对Hive/
2025年以来,AI Agent 技术在数据领域的落地节奏明显提速。阿里云百炼深度集成 Hologres 实时数仓、亿信华辰推出睿治 Agent 数据治理平台、各大厂商将 Agent 引入运维监控体,一个趋势已经清晰:Agent 正在成为数据仓库智能化转型的核心抓手。但坦白说,目前市面上关于"Agent + 数仓"的内容,概念多、细节少,架构图画得漂亮、落地坑点几乎不提。
给大家整理了一些有关【Hive】的项目学习资料(附讲解~~):https://edu.51cto.com/course/31545.htmlHive获取上月月份的完整流程当你在使用Apache Hive时,可能会遇到需要获取上个月月份的情况。在这篇文章中,我会带领你一步一步地实现这个目标。下面是实现这一目标的整体流程:...
给大家整理了一些有关【Hive】的项目学习资料(附讲解~~):https://edu.51cto.com/course/31545.html使用 DBeaver 连接 Hive 的完整指南在数据工程领域,Apache Hive 是一个广泛使用的数仓工具,而 DBeaver 是一款成熟的数据库管理工具。很多初学者在使用 ...
层级简称关键作用粒度说明建议存储周期原始层ODS保留原始业务数据明细15-30天/看磁盘明细层DWD清洗、标准化、去重明细1-2年汇总层DWS多维汇总宽表/指标表主题/部门/时间等长期应用层ADS报表、接口、直接应用维度表/标签/聚合按需维度层DIM辅助分析的维度字典维度唯一性长期。
可以看到,hive cli加载的配置文件是 /opt/cloudera/parcels/CDH-5.14.4-1.cdh5.14.4.p0.3/jars/hive-common-1.1.0-cdh5.14.4.jar!2、在${HIVE_HOME}/conf/hive-log4j.properties文件中找到 hive.root.logger 属性,并将其修改为下面的设置。在 ${HIVE_HO
由于权限配置问题导致的。具体来说,User: guohailong is not allowed to impersonate anonymous 表示当前用户在尝试以匿名身份进行操作时没有足够的权限。在hive-site.xml添加配置。
hive5种存储格式的区别
springboot整合hive
在安装KingbaseES时,安装用户对于安装路径需有“读”、“写”、“执行”的权限。也可以自定义安装路径。定制安装:在数据库服务器、高可用组件、接口、数据库开发管理工具、数据库迁移工具、数据库部署工具所有组件中自由选择。根据安装后数据库服务功能的不同,KingbaseES可分为完全安装、客户端安装和定制安装三种安装集。完全安装:包括数据库服务器、高可用组件、接口、数据库开发管理工具、数据库迁移工
给大家整理了一些有关【数据分析,Hive】的项目学习资料(附讲解~~):https://edu.51cto.com/course/35092.htmlhttps://edu.51cto.com/course/31545.html以一些关于【数据分析】的学习资料和大家一起分享一下:https://edu.51cto.c...
花了很久很久,总是监听不到 10000 端口,最后原因找到,是因为我的hive.server2.thrift.bind.host 写错了。看起来好像localhost也可以,不过输入hostname 查看,但是这个怎么这么奇怪,还不知道为什么会这样。然后,我改了一下 hive.server2.thrift.bind.host,保持和输出一致。被这个 localhost 给迷惑了了。然后重启,就能成
hive表show partitions时显示分区数与实际的分区数不符问题。
选择特定列查询1.2 列起别名重命名一个列案例实操1.3 常用函数1.求总行数(count)2、求工资的最大值(max)3、求工资的最小值(min)4、求工资的总和(sum)5、求工资的平均值(avg)1.4 limit 语句典型的查询会返回多行数据。limit子句用于限制返回的行数。1.5 where 语句1、使用 where 子句,将不满足条件的行过滤掉2、where 子句紧随from子句3、
特性说明核心价值基于数据分布智能选择最优执行计划关键前提准确、及时的统计信息主要收益Join 性能提升 2~10 倍,减少资源浪费适用场景多表关联、复杂子查询、大表 Join推荐指数⭐⭐⭐⭐☆(需配套统计信息管理)💡CBO 不是“银弹”,而是“数据驱动优化”的基础设施。当你的 Hive 数仓进入中大规模阶段,建立统计信息收集机制 + 启用 CBO是性能调优的必经之路。通过合理使用 CBO,你可以
我整理的一些关于【Java】的项目学习资料(附讲解~~)和大家一起分享、学习一下:https://d.51cto.com/bLN8S1连接 Hive 驱动下载及使用指南Hive 是一个构建在 Hadoop 之上的数据仓库软件,它能够提供数据的查询和分析功能。为了使用 Hive,我们通常需要通过 JDBC 驱动来连接 H...
在shell脚本里,删除hive分区时,如果该分区不存在,会报错,可以使用if exists 判断。
我整理的一些关于【数据】的项目学习资料(附讲解~~)和大家一起分享、学习一下:https://d.51cto.com/eDOcp1Hive中查看所有表的字段在大数据处理的过程中,Hive是一个非常重要的数据仓库工具,用于存储和管理海量数据。当需要对表的结构进行了解时,查看所有表的字段是非常必要的。本文将介绍几种方法,帮...
如果在目录datax/plugin/writer 中直接解压,解压后需要把starrockswriter.tar.gz删掉。下载地址https://github.com/StarRocks/DataX/releases。StarRocks官方提供了DataX的Writer插件。解压至目录datax/plugin/writer。
我整理的一些关于【Hive,正则表达式,字段】的项目学习资料(附讲解~~)和大家一起分享、学习一下:https://d.51cto.com/bLN8S1如何在Hive中判断字符是否全是中文的正则表达式在大数据处理和分析中,使用Hive进行数据查询和处理已成为一种流行的选择。如果你在处理文本数据时需要判断某个字段的内容是...
小文件的问题有很多,实际中各种原因,由于自己的不小心,前期没有做好预防都会产生大量小文件,让线上的离线任务神不知鬼不觉,越跑越慢。上面是平时开发数据任务时候,小文件的预防,但如果由于我们的大意,小文件问题已经产生了,就需要解决了。,这种表最坑,每天都会有一个快照,到后面10G大小的数据,表文件体积可以达到600G,时间越长越大;失败,数据没了,这里面是有事物性保证的,可以观察一下执行的时候,在te
本文详细介绍了使用DataGrip连接Hive的完整流程:1)下载安装最新版DataGrip并配置非商业许可证;2)启动HDFS和HiveServer2服务;3)创建项目并配置Hive数据源连接;4)新建数据库操作。同时提供了常见问题解决方案:注释乱码处理、索引报错忽略、内存溢出调整(修改hive-env.sh配置HADOOP_HEAPSIZE)、JSON表字段显示异常(修改hive-site.x
1.2 在 mysql 修改hive元数据表注释和字段注释的编码为 utf-8。修改表字段注解和表注解。
我整理的一些关于【数据】的项目学习资料(附讲解~~)和大家一起分享、学习一下:https://d.51cto.com/eDOcp1Hive 时间范围筛选的实现在大数据的处理与分析中,Hive是一个非常常用的工具,它提供了类似SQL的查询语言来处理存储在Hadoop上的数据。在很多情况下,我们需要对时间范围进行筛选,以便...
奇怪,数据不是被过滤掉了么,如下图,怎么还会传入最后的UDF函数报错。脚本执行,报错后查看Yarn执行日志,发现报错如。,大致原因是:自定义的UDF函数传入了错误的参数。被提前过滤,原因找到,应该是cbo自动优化导致。的条件过滤改在了在reduce阶段执行。在查找错误数据后发现错误数据的。
分区------处理海量数据根据数据文件结构考虑分门别类保存(大化小),使用分区,创建分区表,提高查询效率指定分区字段,分区字段被称为伪列。数据文件中没有和分区字段对应的数据分区可以分为一级分区(分区字段是一个字段),二级分区(分区字段是二个)。。。。。。分区可以是静态分区(导入数据时 ,指定分区字段的值)动态分区(导入数据时,不需要指定分区字段的值,由系统根据数据文件的情况自行判断)。
通常指大小远小于 HDFS 块大小(默认 128MB 或 256MB)的文件。例如,一个只有几MB甚至几KB的文件。场景推荐方法设计阶段使用 ORC/Parquet 格式;合理设计分区和分桶策略。数据写入时在INSERT语句中使用控制 Reduce 数量;在 Spark 中使用coalesce。对已有 ORC 表治理首选,高效且资源消耗小。对其他格式表治理使用查询。冷数据归档考虑使用创建 HAR
对于数据量的统计,从表是否分区分为和两者有着不同的统计方式。
给大家整理了一些有关【Hive,权限管理】的项目学习资料(附讲解~~):https://edu.51cto.com/course/31545.htmlhttps://edu.51cto.com/course/31877.html如何创建Hive新账号:新手指南在追求大数据的时代,Hive作为一种数据仓库工具被广泛使用...
bandwidth100-m100代表每个map传送的宽带是每秒100mb,-m指的是启动100个map。同步方式很多,导出sql,用工具navicat,同步脚本。hive有2种表方式,磁盘和关系型数据库,一般我们都是用mysql,2者操作一样。hive有2种存储方式,存磁盘或者hdfs,2者操作一样,磁盘就scp过去。然后进入迁移后的表,迁移数据后,进入hive在将这个建表sql建立一下。,那么