databricks spark基本使用方法和讲解

server/2025/1/15 23:42:36/

spark_0">databricks spark基本使用方法

文章目录

  • databricks spark基本使用方法
    • spark dataframe和pandas dataframe区别
      • 概念
      • 小例子:感受下语法差异!
    • 基本使用
      • 生成序列数据
      • 显示数据
      • 查看rdd的分区数和作用
      • 对列进行操作

spark_dataframepandas_dataframe_3">spark dataframe和pandas dataframe区别

概念

Spark 的 DataFrame 和 pandas 的 DataFrame 在概念上相似,都是用来处理表格数据的,但它们在设计、实现和使用场景上有显著的差异:

Spark DataFrame
1.分布式计算
2.数据存储在集群的多个节点上
3.懒执行(lazy execution)(如调用 .show().collect() 时)才实际执行。

pandas DataFrame
1.单机内存中的数据处理
2.操作(如添加列、过滤等)会立即在 DataFrame 上执行并返回结果。

小例子:感受下语法差异!

为了展现差异,下面同样的意思,让两者分别code,感受下语法的差异

spark dataframe
(一般在databricks上面不用建立session,环境已经帮你配置好了)

from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("Example").getOrCreate()
df = spark.read.csv("data.csv")
df.na.fill(value=0)  # 填充数字型缺失值为0
df.na.drop()         # 删除任何包含缺失值的行from pyspark.sql.functions import to_date
df.withColumn('new_date', to_date(df['date'], 'yyyy-MM-dd'))from pyspark.sql.functions import udf
from pyspark.sql.types import IntegerType
def square(x):return x * x
square_udf = udf(square, IntegerType())
df.withColumn('squared', square_udf(df['number']))

pandas dataframe

import pandas as pd
df = pd.read_csv("data.csv")
df.fillna(value=0)   # 填充数字型缺失值为0
df.dropna()          # 删除任何包含缺失值的行
df['new_date'] = pd.to_datetime(df['date'], format='%Y-%m-%d')
df['squared'] = df['number'].apply(lambda x: x * x)

基本使用

生成序列数据

df1 = spark.range(2, 10, 2)
df2 = spark.range(2, 10, 4)

生成的数据的index名字叫做“id",这里的df1为
2,4,6,8
df2的数据为
2,6
因此将两者join的话

df3 = df1.join(df2, ["id"])

df3的结果为2,6

显示数据

df1.show(10)

不指定的话,默认会展示20条数据

查看rdd的分区数和作用

df3.rdd.getNumPartitions()

作用:

  1. 并行度评估:RDD的分区数决定了Spark作业的并行度。每个分区通常由一个核心(core)处理,如果分区数太少,可能无法充分利用集群的所有资源;如果分区数过多,则可能因为调度和管理开销而降低性能。

  2. 性能优化:了解当前的分区数可以帮助你决定是否需要重新分区。通过调整分区数(使用repartition()coalesce()方法),来优化作业的性能

对列进行操作

from pyspark.sql.functions import spark_partition_id
df3.withColumn("partition_id", spark_partition_id()).show()

使用spark_partition_id函数可以帮助获得数据所在的分区的id。这里用withColumn之后返回了一个新的对象(rdd不可变,因此每次的操作实际上都会生成新的对象),并且调用show(),把这个对象使用掉了。如果希望是把分区id加上并且存下来,需要写:

from pyspark.sql.functions import spark_partition_id
df3 = df3.withColumn("partition_id", spark_partition_id())

这里,withColumn实际上是DataFrame API的一部分,而不是直接操作RDD。当在DataFrame上使用withColumn方法时,是在定义一个转换操作,这个操作会在DataFrame的执行计划中被添加。虽然DataFrame是建立在RDD之上的,所有DataFrame的操作最终都会转换成对RDD的操作,但从用户的角度看,withColumn是一个更高级别的抽象,专门用于结构化数据的操作。使用DataFrame API可以使代码更易于理解和维护,并且可以利用Spark的优化引擎(如Catalyst优化器和Tungsten执行引擎)来提高性能。

对列的数据进行统计

df2.withColumn("partition_id", spark_partition_id()              ).groupBy("partition_id").count().show()

http://www.ppmy.cn/server/1742.html

相关文章

从零开始搭建社交圈子系统:充实人脉的最佳路径

线上交友圈:拓展社交网络的新时代 线上交友圈是社交网络的新引擎,提供了更广泛的社交机会,注重共同兴趣的连接,强调多样性的社交形式,更真实地展示自己,让朋友更全面地了解我们的生活状态。虽然虚拟交往存在…

Linux的图形资源及指令

一、火车 1.切换到超级用户 su 2.下载资源 yum install -y sl 3.输入指令 sl,得到火车图形 如果没有得到该图形,就将2处改为yum install -y epel-release。 二、Linux的logo 1.在超级用户模式下下载资源 yum install -y linux_logo 2.输…

快手本地生活服务商系统怎么操作?

当下,抖音和快手两大短视频巨头都已开始布局本地生活服务,想要在这一板块争得一席之地。而这也很多普通人看到了机遇,选择成为抖音和快手的本地生活服务商,通过将商家引进平台,并向其提供代运营服务,而成功…

nuxt3使用记录四:加载静态资源时路径的写法研究

在上一篇记录了NUXT进行SSG构建时&#xff0c;不仅会构建纯静态的html文件&#xff0c;也会构建一堆js文件。而如果网页中有加载静态资源&#xff0c;如图片&#xff0c;这时就需要注意了&#xff0c;不能简单的使用官网说的<img src"~/assets/img/nuxt.png" alt&…

Vue-router 路由钩子在生命周期的体现

一、Vue-Router导航守卫 有的时候&#xff0c;需要通过路由来进行一些操作&#xff0c;比如最常见的登录权限验证&#xff0c;当用户满足条件时&#xff0c;才让其进入导航&#xff0c;否则就取消跳转&#xff0c;并跳到登录页面让其登录。 为此有很多种方法可以植入路由的导航…

Day38: 动态规划 LeedCode:509. 斐波那契数 70. 爬楼梯 746. 使用最小花费爬楼梯 蓝桥杯: 更小的数

对于动态规划问题&#xff0c;拆解为如下五步曲 确定dp数组&#xff08;dp table&#xff09;以及下标的含义确定递推公式dp数组如何初始化(容易数组溢出)确定遍历顺序举例推导dp数组 509. 斐波那契数 斐波那契数 &#xff08;通常用 F(n) 表示&#xff09;形成的序列称为 斐…

acwing算法提高之图论--最近公共祖先

目录 1 介绍1.1 向上标记法1.2 倍增法1.3 Tarjan法 2 训练 1 介绍 本博客用来记录"对于有根图中&#xff0c;求最近公共祖先"的题目。 求解方法&#xff1a; 向上标记法。每次求两个结点的最近公共祖先的时间复杂度是O(N)。由于时间复杂度较高&#xff0c;通常不用…

云原生数据库海山(He3DB)PostgreSQL版核心设计理念

本期深入解析云原生数据库海山PostgreSQL版&#xff08;以下简称“He3DB”&#xff09;的设计理念&#xff0c;探讨在设计云原生数据库过程中遇到的工程挑战&#xff0c;并展示He3DB如何有效地解决这些问题。 He3DB是移动云受到 Amazon Aurora 论文启发而独立自主设计的云原生数…