当前位置: 首页 > news >正文

网站建站的标准网站排名提高

网站建站的标准,网站排名提高,青岛公交优化,惠州招聘网sparkSql的数据抽象有两种。 一类是data set适用于java和Scala 一类是data frame适用于java,Scala,python 将r d d转换为data frame #方式一 df spark.createDataFrame(rdd,schema[name,age]) #方式二 schema Structtype(). add(id,integertype(),nu…

在这里插入图片描述
在这里插入图片描述
sparkSql的数据抽象有两种。
一类是data set适用于java和Scala
一类是data frame适用于java,Scala,python

将r d d转换为data frame

#方式一
df = spark.createDataFrame(rdd,schema=['name','age'])
#方式二
schema = Structtype().
add('id',integertype(),nullable=False).
add('name',StringType(),nullable=True)
df = spark.createDataFrame(rdd, schema)
#方式三
df = rdd.toDF(['id','name'])
df = rdd.toDF(schema)

DSL风格

show()方法,默认展示二十行
printSchema()方法,展示d f的信息
展示制定列
df.select('id','name').show()
df.select(['id','name']).show()
df.select(df['id'],df['name']).show()
过滤数据
df.filter('score<90').show()
df.filter(df['score']<99).show()
df.where('score < 99').show()
df.where(df['score']<99).show()
分组展示
df.groupBy('subject').count().show()
df.groupBy(df['subject']).count().show()

SQL风格

注册成表
df.createTempView('score')临时表
df.createOrReplaceTempView('score')注册临时表存在就替换
df.createGlobalTempView('score')注册一个全局表
注册好临时表之后可以执行s q l查询
df2 = spark.sql("""select * from score where score < 99""")
df2.show()

词频统计案例

sql风格处理
rdd = sc.textFile('./a.txt').flatMap(lmda x: x.split('')).map(lambda x:[x])
df = rdd.toDF(['word'])
df.createTempView('words')
spark.sql("""select word,count(*) as cnt from words group by word order by cnt desc""").show()
dsl风格处理
df = spark.read.format('text').load('./a.txt')
df2 = df.withColumn('value',F.explode(F.split(df['value'],'')))
df2.groupBy('value').count().withColumnRenamed('count','cnt').orderBy('cnt',ascending=False).show()

数据清洗API

df.dropDuplicates().show()
去除重复值
df.dropDuplicates(['age','job']).show()
按照列名去除重复值
df.dropna().show()
如果有缺失值删除此行
df.dropna(thresh=3).show()
有效列最少三个才能保存此行
df.dropna(thresh=2,subset=['name','age']).shwo()
针对这两个列必须有效列为两个才能保留数据
df.fillna({'name':'位置姓名','age':'1','job':'worker'}).show()
对制定列用指定值进行缺失值填充

在这里插入图片描述
RDD运行流程:代码-- DAG调度器逻辑任务-- Task调度器任务分配和管理监控-- worker干活

http://www.zhongyajixie.com/news/34029.html

相关文章:

  • 手机怎样设计网站建设怎样做百度推广网页
  • 对政府网站建设的意见建议河南seo排名
  • 经营性网站icp沈阳seo技术
  • 有做网站的公司吗怎么才能让百度收录网站
  • 红花岗区住房和城乡建设局网站超级优化大师
  • 青岛快速建站模板百度灰色词排名代发
  • 超链接网站图片怎么在记事本上做时事新闻最新
  • 成都网站优化公司哪家好网络服务商主要包括哪些
  • 汉字域名的网站有哪些汕头seo外包公司
  • 广州网站设计网站制作商丘seo
  • php做网站如何架构网络平台推广方案
  • wordpress 建站插件武汉seo网络营销推广
  • 长春有什么好的网站制作公司网站快速刷排名工具
  • 做童装在哪个网站找客户企业网站排名优化
  • 免费音乐网站建设域名归属查询
  • 会泽住房和城乡建设局网站百度seo最新算法
  • 网站建设怎么做更好中小企业网络推广
  • 我要自学网python搜索引擎优化的特点
  • dede淘宝客网站百度搜索引擎优化
  • 徐州网站建设案例免费二级域名注册申请
  • 广元网站制作淘客推广
  • 佛山哪个做网站的好网站优化助手
  • 接网站制作windows优化大师提供的
  • vps如何做网站新浪微指数
  • 网站上传到万网主机关键词搜索排名查询
  • 厦门网站建设哪家便宜网络营销推广专家
  • 怎么查询商标是否已被注册网站如何做优化推广
  • wordpress自动还原seo是什么职位的简称
  • 网站运营专员是干嘛的产品推广平台排行榜
  • 漯河 做网站最有效的网络推广方式