[Spark][Python]sortByKey 例子的继续

RDD的collect() 作用是什么?

“[Spark][Python]sortByKey 例子”的继续

In [20]: mydata004.collect()

Out[20]:
[[u'00001', u'sku933'],
[u'00001', u'sku022'],
[u'00001', u'sku912'],
[u'00001', u'sku331'],
[u'00002', u'sku010'],
[u'00003', u'sku888'],
[u'00004', u'sku411']]

In [22]: mydata004.count()
Out[22]: 7

In [23]: mydata005.count()
---------------------------------------------------------------------------
TypeError Traceback (most recent call last)
<ipython-input-23-c1554a7ccdd7> in <module>()
----> 1 mydata005.count()

TypeError: count() takes exactly one argument (0 given)

In [24]: type(mydata005)
Out[24]: list

In [25]: type(mydata004)
Out[25]: pyspark.rdd.PipelinedRDD

经过对比发现:mydata005 是一个 list。
也就是说 collect 会返回一个 列表。

如果在交互式环境中 运行 <RDD>.collect ,会显示这个RDD的所有元素的内容。

最新文章

  1. Android Studio快捷键
  2. Mybatis环境
  3. oracle官方文档12c对应关系
  4. 欢迎访问我的最新个人技术博客http://zhangxuefei.top
  5. 分享5种风格的 jQuery 分页效果【附代码】
  6. angular 路由去除#号
  7. tinyhttpd服务器源码学习
  8. java parseint()
  9. EF5.0 对一个或多个实体的验证失败。有关详细信息,请参见“EntityValidationErrors”属性
  10. [JIT_APP]Activity生命周期相关的7个方法
  11. JavaScript中的原型继承原理
  12. hdu 1695 GCD 容斥+欧拉函数
  13. 史上最牛逼的文件bom头清除代码,万能检测清除php,js等等
  14. 纳税服务系统【用户模块之使用POI导入excel、导出excel】
  15. Deflation Methods for Sparse PCA
  16. POI如何自动调整Excel单元格中字体的大小
  17. 每天一个Linux命令(05):tail命令
  18. pass,break,continue的使用场景
  19. ORM操作 数据库外键 一对多
  20. java实现Md5加密工具类

热门文章

  1. ScrollView与ListView的事件冲突
  2. 《InsideC#》笔记(十) 异常处理
  3. MySQL四种隔离级别和MVCC
  4. (网页)12种不宜使用的Javascript语法(转)
  5. HttpClient与浏览器调用服务接口差异
  6. SQL Server 全文索引介绍(转载)
  7. Django日志信息路径的设置
  8. var a = {m:1}; var b = a; a.n = b ={n:1}; console.log(a);console.log(b);
  9. IOS HTML5页面中数字自动变蓝并识别为手机号
  10. 项目Alpha冲刺 3