rdd = sc.parallelize([("a", 1), ("b", 1), ("a", 1)]) sorted(rdd.groupByKey().mapValues(len).collect()) # [('a', 2), ('b', 1)] sorted(rdd.groupByKey().mapValues(list).collect()) # [('a', [1, 1]), ('b', [1])]