# Writing Parquet files

**URL:** https://discourse.julialang.org/t/writing-parquet-files/11221
**Category:** General Usage
**Created:** [May 29, 2018, 7:49am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221 "2018-05-29T07:49:48Z")
**Posts on this page:** 9
**Page:** 2

<div class="post-metadata">

### Author: ![paulmelis](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/paulmelis/32/35063_2.png) [@paulmelis](https://discourse.julialang.org/u/paulmelis)
#### Post date: [October 2, 2020, 9:33am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/21 "2020-10-02T09:33:44Z")

</div>

> [@ExpandingMan](#):
>
> Even in Python it seems that people always deal with parquets using spark. This does seem like ridiculous overkill depending on what you’re doing, but my impression is that parquets were designed for enormous datasets.

Late reply, but [pyarrow](https://arrow.apache.org/docs/python/api/formats.html) can be used to read/write parquet files in Python without having to have Spark at hand. It only needs Pandas (at least, that’s the combination I’ve used). Plus, parquet is quite a nice file format, even for moderate datasets, say a few GBs.

---

<div class="post-metadata">

### Author: ![xiaodai](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/xiaodai/32/15937_2.png) [@xiaodai](https://discourse.julialang.org/u/xiaodai)
#### Post date: [October 2, 2020, 2:40pm UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/22 "2020-10-02T14:40:29Z")

</div>

> [@paulmelis](#):
>
> parquet is quite a nice file format

that’s controversial

---

<div class="post-metadata">

### Author: ![paulmelis](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/paulmelis/32/35063_2.png) [@paulmelis](https://discourse.julialang.org/u/paulmelis)
#### Post date: [October 2, 2020, 3:25pm UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/23 "2020-10-02T15:25:25Z")

</div>

> [@xiaodai](#):
>
> that’s controversial

In what way? It’s a column-based storage format that supports compression and things like explicit nulls. It has its use cases

---

<div class="post-metadata">

### Author: ![tk3369](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/tk3369/32/2824_2.png) [@tk3369](https://discourse.julialang.org/u/tk3369)
#### Post date: [October 2, 2020, 5:55pm UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/24 "2020-10-02T17:55:18Z")

</div>

What would it take to support `Date` columns?

```julia
julia> df = DataFrame(date = Date(now()), x = 1:1000, y = rand(1000));

julia> write_parquet("test.parquet", df)
ERROR: "Column whose `eltype` is Date is not supported at this stage. \n"
Stacktrace:
 [1] write_parquet(::String, ::DataFrame; compression_codec::String) at /home/tkwong/.julia/packages/Parquet/2HfNB/src/writer.jl:479
 [2] write_parquet(::String, ::DataFrame) at /home/tkwong/.julia/packages/Parquet/2HfNB/src/writer.jl:464

```

---

<div class="post-metadata">

### Author: ![xiaodai](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/xiaodai/32/15937_2.png) [@xiaodai](https://discourse.julialang.org/u/xiaodai)
#### Post date: [October 3, 2020, 1:05am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/25 "2020-10-03T01:05:46Z")

</div>

No native categorical support.

---

<div class="post-metadata">

### Author: ![xiaodai](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/xiaodai/32/15937_2.png) [@xiaodai](https://discourse.julialang.org/u/xiaodai)
#### Post date: [October 3, 2020, 4:42am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/26 "2020-10-03T04:42:58Z")

</div>

Hmm think have to revive the 96 bytes

---

<div class="post-metadata">

### Author: ![tk3369](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/tk3369/32/2824_2.png) [@tk3369](https://discourse.julialang.org/u/tk3369)
#### Post date: [October 4, 2020, 7:02pm UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/27 "2020-10-04T19:02:34Z")

</div>

Interestingly, `DateTime` works.

---

<div class="post-metadata">

### Author: ![merlin](https://avatars.discourse-cdn.com/v4/letter/m/8baadc/32.png) [@merlin](https://discourse.julialang.org/u/merlin)
#### Post date: [November 12, 2020, 5:13am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/28 "2020-11-12T05:13:44Z")

</div>

I could not make this work:

```nohighlight
using DataFrames, Dates
 df = DataFrame(date = DateTime(now()), x = 1:1000, y = rand(1000));

write_parquet("test.parquet", df)
ERROR: "Column whose `eltype` is DateTime is not supported at this stage. \n"

```

---

<div class="post-metadata">

### Author: ![xiaodai](https://sea2.discourse-cdn.com/julialang/user_avatar/discourse.julialang.org/xiaodai/32/15937_2.png) [@xiaodai](https://discourse.julialang.org/u/xiaodai)
#### Post date: [November 12, 2020, 6:59am UTC](https://discourse.julialang.org/t/writing-parquet-files/11221/29 "2020-11-12T06:59:02Z")

</div>

i thought someone merged a datetime fix. Try the master branch.

[Previous page](https://discourse.julialang.org/t/writing-parquet-files/11221.md?page=1)
