Kyle
10/14/2024, 1:31 AM@daft.udf(return_dtype = daft.DataType.bool())
def check_path(path_string_series):
path_strings = path_string_series.to_pylist()
results = []
for path in path_strings:
if ".parquet" in path:
try:
df = daft.read_parquet(path).collect()
del df
results.append(True)
except Exception as e:
results.append(False)
print_with_context(f"Failed to read {path} due to {e}")
else:
results.append(False)
return resultsjay
10/14/2024, 2:15 AMKyle
10/14/2024, 2:18 AMjay
10/14/2024, 2:29 AMdf[“path”].file_from_url().valid_parquet() or somethingKyle
10/14/2024, 2:38 AMjay
10/14/2024, 2:56 AMjay
10/14/2024, 2:56 AMKyle
10/14/2024, 3:00 AMKyle
10/14/2024, 3:23 AMKevin Wang
10/15/2024, 9:48 PMimport pyarrow
import pyarrow.parquet as pq
@daft.udf(return_dtype = daft.DataType.bool())
def check_path(path_string_series):
path_strings = path_string_series.to_pylist()
results = []
for path in path_strings:
if ".parquet" in path:
try:
parquet_file = pq.ParquetFile(path)
results.append(True)
del parquet_file
except pyarrow.lib.ArrowIOError as e:
results.append(False)
print_with_context(f"Failed to read {path} due to {e}")
else:
results.append(False)
return resultsKyle
10/16/2024, 1:19 AMKyle
10/16/2024, 1:35 AM