tensorflow_datasets 如何load本地的数据集？-CDA数据分析师官网

热线电话：13121318867

首页大数据时代tensorflow_datasets 如何load本地的数据集？

tensorflow_datasets 如何load本地的数据集？

2025-03-26

TensorFlow Datasets（TFDS）是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API，允许用户从现有集合中选择并下载各种数据集。然而，在一些情况下，用户可能需要使用本地数据集进行模型训练和测试。在本文中，我们将介绍如何使用TFDS加载本地数据集。

为了加载本地数据集，我们需要做以下几个步骤：

1.准备数据集 2.创建TFDS数据集描述文件 3.使用描述文件加载数据集

准备数据集

首先，我们需要准备我们要使用的数据集。这通常涉及到收集、清洗和组织数据，以便可以轻松地访问数据。在本例中，我们将使用一个简单的示例数据集，其中包含数字图像和相应的标签。

该数据集的目录结构类似于以下内容：

data/
    0/
        image1.png
        image2.png
        ...
    1/
        image1.png
        image2.png
        ...
    ...

在上面的目录结构中，每个数字目录代表一个唯一的标签，并包含与该标签相关联的所有图像。

创建TFDS数据集描述文件

接下来，我们需要创建一个TFDS数据集描述文件。该文件告诉TFDS如何读取和使用我们的本地数据集。描述文件通常是一个Python模块，其中包含有关数据集的元数据和函数，该函数将数据集加载到内存中。

在描述文件中，我们需要定义以下元数据：

1.名称：数据集的名称。 2.版本：数据集的版本号。 3.描述：数据集的简短描述。 4.特征：数据集的特征（例如，输入和输出的形状、数据类型等）。 5.拆分：数据集应该如何划分以进行训练、验证和测试。 6.下载URL（可选）：如果数据集没有被打包成一个文件，请提供一个URL以下载数据集。

以下是一个简单的描述文件示例：

import tensorflow_datasets as tfds import os # Define the metadata for the dataset _DESCRIPTION = 'A dataset containing images of digits.' _VERSION = tfds.core.Version('1.0.0')
_NAME = 'my_dataset' def my_dataset(split): # Define the path to the data directory data_dir = os.path.join(os.getcwd(), 'data') # Define the classes classes = ['0', '1', '2', '3', '4', '5', '6', '7', '8', '9'] # Load the data dataset_builder = tfds.builder(_NAME)
    dataset_builder.data_dir = data_dir
    dataset_builder.add_images(
        os.path.join(data_dir, '*/*'), 
        labels=classes,
    ) return dataset_builder.as_dataset(split=split)

在上面的代码中，我们定义了一个名为my_dataset的函数，该函数将数据集加载到内存中。我们还定义了元数据，包括数据集的名称、版本和描述，以及数据集的特征和拆分方式。

最后，我们使用tfds.builder()函数创建了一个dataset_builder对象，并使用add_images()方法将图像添加到数据集中。请注意，此处我们使用了data_dir变量来指定数据集的路径。如果您的数据集存在其他位置，则需要更改此变量的值以反映正确的路径。

使用描述文件加载数据集

使用上述描述文件，我们可以通过调用tfds.load()函数来加载本地数据集。这个函数需要传递三个参数：数据集名称、数据集拆分方式和描述文件的路径或模块。

以下是一个简单的例子：

import tensorflow_datasets as tfds # Load the data my_dataset = tfds.load(
    name='my_dataset',
    split='train',
    data_dir='./data',
    download=False,
    with_info=True,
) # Print

在上面的代码中，我们使用tfds.load()函数来加载名为my_dataset的数据集，使用了train拆分并指定了数据集路径。此外，我们将with_info参数设置为True以获取有关数据集的元信息。

一旦数据集被加载到内存中，我们可以像其他TFDS数据集一样使用它进行训练或测试。

总结

在本文中，我们介绍了如何使用TFDS加载本地数据集。首先，我们准备了数据集，并创建了一个TFDS数据集描述文件。然后，我们使用tfds.load()函数将数据集加载到内存中，并使用它来训练或测试模型。虽然这种方法可能需要更多的手动操作，但它允许用户使用自己的数据集进行机器学习，从而获得更好的控制和灵活性。

相信读完上文，你对算法已经有了全面认识。若想进一步探索机器学习的前沿知识，强烈推荐机器学习之半监督学习课程。