返回 AI 工具目录

datasetGPT

开发框架人工精选最近核验 2026年7月24日

datasetGPT 是一个命令行工具兼 Python 库,用大模型批量生成文本与对话数据集。它支持 OpenAI(GPT-3/4)、Cohere 以及基于 Petals 的 BLOOM 等后端:在提示词里放占位变量,指定后端与参数(温度、模型、自定义项)后由 CLI 跑出各参数组合的结果并存成 JSON;也能让两个对话智能体按设定角色互相对话生成语料。常见用途有构建 AI 检测语料、收集研究用对话、大规模文本处理、为微调小模型造数据。以 Python 编写、pip 安装。仓库未声明开源许可,且自 2023 年后基本停更,商用与再分发前需留意。

定价免费部署本地运行国内可达国内可达性待核验

解决什么问题

  • 用大模型批量生成文本与对话数据集
  • 跨温度、模型等参数组合成批产出
  • 让两个智能体按角色对话生成语料
  • 为微调小模型或研究快速造数据

适合

  • 需要快速造 LLM 文本或对话数据的研究者
  • 要在多参数组合下批量生成语料
  • 可接受用 OpenAI、Cohere 等后端
  • 用于微调数据或 AI 检测语料构建

不适合

  • 自 2023 年停更,依赖版本可能已过时
  • 仓库未声明许可,商用再分发有合规风险
  • 依赖海外模型 API,国内直连受限
  • 生成数据的质量与偏差需自行审校

如何接入

  • 经 pip install datasetGPT 安装
  • 另装 openai、cohere、petals 等依赖
  • 用 CLI 传入提示词、后端与参数
  • 结果按参数组合导出为 JSON

已知限制

  • 未声明开源许可,授权状态不明
  • 项目停更,后端 API 变动可能失效
  • 需自备并调用海外模型,费用自理
  • 生成语料可能含偏差,需人工把关

接入与使用事实

部署方式
本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
免费
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网