DataFlow получил крупное обновление: AI-агент строит пайплайны сам

13 июля 2026 года команда OpenDCAI объявила о масштабном апгрейде DataFlow-WebUI — теперь интерфейс поддерживает AI-агента, который сам собирает, управляет и запускает пайплайны обработки данных. Проект нацелен на решение одной из главных проблем в AI-разработке: превращение «грязных» исходных данных в качественные тренировочные датасеты для больших языковых моделей.

ℹ Что такое DataFlow?
DataFlow — система подготовки и обучения данных, предназначенная для парсинга, генерации, обработки и оценки высококачественных данных из зашумлённых источников (PDF, plain-text, низкокачественные QA-пары) с целью улучшения работы LLM в конкретных областях через целевое обучение (Pre-training, SFT, RL) или RAG.

Почему это важно

Конкуренция между языковыми моделями резко усилилась, при этом архитектуры стали прозрачными и воспроизводимыми — а значит, главное конкурентное преимущество смещается в сторону качества данных. Несмотря на обилие открытых датасетов, привести их в «боевую» форму по-прежнему крайне сложно из-за отсутствия системных инструментов.

DataFlow уже эмпирически подтвердил улучшение качества доменных LLM в медицине, финансах и праве.

Архитектура: четыре слоя DataFlow Suite

DataFlow Suite обеспечивает ключевую инфраструктуру для автоматизации и масштабирования подготовки LLM-данных. Платформа состоит из четырёх взаимосвязанных компонентов:

КомпонентНазначение
DataFlow-SkillsКоллекция туториалов и навыков по разработке операторов
DataFlow-WebUIВизуальный drag-and-drop редактор пайплайнов с AI-агентом
DataFlow-EcosystemМодульный слой регистрации операторов для доменных модулей
RayOrchРаспределённое выполнение задач на базе Ray

DataFlow-WebUI — это визуальное рабочее пространство с поддержкой AI-агента для построения, управления и запуска пайплайнов. Оно сочетает drag-and-drop редактирование с взаимодействием на естественном языке, позволяя эффективнее выстраивать и запускать рабочие процессы.


graph LR
    A[Сырые данные\nPDF / текст / QA] --> B[Операторы DataFlow]
    B --> C{Пайплайн}
    C --> D[Генерация данных]
    C --> E[Очистка и фильтрация]
    C --> F[Оценка качества]
    D --> G[Тренировочный датасет LLM]
    E --> G
    F --> G

Операторы: PyTorch-стиль для данных

Платформа предлагает более 10 базовых операторов и свыше 100 операторов под конкретные пайплайны, доступных для повторного использования. Поддерживается создание собственных операторов — plug-and-play, с возможностью публикации через GitHub или PyPI.

Операторы организованы по функциональным категориям: генерация, оценка, фильтрация и рефайнинг. Ниже — минимальный пример запуска оператора PromptedGenerator:

from dataflow.operators.core_text import PromptedGenerator
from dataflow.utils.storage import FileStorage
from dataflow.serving import APILLMServing_request

storage = FileStorage(first_entry_file_name="./input.json")
llm_serving = APILLMServing_request(
    api_url="https://api.openai.com/v1/chat/completions"
)
prompted_generator = PromptedGenerator(
    llm_serving=llm_serving,
    system_prompt="Please solve this math problem."
)
prompted_generator.run(
    storage=storage.step(),
    input_key="problem",
    output_key="solution"
)
💡 Начало работы
Запустить визуальный интерфейс можно одной командой: dataflow webui. После этого откроется полноценный визуальный конструктор пайплайнов прямо в браузере.

DataFlow-Harness: агент, закрывающий NL2Pipeline-разрыв

Вместе с обновлением WebUI команда опубликовала исследование DataFlow-Harness — платформы на базе LLM-агента для автоматического построения редактируемых пайплайнов.

LLM всё активнее используются для автоматизации рабочих процессов обработки данных, однако агенты обычно генерируют скрипты, которые не становятся постоянными редактируемыми артефактами платформы — этот разрыв авторы назвали NL2Pipeline gap.

На бенчмарке из 12 задач DataFlow-Harness достиг 93,3% успешных прохождений end-to-end. По сравнению с Vanilla Claude Code денежные затраты снизились на 72,5%, а задержка генерации — на 49,9%.

DataFlow vs. конкуренты

ФункцияDataFlowNemo-CuratorData-Juicer
Синтез данных (текст/код/математика)Частично
Визуальный WebUI
AI-агент для сборки пайплайнов
PyTorch-подобный API
Распределённое выполнение (Ray)
⚠ Статус проекта
DataFlow активно эволюционирует: v1.0.9 сфокусирован на инженерной надёжности и масштабируемости — система движется от исследовательского тулкита к production-grade решению.

Итог

DataFlow закрывает реальную боль как исследователей, так и инженеров: подготовка качественных тренировочных данных перестаёт быть ручной, дорогой и непрозрачной работой. С появлением AI-агента в WebUI порог входа снижается до минимума — теперь пайплайн можно описать на естественном языке и сразу получить готовый граф выполнения. Проект доступен на GitHub под открытой лицензией.