Back to list
pluginagentmarketplace

training-pipelines

by pluginagentmarketplace

MLOps Plugin Development

1🍴 0📅 Jan 7, 2026

SKILL.md


name: training-pipelines version: "2.0.0" sasmp_version: "1.3.0" description: Master training pipelines - orchestration, distributed training, hyperparameter tuning bonded_agent: 04-training-pipelines bond_type: PRIMARY_BOND

SKILL METADATA

category: training difficulty: intermediate_to_advanced estimated_hours: 40 prerequisites:

  • mlops-basics
  • experiment-tracking

VALIDATION

validation: pre_conditions: - "Completed prerequisite skills" - "Access to GPU resources" post_conditions: - "Can build Kubeflow pipelines" - "Can configure distributed training" - "Can run hyperparameter tuning"

OBSERVABILITY

observability: metrics: - pipelines_created - training_jobs_completed - gpu_utilization

Training Pipelines Skill

Learn: Build production training pipelines with orchestration and distributed training.

Skill Overview

AttributeValue
Bonded Agent04-training-pipelines
DifficultyIntermediate to Advanced
Duration40 hours
Prerequisitesmlops-basics, experiment-tracking

Learning Objectives

  1. Design end-to-end training pipelines
  2. Implement distributed training with PyTorch DDP
  3. Configure hyperparameter tuning with Optuna
  4. Deploy pipelines to Kubeflow
  5. Optimize GPU utilization and costs

Topics Covered

Module 1: Pipeline Design (10 hours)

Pipeline Architecture:

┌────────────────────────────────────────────────────────────────┐
│                    TRAINING PIPELINE                            │
├────────────────────────────────────────────────────────────────┤
│                                                                 │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌─────────┐  ┌───────┐ │
│  │  Data   │─▶│Preprocess│─▶│  Train  │─▶│ Evaluate│─▶│Register│ │
│  │  Load   │  │         │  │         │  │         │  │       │ │
│  └─────────┘  └─────────┘  └─────────┘  └─────────┘  └───────┘ │
│                              ║                                  │
│                              ▼                                  │
│                        [Hyperparameter]                         │
│                        [   Tuning     ]                         │
│                                                                 │
└────────────────────────────────────────────────────────────────┘

Module 2: Distributed Training (12 hours)

PyTorch DDP Setup:

import torch.distributed as dist
from torch.nn.parallel import DistributedDataParallel as DDP

def setup_distributed():
    dist.init_process_group(backend="nccl")
    local_rank = int(os.environ["LOCAL_RANK"])
    torch.cuda.set_device(local_rank)
    return local_rank

# Wrap model
model = DDP(model, device_ids=[local_rank])

# Use DistributedSampler
sampler = DistributedSampler(dataset)
loader = DataLoader(dataset, sampler=sampler)

Exercises:

  • Convert single-GPU training to DDP
  • Benchmark scaling efficiency
  • Implement gradient accumulation

Module 3: Hyperparameter Tuning (10 hours)

Optuna Configuration:

import optuna

def objective(trial):
    lr = trial.suggest_float("lr", 1e-5, 1e-2, log=True)
    batch_size = trial.suggest_categorical("batch_size", [16, 32, 64])
    hidden_size = trial.suggest_int("hidden_size", 64, 512, step=64)

    model = build_model(hidden_size)
    metrics = train_model(model, lr, batch_size)

    return metrics["val_loss"]

study = optuna.create_study(
    direction="minimize",
    sampler=TPESampler(),
    pruner=HyperbandPruner()
)
study.optimize(objective, n_trials=100)

Module 4: Pipeline Deployment (8 hours)

Kubeflow Pipeline:

from kfp import dsl, compiler

@dsl.component
def train_model(data_path: str, model_path: str):
    # Training logic
    pass

@dsl.pipeline(name="training-pipeline")
def training_pipeline(dataset_uri: str):
    preprocess_task = preprocess_data(input_path=dataset_uri)
    train_task = train_model(data_path=preprocess_task.output)
    train_task.set_gpu_limit(1)

Code Templates

Template: Production Training Script

# templates/train.py
import torch
import pytorch_lightning as pl
from pytorch_lightning.callbacks import ModelCheckpoint, EarlyStopping

class ProductionTrainer:
    """Production-ready training wrapper."""

    def __init__(self, config: dict):
        self.config = config

    def train(self, model, train_loader, val_loader):
        callbacks = [
            ModelCheckpoint(
                monitor="val_loss",
                mode="min",
                save_top_k=3
            ),
            EarlyStopping(
                monitor="val_loss",
                patience=5
            )
        ]

        trainer = pl.Trainer(
            max_epochs=self.config["epochs"],
            accelerator="gpu",
            devices=self.config["gpus"],
            strategy="ddp" if self.config["gpus"] > 1 else "auto",
            callbacks=callbacks,
            precision="16-mixed"
        )

        trainer.fit(model, train_loader, val_loader)
        return trainer

Troubleshooting Guide

IssueCauseSolution
GPU OOMBatch too largeReduce batch, use gradient accumulation
Slow trainingI/O bottleneckIncrease workers, prefetch
Distributed hangNCCL timeoutCheck network, increase timeout

Resources


Version History

VersionDateChanges
2.0.02024-12Production-grade with DDP examples
1.0.02024-11Initial release

Score

Total Score

60/100

Based on repository quality metrics

SKILL.md

SKILL.mdファイルが含まれている

+20
LICENSE

ライセンスが設定されている

+10
説明文

100文字以上の説明がある

0/10
人気

GitHub Stars 100以上

0/15
最近の活動

3ヶ月以内に更新がある

0/10
フォーク

10回以上フォークされている

0/5
Issue管理

オープンIssueが50未満

+5
言語

プログラミング言語が設定されている

+5
タグ

1つ以上のタグが設定されている

0/5

Reviews

💬

Reviews coming soon