# Finetuning > Ajusta modelos en Microsoft Foundry con SFT (supervisado), DPO (preferencia) o RFT (refuerzo con graders). Cubre preparación de datasets, envío del entrenamiento, despliegue y evaluación. Fuente: https://skillsagentes.com/skills/microsoft/azure-skills/finetuning Markdown: https://skillsagentes.com/skills/microsoft/azure-skills/finetuning.md Repositorio: https://github.com/microsoft/azure-skills Autor: microsoft Licencia: MIT Actualizado: el mes pasado Coste de contexto: 140 tok instalada, 1.4k tok al activarse, 47.2k tok con todos los archivos del bundle Bundle: 34 archivos, 184 KB Permisos que pide: ninguno declarado ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add microsoft/azure-skills --skill finetuning --agent claude-code # Cursor npx -y skills add microsoft/azure-skills --skill finetuning --agent cursor # Codex npx -y skills add microsoft/azure-skills --skill finetuning --agent codex # Gemini CLI npx -y skills add microsoft/azure-skills --skill finetuning --agent gemini # Windsurf npx -y skills add microsoft/azure-skills --skill finetuning --agent windsurf # Cline npx -y skills add microsoft/azure-skills --skill finetuning --agent cline ``` ## Qué hace - Hace fine-tuning de modelos en Microsoft Foundry con tres métodos: SFT (supervisado), DPO (por preferencia) y RFT (por refuerzo con graders). - Cubre el ciclo entero: preparación y validación del dataset, envío y monitorización del trabajo de entrenamiento, despliegue y evaluación. - Ayuda a elegir entre los tres tipos de entrenamiento y a calibrar graders y umbrales de aprobado para RFT. - Incluye destilación, datos sintéticos y subida de archivos grandes. ## Cuándo usarla - Se quiere hacer fine-tuning de un modelo, preparar datos de entrenamiento o enviar y diagnosticar trabajos de entrenamiento. - Se quiere desplegar o evaluar un modelo ya ajustado. ## Cuándo no - Para desplegar un modelo sin fine-tuning, que va a `deploy-model`. - Para crear agentes, o para optimizar prompts sin entrenar. ## Qué la activa - "haz fine-tuning de este modelo" - "¿SFT, DPO o RFT?" - "prepara mis datos de entrenamiento" - "despliega el modelo ajustado" ## Antes de instalar - El frontmatter declara versión `0.0.0-placeholder`, así que es un sub-skill de Foundry en estado inicial. - Variables de entorno: API_KEY, AZURE_AI_PROJECT_ENDPOINT, AZURE_COGSERVICES_ACCOUNT, AZURE_OPENAI_API_KEY, AZURE_OPENAI_ENDPOINT, AZURE_RESOURCE_GROUP, AZURE_SUBSCRIPTION_ID, AZ_CLI_PATH, BASE_URL, ENDPOINT, OPENAI_BASE_URL - makes network requests - needs API credentials ## Archivos - SKILL.md — 5 KB - references/agentic-rft.md — 3 KB - references/dataset-formats.md — 4 KB - references/deployment.md — 3 KB - references/evaluation.md — 6 KB - references/grader-design.md — 3 KB - references/hyperparameters.md — 3 KB - references/large-file-uploads.md — 927 B - references/platform-gotchas.md — 2 KB - references/reward-hacking.md — 3 KB - references/training-curves.md — 4 KB - references/training-types.md — 3 KB - references/vision-fine-tuning.md — 4 KB - scripts/calibrate_grader.py — 9 KB - scripts/check_training.py — 8 KB - scripts/cleanup.py — 9 KB - scripts/common.py — 8 KB - scripts/convert_dataset.py — 11 KB - scripts/deploy_model.py — 9 KB - scripts/evaluate_model.py — 11 KB - scripts/generate_distillation_data.py — 10 KB - scripts/monitor_training.py — 6 KB - scripts/score_dataset.py — 8 KB - scripts/submit_training.py — 11 KB - scripts/validate/__init__.py — 305 B - scripts/validate/data_stats.py — 6 KB - scripts/validate/validate_dpo.py — 4 KB - scripts/validate/validate_rft.py — 9 KB - scripts/validate/validate_sft.py — 4 KB - workflows/dataset-creation.md — 3 KB - workflows/diagnose-poor-results.md — 2 KB - workflows/full-pipeline.md — 3 KB - workflows/iterative-training.md — 3 KB - workflows/quickstart.md — 4 KB ## SKILL.md Reproducido tal cual desde microsoft/azure-skills bajo MIT. Esta sección es el documento original y está en inglés. # Fine-Tuning on Microsoft Foundry Fine-tune models using SFT (supervised), DPO (preference), or RFT (reinforcement with graders). Covers dataset prep, training, deployment, and evaluation. ## When to Use Use this sub-skill when the user asks about: - Fine-tuning a model (SFT, DPO, or RFT) - Preparing, validating, or formatting training data - Submitting, monitoring, or diagnosing training jobs - Calibrating graders or pass thresholds for RFT - Deploying or evaluating a fine-tuned model - Choosing between training types (SFT vs DPO vs RFT) - Distillation, synthetic data generation, or dataset quality scoring - Large file uploads for training data - Cleaning up fine-tuning resources (files, deployments) **Do NOT use for:** General model deployment without fine-tuning (use deploy-model), agent creation (use agents), prompt optimization without training (use prompt-optimizer). ## Workflows | Stage | Guide | |-------|-------| | **Quick start** | [workflows/quickstart.md](workflows/quickstart.md) | | **Full pipeline** | [workflows/full-pipeline.md](workflows/full-pipeline.md) | | **Create data** | [workflows/dataset-creation.md](workflows/dataset-creation.md) | | **Iterate** | [workflows/iterative-training.md](workflows/iterative-training.md) | | **Diagnose** | [workflows/diagnose-poor-results.md](workflows/diagnose-poor-results.md) | ## References | Topic | File | |-------|------| | SFT vs DPO vs RFT | [references/training-types.md](references/training-types.md) | | Hyperparameters | [references/hyperparameters.md](references/hyperparameters.md) | | Data formats | [references/dataset-formats.md](references/dataset-formats.md) | | Grader design (RFT) | [references/grader-design.md](references/grader-design.md) | | Reward hacking | [references/reward-hacking.md](references/reward-hacking.md) | | Agentic RFT (tools) | [references/agentic-rft.md](references/agentic-rft.md) | | Deployment | [references/deployment.md](references/deployment.md) | | Training curves | [references/training-curves.md](references/training-curves.md) | | Evaluation | [references/evaluation.md](references/evaluation.md) | | Vision fine-tuning | [references/vision-fine-tuning.md](references/vision-fine-tuning.md) | | Large file uploads | [references/large-file-uploads.md](references/large-file-uploads.md) | | Platform gotchas | [references/platform-gotchas.md](references/platform-gotchas.md) | ## Scripts | Script | Purpose | |--------|---------| | `scripts/submit_training.py` | Submit SFT/DPO/RFT jobs | | `scripts/monitor_training.py` | Poll job until completion | | `scripts/calibrate_grader.py` | Find optimal RFT pass_threshold | | `scripts/check_training.py` | Analyze curves, list checkpoints | | `scripts/deploy_model.py` | Deploy via ARM REST API | | `scripts/evaluate_model.py` | LLM judge evaluation | | `scripts/convert_dataset.py` | Convert between SFT/DPO/RFT formats | | `scripts/generate_distillation_data.py` | Generate synthetic training data | | `scripts/score_dataset.py` | Quality scoring on training data | | `scripts/cleanup.py` | Delete old files and deployments | | `scripts/validate/` | Data validators (SFT, DPO, RFT) + stats | ## Rules 1. **Always baseline first** — evaluate the base model before fine-tuning 2. **Validate data** before submitting — run `scripts/validate/validate_sft.py` 3. **Calibrate RFT graders** — target 25-50% failure rate on the base model 4. **Evaluate checkpoints** — don't blindly deploy the final one 5. **Measure token cost** alongside accuracy when comparing models ## Quick Reference | Task | Command | |------|---------| | Validate SFT data | `python scripts/validate/validate_sft.py data.jsonl` | | Submit SFT job | `python scripts/submit_training.py --model gpt-4.1-mini --training-file train.jsonl --validation-file val.jsonl --type sft` | | Monitor job | `python scripts/monitor_training.py --job-id ftjob-xxx` | | Analyze curves | `python scripts/check_training.py --job-id ftjob-xxx` | | Deploy model | `python scripts/deploy_model.py --model-id ft:gpt-4.1-mini:... --name my-eval` | | Evaluate model | `python scripts/evaluate_model.py --deployment-name my-eval --test-file test.jsonl` | ## Error Handling | Error | Cause | Fix | |-------|-------|-----| | "API version not supported" | Older `openai` SDK on `/v1/` endpoint | Upgrade to `openai>=1.0` | | "does not support fine-tuning with Standard TrainingType" | OSS model needs `globalStandard` | Use `--use-rest` flag or script auto-falls back | | Job stuck in post-training eval | Under-provisioned tool endpoint (RFT) | Scale to S2+, enable Always On | | "DeploymentNotReady" after ARM succeeds | ARM/data-plane race condition | Delete and recreate deployment, wait 5 min | | Content safety block at deployment | PII-dense training data | Remove problematic document types | ## Dónde encaja - Categoría: [Herramientas para desarrolladores](https://skillsagentes.com/categorias/herramientas-desarrollo.md) — Skills que cambian cómo tu agente escribe, revisa y despliega código. - Creador: [microsoft](https://skillsagentes.com/creators/microsoft.md) — 43 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Microsoft Foundry](https://skillsagentes.com/skills/microsoft/azure-skills/microsoft-foundry.md): Despliega, evalúa, ajusta y gestiona agentes de Foundry de punta a punta con azd: agentes hospedados, evaluación por lotes y continua, optimizador de prompts y fine-tuning (SFT/DPO/RFT). - [Azure Prepare](https://skillsagentes.com/skills/microsoft/azure-skills/azure-prepare.md): Prepara proyectos Azure basados en azd para desplegar: genera azure.yaml, la infraestructura (Bicep o Terraform) y los Dockerfiles del flujo del Azure Developer CLI. - [Azure Diagnostics](https://skillsagentes.com/skills/microsoft/azure-skills/azure-diagnostics.md): Depura incidencias de producción en Azure con AppLens, Azure Monitor, resource health y triaje seguro. Cubre App Service, Container Apps, Functions, AKS, VMs y mensajería. - [Azure Validate](https://skillsagentes.com/skills/microsoft/azure-skills/azure-validate.md): Validación previa al despliegue en Azure. Comprueba en profundidad la configuración, la infraestructura (Bicep o Terraform), los roles RBAC, los permisos de identidad administrada y los prerrequisitos. - [Deploy Model](https://skillsagentes.com/skills/microsoft/azure-skills/deploy-model.md): Skill unificado de despliegue de modelos de Azure OpenAI con enrutado por intención: despliegues rápidos con preset, despliegues personalizados y descubrimiento de capacidad entre regiones y proyectos. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)