Skills Agentes

Minimal Run And Audit

Skill Rigor Run para reproducir repos de deep learning centrados en el README: captura evidencia de un smoke test, inferencia o evaluación documentada en repro_outputs/, con notas de parches si cambian archivos.

Estrellas
493

en todo el repo

Actividad
62

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
5

últimos 90 días

Contexto
679 tok

124 tok en reposo

Paquete
5 archivos

14 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add lllllllama/RigorPilot-Skills --skill minimal-run-and-audit --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Ejecuta o normaliza evidencia de un smoke test, inferencia o evaluación documentada y escribe archivos estandarizados en repro_outputs/
  • Genera SCIENTIFIC_CHANGELOG.md cuando cambia el significado científico y COMPARABILITY_REPORT.md para comparar con README/paper/baseline
  • Distingue claramente entre estados verificado, parcial y bloqueado
  • Produce PATCHES.md cuando se modificaron archivos del repositorio

Úsalo cuando

  • Ya existe un objetivo de reproducción y un plan de configuración
  • El skill principal necesita evidencia de ejecución y salidas normalizadas
  • Es apropiado un smoke test, una ejecución de inferencia/evaluación documentada u otra verificación corta sin entrenamiento
  • El usuario ya sabe qué comando intentar y solo quiere ejecución más reporte

No lo uses cuando

  • Durante el escaneo inicial del repositorio o cuando el entorno/assets aún están indefinidos
  • Cuando la tarea es una búsqueda bibliográfica y no una ejecución del repositorio
  • Cuando el usuario aún está decidiendo qué objetivo de reproducción será el principal

Qué lo activa

Di cualquiera de estas frases y el agente debería cargar este skill.

  • “Ejecuta el smoke test documentado y guarda la evidencia en repro_outputs/”
  • “Corre el comando de inferencia del README y normaliza los resultados”
  • “Necesito el reporte de comparabilidad tras correr la evaluación documentada”

SKILL.md

En inglés

minimal-run-and-audit

Use this as the Rigor Run skill. The installed slug remains minimal-run-and-audit for compatibility.

Use the shared operating principles in ../../references/agent-operating-principles.md; this skill should make run evidence auditable without turning every command into a rigid protocol.

When to apply

  • After a reproduction target and setup plan exist.
  • When the main skill needs execution evidence and normalized outputs.
  • When a smoke test, documented inference run, documented evaluation run, or other short non-training verification is appropriate.
  • When the user already knows what command should be attempted and wants execution plus reporting only.

When not to apply

  • During initial repo scanning.
  • When environment or assets are still undefined enough to make execution meaningless.
  • When the task is a literature lookup rather than repository execution.
  • When the user is still deciding which reproduction target should count as the main run.

Clear boundaries

  • This skill owns normalized reporting for an attempted command.
  • It may receive execution evidence from the main skill or a thin helper.
  • It does not choose the overall target on its own.
  • It does not perform broad paper analysis.
  • It does not own training startup, resume, or long-running training state.
  • It should not normalize risky code edits into acceptable practice.
  • It must not hide changes that alter evaluation, preprocessing, checkpoints, metrics, or other scientific meaning.

Input expectations

  • selected reproduction goal
  • runnable commands or smoke commands
  • environment and asset assumptions
  • optional patch metadata

Output expectations

  • execution result summary
  • standardized repro_outputs/ files
  • SCIENTIFIC_CHANGELOG.md for changed scientific meaning and evidence status
  • COMPARABILITY_REPORT.md for README/paper/baseline comparability
  • clear distinction between verified, partial, and blocked states
  • PATCHES.md when repo files changed

Notes

Use references/reporting-policy.md, ../../references/research-rigor-principles.md, scripts/run_command.py, and scripts/write_outputs.py.

Reproducido de lllllllama/RigorPilot-Skills bajo licencia MIT. Leer esta página en markdown.

Archivos

5 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

Antes de instalar

Requiere que ya exista un objetivo de reproducción seleccionado y comandos ejecutables o de smoke test definidos.

Detalles

Creador
lllllllama
Categoría
Testing y QA
Licencia
MIT
Recursos incluidos
scripts en python + referencias
Código fuente
Ver SKILL.md

Más de lllllllama/RigorPilot-Skills

Este repo incluye 11 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack RigorPilot-Skills entero y su comando de instalación

Skill compatible con Rigor Reproduce para reproducción README-first de repos de deep learning: elige el objetivo mínimo confiable, coordina fases confiables y registra evidencia y desviaciones en `repro_outputs/`.

Costo de contexto al activarse
1.7k tok
Tamaño del paquete
14 archivos
Última actualización
hace 2 meses
desarrollo apis

Slug de skill compatible con Rigor Explore para candidatos de investigación en deep learning potencialmente novedosos: exploración solo de candidatos sobre `current_research`, con comprensión auditable del repo y comparación justa.

Costo de contexto al activarse
1.6k tok
Tamaño del paquete
34 archivos
Última actualización
hace 2 meses
investigacion

Ayudante de Rigor Intake para reproducción de repos de deep learning basada en README: escanea el repo, extrae comandos documentados y clasifica candidatos de inferencia, evaluación y entrenamiento.

Costo de contexto al activarse
531 tok
Tamaño del paquete
5 archivos
Última actualización
hace 2 meses
herramientas desarrollo

Skill de Rigor Train para repositorios de investigación de deep learning: ejecuta de forma conservadora comandos de entrenamiento y registra evidencia estandarizada en train_outputs/.

Costo de contexto al activarse
621 tok
Tamaño del paquete
5 archivos
Última actualización
hace 2 meses
desarrollo apis

Skill de implementación para trabajo exploratorio auditable de código en investigación de deep learning: transplante de módulos, adaptación de backbone o capas LoRA/adapter en rama aislada, con registros para rollback en explore_outputs/.

Costo de contexto al activarse
637 tok
Tamaño del paquete
5 archivos
Última actualización
hace 2 meses
herramientas desarrollo

Skill hoja de Rigor Improve/Rigor Explore para evidencia exploratoria acotada: validaciones en subconjunto, sweeps, búsqueda en GPU ociosa o transfer-learning rápido, con resúmenes sin sobreclamar en `explore_outputs/`.

Costo de contexto al activarse
817 tok
Tamaño del paquete
5 archivos
Última actualización
hace 2 meses
datos analitica

Skills relacionados

Úsalo al recibir feedback de code review, antes de implementar sugerencias, sobre todo si el feedback parece poco claro o técnicamente cuestionable: exige rigor técnico y verificación, no acuerdo performativo ni implementación ciega.

Costo de contexto al activarse
1.6k tok
Tamaño del paquete
1 archivo
Última actualización
hace 2 meses
testing qa

Úsalo al completar tareas, implementar features mayores, o antes de mergear, para verificar que el trabajo cumple los requisitos.

Costo de contexto al activarse
739 tok
Tamaño del paquete
2 archivos
Última actualización
el mes pasado
testing qa

Úsalo ante cualquier bug, fallo de test o comportamiento inesperado, antes de proponer arreglos.

Costo de contexto al activarse
2.4k tok
Tamaño del paquete
11 archivos
Última actualización
hace 2 meses
testing qa