Úsalo antes de afirmar que un trabajo está completo, corregido o pasando, antes de hacer commit o crear PRs: exige ejecutar comandos de verificación y confirmar la salida antes de cualquier afirmación de éxito.
Úsalo al recibir feedback de code review, antes de implementar sugerencias, sobre todo si el feedback parece poco claro o técnicamente cuestionable: exige rigor técnico y verificación, no acuerdo performativo ni implementación ciega.
Desarrollo guiado por tests. Úsalo cuando quieras construir features o arreglar bugs test-first, cuando menciones "red-green-refactor", o cuando quieras tests de integración.
Migra archivos de test de aserciones de tipo `as` a @total-typescript/shoehorn. Úsalo cuando menciones shoehorn, quieras reemplazar `as` en tests, o necesites datos de test parciales.
Kit para interactuar con aplicaciones web locales y probarlas con Playwright. Permite verificar el frontend, depurar la UI, capturar pantallazos del navegador y ver sus logs.
Hace QA de un sitio o app web y devuelve una puntuación de 1 a 5 (5 = perfecto, 1 = roto) con evidencia, usando un navegador real en la nube de Browser Use, incluso con localhost.
CLI de automatización de navegador para agentes de IA: navega, rellena formularios, hace clic, captura pantallas, extrae datos, prueba apps y automatiza Electron o Slack.
Explora y prueba sistemáticamente una aplicación web para encontrar bugs y problemas de UX, generando un reporte con capturas paso a paso, videos de reproducción y pasos detallados por cada hallazgo.
Úsalo tras generar código con IA, aceptar sugerencias o revisar módulos escritos por IA, o cuando el código funcione pero parezca frágil o con deuda oculta.
Realiza auditorías de accesibilidad WCAG 2.2 con pruebas automatizadas, verificación manual y guía de remediación. Útil para auditar sitios, corregir violaciones y aplicar patrones de diseño accesible.
Prueba workflows de Temporal con pytest, time-skipping y estrategias de mocking: testing unitario, de integración, de replay y configuración de desarrollo local.
Úsalo al revisar código Python en busca de antipatrones comunes: como checklist antes de finalizar implementaciones o al depurar problemas derivados de malas prácticas conocidas.
Filtra checkpoints fine-tuneados con presupuestos de drift, comparación pareada y chequeos de olvido antes de promoverlos, tras un entrenamiento o al re-gatear un modelo ya promovido.
Domina técnicas sistemáticas de depuración, herramientas de profiling y análisis de causa raíz para localizar bugs en cualquier código o stack tecnológico.
Metodología de calidad de PluginEval: dimensiones, rúbricas, métodos estadísticos y fórmulas de puntuación, para interpretar scores bajos o calibrar umbrales del marketplace.
Domina prácticas efectivas de revisión de código para dar feedback constructivo, detectar bugs a tiempo y fomentar el intercambio de conocimiento sin dañar la moral del equipo.
Implementa estrategias de evaluación integrales para aplicaciones LLM usando métricas automatizadas, feedback humano y benchmarking, útil para medir la calidad de sistemas de IA.
Coordina revisiones de código paralelas en varias dimensiones de calidad, con deduplicación de hallazgos, calibración de severidad e informes consolidados.
Prueba aplicaciones web con lectores de pantalla como VoiceOver, NVDA y JAWS para validar compatibilidad, depurar accesibilidad y verificar soporte de tecnología asistiva.
Domina la configuración y el uso de ShellCheck para el análisis estático de shell scripts. Úsalo al montar infraestructura de linting, corregir problemas de código o garantizar la portabilidad de scripts.
Revisa código de animación y motion contra un estándar de craft alto basado en la filosofía de diseño de Emil Kowalski; por defecto señala problemas, la aprobación se gana.
Úsalo al añadir o actualizar cobertura E2E de CLI en Go para un dominio tests/cli_e2e/{domain} del lark-cli compilado, con exploración en vivo de --help/schema, flujos clie2e.RunCmd y mantenimiento de coverage.md.
Guía sobre la metodología de evaluación de Agent Platform y el Quality Flywheel: métricas, esquema de dataset, scoring LLM-as-judge y causas comunes de fallo.
Analiza el rendimiento web con Chrome DevTools MCP: mide Core Web Vitals y métricas complementarias, detecta bloqueos de renderizado, cadenas de red, layout shifts, caché y brechas de accesibilidad.
Audita y mejora la accesibilidad web siguiendo las pautas WCAG 2.2. Úsalo ante 'improve accessibility', 'a11y audit', 'WCAG compliance', 'screen reader support', 'keyboard navigation' o 'make accessible'.
Evalúa skills de Expo de extremo a extremo: precisión de activación, calidad del código generado y capturas en tiempo de ejecución en simulador iOS y emulador Android vía Expo Go (web opcional).
Skill Rigor Run para reproducir repos de deep learning centrados en el README: captura evidencia de un smoke test, inferencia o evaluación documentada en repro_outputs/, con notas de parches si cambian archivos.
Skill Rigor Debug / Rigor Audit para investigación de deep learning: diagnóstico conservador ante tracebacks o fallos de entrenamiento, separando fixes de depuración de contribuciones de investigación.
Úsalo al escribir tests de Playwright, arreglar tests flaky, depurar fallos, POM, CI/CD, mocking de APIs, auth, accesibilidad y más: E2E, componentes, API, visual, seguridad, Electron y extensiones.
Ejecuta todas las auditorías de Convex (authz, reviewer, advisor, insights) en un único reporte puntuado y deduplicado, con un plan de arreglo ordenado — como Lighthouse para tu backend.
Revisor de código Convex: comprueba seguridad, auth, validators, rendimiento y patrones en código dentro de un directorio convex/. Úsalo para revisar o auditar funciones Convex antes de publicarlas.
Demuestra que una feature de Convex funciona: seedea datos, la ejecuta como varios usuarios simulados vía convex-test y afirma el comportamiento, incluidos los casos negativos de autorización.
Crea, ejecuta y mantiene tests E2E móviles Momentic y módulos para Android e iOS, usando MCP para validación en dispositivo real o edición directa de YAML v2 para cambios locales de alta confianza.
Crea, ejecuta y mantiene tests y módulos E2E de Momentic, serializados como *.test.yaml y *.module.yaml, usando agentes de IA para automatizar interacciones de navegador.
Genera un explore-prompt.md con contexto específico del repo para el agente explorador de Momentic: apps a probar, URLs objetivo, autenticación, ubicación de tests y particularidades, para usar con --prompt-file.
Clasifica o explica los resultados de ejecuciones de pruebas de Momentic usando las herramientas MCP de Momentic: categoriza fallos, explica causas, triaje y comparación con ejecuciones pasadas.