Skills Agentes

Scikit Learn

Aprendizaje automático en Python con scikit-learn: clasificación, regresión, clustering, reducción de dimensionalidad, evaluación de modelos, ajuste de hiperparámetros, preprocesamiento y pipelines de ML.

Solicitaread write edit bash
Estrellas
34.8k

en todo el repo

Actividad
58

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
3

últimos 90 días

Contexto
2.6k tok

95 tok en reposo

Paquete
11 archivos

118 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add K-Dense-AI/scientific-agent-skills --skill scikit-learn --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Guía tareas de clasificación, regresión, clustering y reducción de dimensionalidad con scikit-learn
  • Construye pipelines completos con Pipeline y ColumnTransformer para datos mixtos numéricos y categóricos
  • Evalúa modelos con validación cruzada, búsqueda de hiperparámetros (Grid/RandomizedSearchCV) y métricas
  • Incluye scripts de ejemplo para un pipeline de clasificación completo y un análisis de clustering
  • Documenta preprocesamiento (escalado, codificación, imputación) y selección de características

Úsalo cuando

  • Construir modelos de clasificación o regresión
  • Realizar clustering o reducción de dimensionalidad
  • Evaluar el rendimiento de un modelo con validación cruzada o ajustar hiperparámetros
  • Crear pipelines de ML para producción o comparar algoritmos

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Entrena un RandomForestClassifier y evalúa con validación cruzada
    • Crea un pipeline con ColumnTransformer para datos numéricos y categóricos
    • Compara algoritmos de clustering con el método del codo y silhouette
    • Ajusta hiperparámetros con GridSearchCV para este modelo

    SKILL.md

    En inglés

    Scikit-learn

    Overview

    This skill provides comprehensive guidance for machine learning tasks using scikit-learn, the industry-standard Python library for classical machine learning. Use this skill for classification, regression, clustering, dimensionality reduction, preprocessing, model evaluation, and building production-ready ML pipelines.

    Installation

    Tested against scikit-learn 1.8.0 (stable; December 2025). Requires Python 3.11–3.14 (free-threaded CPython 3.14 wheels available in 1.8+).

    Install the PyPI package scikit-learn (not the deprecated sklearn package on PyPI). Import in code as sklearn.

    # Install scikit-learn using uv
    uv pip install "scikit-learn>=1.7"
    
    # Optional: plotting utilities and bundled script dependencies
    uv pip install "scikit-learn[plots]" matplotlib seaborn
    
    # Commonly used with
    uv pip install pandas numpy
    

    Check your version:

    import sklearn
    print(sklearn.__version__)
    

    When to Use This Skill

    Use the scikit-learn skill when:

    • Building classification or regression models
    • Performing clustering or dimensionality reduction
    • Preprocessing and transforming data for machine learning
    • Evaluating model performance with cross-validation
    • Tuning hyperparameters with grid or random search
    • Creating ML pipelines for production workflows
    • Comparing different algorithms for a task
    • Working with both structured (tabular) and text data
    • Need interpretable, classical machine learning approaches

    Quick Start

    Classification Example

    from sklearn.model_selection import train_test_split
    from sklearn.preprocessing import StandardScaler
    from sklearn.ensemble import RandomForestClassifier
    from sklearn.metrics import classification_report
    
    # Split data
    X_train, X_test, y_train, y_test = train_test_split(
        X, y, test_size=0.2, stratify=y, random_state=42
    )
    
    # Preprocess
    scaler = StandardScaler()
    X_train_scaled = scaler.fit_transform(X_train)
    X_test_scaled = scaler.transform(X_test)
    
    # Train model
    model = RandomForestClassifier(n_estimators=100, random_state=42)
    model.fit(X_train_scaled, y_train)
    
    # Evaluate
    y_pred = model.predict(X_test_scaled)
    print(classification_report(y_test, y_pred))
    

    Complete Pipeline with Mixed Data

    from sklearn.pipeline import Pipeline
    from sklearn.compose import ColumnTransformer
    from sklearn.preprocessing import StandardScaler, OneHotEncoder
    from sklearn.impute import SimpleImputer
    from sklearn.ensemble import GradientBoostingClassifier
    
    # Define feature types
    numeric_features = ['age', 'income']
    categorical_features = ['gender', 'occupation']
    
    # Create preprocessing pipelines
    numeric_transformer = Pipeline([
        ('imputer', SimpleImputer(strategy='median')),
        ('scaler', StandardScaler())
    ])
    
    categorical_transformer = Pipeline([
        ('imputer', SimpleImputer(strategy='most_frequent')),
        ('onehot', OneHotEncoder(handle_unknown='ignore'))
    ])
    
    # Combine transformers
    preprocessor = ColumnTransformer([
        ('num', numeric_transformer, numeric_features),
        ('cat', categorical_transformer, categorical_features)
    ])
    
    # Full pipeline
    model = Pipeline([
        ('preprocessor', preprocessor),
        ('classifier', GradientBoostingClassifier(random_state=42))
    ])
    
    # Fit and predict
    model.fit(X_train, y_train)
    y_pred = model.predict(X_test)
    

    Core Capabilities

    Five capability areas are documented in references/core_capabilities.md, with per-topic detail in references/supervised_learning.md, references/unsupervised_learning.md, references/model_evaluation.md, references/preprocessing.md, and references/pipelines_and_composition.md:

    1. Supervised learning — classification and regression estimator families.
    2. Unsupervised learning — clustering, decomposition, and manifold learning.
    3. Model evaluation and selection — metrics, cross-validation, and hyperparameter search.
    4. Data preprocessing — scaling, encoding, imputation, and feature selection.
    5. Pipelines and compositionPipeline and ColumnTransformer.

    Always fit preprocessing inside a Pipeline so it is refit per cross-validation fold; scaling or imputing before splitting leaks test information into training.

    Two worked workflows are in references/common_workflows.md.

    Example Scripts

    Classification Pipeline

    Run a complete classification workflow with preprocessing, model comparison, hyperparameter tuning, and evaluation:

    uv run python scripts/classification_pipeline.py
    

    This script demonstrates:

    • Handling mixed data types (numeric and categorical)
    • Model comparison using cross-validation
    • Hyperparameter tuning with GridSearchCV
    • Comprehensive evaluation with multiple metrics
    • Feature importance analysis

    Clustering Analysis

    Perform clustering analysis with algorithm comparison and visualization:

    uv run python scripts/clustering_analysis.py
    

    This script demonstrates:

    • Finding optimal number of clusters (elbow method, silhouette analysis)
    • Comparing multiple clustering algorithms (K-Means, DBSCAN, Agglomerative, Gaussian Mixture)
    • Evaluating clustering quality without ground truth
    • Visualizing results with PCA projection

    Reference Documentation

    This skill includes comprehensive reference files for deep dives into specific topics:

    Quick Reference

    File: references/quick_reference.md

    • Common import patterns and installation instructions
    • Quick workflow templates for common tasks
    • Algorithm selection cheat sheets
    • Common patterns and gotchas
    • Performance optimization tips

    Supervised Learning

    File: references/supervised_learning.md

    • Linear models (regression and classification)
    • Support Vector Machines
    • Decision Trees and ensemble methods
    • K-Nearest Neighbors, Naive Bayes, Neural Networks
    • Algorithm selection guide

    Unsupervised Learning

    File: references/unsupervised_learning.md

    • All clustering algorithms with parameters and use cases
    • Dimensionality reduction techniques
    • Outlier and novelty detection
    • Gaussian Mixture Models
    • Method selection guide

    Model Evaluation

    File: references/model_evaluation.md

    • Cross-validation strategies
    • Hyperparameter tuning methods
    • Classification, regression, and clustering metrics
    • Learning and validation curves
    • Best practices for model selection

    Preprocessing

    File: references/preprocessing.md

    • Feature scaling and normalization
    • Encoding categorical variables
    • Missing value imputation
    • Feature engineering techniques
    • Custom transformers

    Pipelines and Composition

    File: references/pipelines_and_composition.md

    • Pipeline construction and usage
    • ColumnTransformer for mixed data types
    • FeatureUnion for parallel transformations
    • Complete end-to-end examples
    • Best practices

    Best Practices

    Always Use Pipelines

    Pipelines prevent data leakage and ensure consistency:

    # Good: Preprocessing in pipeline
    pipeline = Pipeline([
        ('scaler', StandardScaler()),
        ('model', LogisticRegression())
    ])
    
    # Bad: Preprocessing outside (can leak information)
    X_scaled = StandardScaler().fit_transform(X)
    

    Fit on Training Data Only

    Never fit on test data:

    # Good
    scaler = StandardScaler()
    X_train_scaled = scaler.fit_transform(X_train)
    X_test_scaled = scaler.transform(X_test)  # Only transform
    
    # Bad
    scaler = StandardScaler()
    X_all_scaled = scaler.fit_transform(np.vstack([X_train, X_test]))
    

    Use Stratified Splitting for Classification

    Preserve class distribution:

    X_train, X_test, y_train, y_test = train_test_split(
        X, y, test_size=0.2, stratify=y, random_state=42
    )
    

    Set Random State for Reproducibility

    model = RandomForestClassifier(n_estimators=100, random_state=42)
    

    Choose Appropriate Metrics

    • Balanced data: Accuracy, F1-score
    • Imbalanced data: Precision, Recall, ROC AUC, Balanced Accuracy
    • Cost-sensitive: Define custom scorer

    Scale Features When Required

    Algorithms requiring feature scaling:

    • SVM, KNN, Neural Networks
    • PCA, Linear/Logistic Regression with regularization
    • K-Means clustering

    Algorithms not requiring scaling:

    • Tree-based models (Decision Trees, Random Forest, Gradient Boosting)
    • Naive Bayes

    Troubleshooting Common Issues

    ConvergenceWarning

    Issue: Model didn't converge Solution: Increase max_iter or scale features

    model = LogisticRegression(max_iter=1000)
    

    Poor Performance on Test Set

    Issue: Overfitting Solution: Use regularization, cross-validation, or simpler model

    # Add regularization
    model = Ridge(alpha=1.0)
    
    # Use cross-validation
    scores = cross_val_score(model, X, y, cv=5)
    

    Memory Error with Large Datasets

    Solution: Use algorithms designed for large data

    # Use SGD for large datasets
    from sklearn.linear_model import SGDClassifier
    model = SGDClassifier()
    
    # Or MiniBatchKMeans for clustering
    from sklearn.cluster import MiniBatchKMeans
    model = MiniBatchKMeans(n_clusters=8, batch_size=100)
    

    Additional Resources

    Reproducido de K-Dense-AI/scientific-agent-skills bajo licencia BSD-3-Clause license. Leer esta página en markdown.

    Archivos

    11 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere Python 3.11+ y scikit-learn 1.7+, con NumPy y SciPy; matplotlib/seaborn son opcionales para los scripts de ejemplo.

    Detalles

    Creador
    K-Dense-AI
    Licencia
    BSD-3-Clause license
    Recursos incluidos
    scripts en python + referencias
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de K-Dense-AI/scientific-agent-skills

    Este repo incluye 163 skills. Si instalas uno, normalmente ya tienes los demás.

    Gestión integral de citas académicas: busca en OpenAlex, PubMed y Google Scholar, extrae metadatos precisos, valida citas y genera entradas BibTeX correctamente formateadas.

    Costo de contexto al activarse
    3.7k tok
    Tamaño del paquete
    21 archivos
    Última actualización
    hace 28 días
    investigacion

    Realiza revisiones bibliográficas sistemáticas y completas usando varias bases académicas (PubMed, arXiv, bioRxiv, Semantic Scholar). Genera markdown y PDF con citas verificadas en varios estilos (APA, Nature, Vancouver).

    Costo de contexto al activarse
    3.2k tok
    Tamaño del paquete
    12 archivos
    Última actualización
    hace 15 días
    investigacion

    Crea decks de diapositivas y presentaciones para charlas de investigación: PowerPoint, presentaciones de conferencia, seminarios, defensas de tesis. Da estructura, plantillas, guía de tiempos y validación visual.

    Costo de contexto al activarse
    5.1k tok
    Tamaño del paquete
    24 archivos
    Última actualización
    hace 15 días
    documentos

    Crea infografías profesionales con Nano Banana Pro AI y refinamiento iterativo inteligente. Usa Gemini 3.6 Flash para revisar la calidad e integra investigación con Perplexity Sonar. Soporta 10 tipos, 8 estilos y paletas para daltonismo.

    Costo de contexto al activarse
    2.7k tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 15 días
    diseno ui

    Crea pósteres de investigación profesionales en LaTeX con beamerposter, tikzposter o baposter, para conferencias y comunicación científica: layout, colores, columnas múltiples e integración de figuras.

    Costo de contexto al activarse
    3.9k tok
    Tamaño del paquete
    17 archivos
    Última actualización
    hace 15 días
    documentos

    Crea diagramas científicos de calidad de publicación con la IA Nano Banana 2 y refinamiento iterativo inteligente. Gemini 3.6 Flash revisa la calidad y solo regenera si está por debajo del umbral de tu tipo de documento.

    Costo de contexto al activarse
    4.1k tok
    Tamaño del paquete
    6 archivos
    Última actualización
    hace 15 días
    diseno ui

    Skills relacionados

    Aeon

    34.8k

    Para tareas de machine learning con series temporales: clasificación, regresión, clustering, forecasting, detección de anomalías, segmentación y búsqueda de similitud, con APIs compatibles con scikit-learn.

    Costo de contexto al activarse
    3.1k tok
    Tamaño del paquete
    12 archivos
    Última actualización
    el mes pasado
    datos analitica

    Anndata

    34.8k

    Estructura de datos para matrices anotadas en análisis de célula única. Úsala con archivos .h5ad o el ecosistema scverse; para análisis usa scanpy, para modelos probabilísticos scvi-tools, para escala poblacional cellxgene-census.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    6 archivos
    Última actualización
    el mes pasado
    datos analitica

    Infiere redes de regulación génica (GRN) a partir de datos de expresión génica con algoritmos escalables (GRNBoost2, GENIE3), para transcriptómica bulk o de célula única, con computación distribuida.

    Costo de contexto al activarse
    2.1k tok
    Tamaño del paquete
    5 archivos
    Última actualización
    el mes pasado
    datos analitica