# Quick Start Guide Worked minimal examples for OLS, logistic regression, ARIMA, and GLM, including how to read the summary output. ## Quick Start Guide ### Linear Regression (OLS) ```python import statsmodels.api as sm import numpy as np import pandas as pd # Prepare data - ALWAYS add constant for intercept X = sm.add_constant(X_data) # Fit OLS model model = sm.OLS(y, X) results = model.fit() # View comprehensive results print(results.summary()) # Key results print(f"R-squared: {results.rsquared:.4f}") print(f"Coefficients:\\n{results.params}") print(f"P-values:\\n{results.pvalues}") # Predictions with confidence intervals predictions = results.get_prediction(X_new) pred_summary = predictions.summary_frame() print(pred_summary) # includes mean, CI, prediction intervals # Diagnostics from statsmodels.stats.diagnostic import het_breuschpagan bp_test = het_breuschpagan(results.resid, X) print(f"Breusch-Pagan p-value: {bp_test[1]:.4f}") # Visualize residuals import matplotlib.pyplot as plt plt.scatter(results.fittedvalues, results.resid) plt.axhline(y=0, color='r', linestyle='--') plt.xlabel('Fitted values') plt.ylabel('Residuals') plt.show() ``` ### Logistic Regression (Binary Outcomes) ```python from statsmodels.discrete.discrete_model import Logit # Add constant X = sm.add_constant(X_data) # Fit logit model model = Logit(y_binary, X) results = model.fit() print(results.summary()) # Odds ratios odds_ratios = np.exp(results.params) print("Odds ratios:\\n", odds_ratios) # Predicted probabilities probs = results.predict(X) # Binary predictions (0.5 threshold) predictions = (probs > 0.5).astype(int) # Model evaluation from sklearn.metrics import classification_report, roc_auc_score print(classification_report(y_binary, predictions)) print(f"AUC: {roc_auc_score(y_binary, probs):.4f}") # Marginal effects marginal = results.get_margeff() print(marginal.summary()) ``` ### Time Series (ARIMA) ```python from statsmodels.tsa.arima.model import ARIMA from statsmodels.graphics.tsaplots import plot_acf, plot_pacf # Check stationarity from statsmodels.tsa.stattools import adfuller adf_result = adfuller(y_series) print(f"ADF p-value: {adf_result[1]:.4f}") if adf_result[1] > 0.05: # Series is non-stationary, difference it y_for_acf = y_series.diff().dropna() d = 1 else: y_for_acf = y_series.dropna() d = 0 # Plot ACF/PACF to identify p, q fig, (ax1, ax2) = plt.subplots(2, 1, figsize=(12, 8)) plot_acf(y_for_acf, lags=40, ax=ax1) plot_pacf(y_for_acf, lags=40, ax=ax2) plt.show() # Fit ARIMA(p,d,q) model = ARIMA(y_series, order=(1, d, 1)) results = model.fit() print(results.summary()) # Forecast forecast = results.forecast(steps=10) forecast_obj = results.get_forecast(steps=10) forecast_df = forecast_obj.summary_frame() print(forecast_df) # includes mean and confidence intervals # Residual diagnostics results.plot_diagnostics(figsize=(12, 8)) plt.show() ``` ### Generalized Linear Models (GLM) ```python import statsmodels.api as sm # Poisson regression for count data X = sm.add_constant(X_data) model = sm.GLM(y_counts, X, family=sm.families.Poisson()) results = model.fit() print(results.summary()) # Rate ratios (for Poisson with log link) rate_ratios = np.exp(results.params) print("Rate ratios:\\n", rate_ratios) # Check overdispersion overdispersion = results.pearson_chi2 / results.df_resid print(f"Overdispersion: {overdispersion:.2f}") if overdispersion > 1.5: # Use Negative Binomial instead from statsmodels.discrete.discrete_model import NegativeBinomial nb_model = NegativeBinomial(y_counts, X) nb_results = nb_model.fit() print(nb_results.summary()) ```