Back to Projects

Data Science & Mobility Intelligence2025

Casestudy 05

Flux

Shanghai Metro Passenger Mobility Intelligence

PythonPandasSciPy.statsNumPyTableau

The Vision & Architecture

Decoding urban transit dynamics with rigorous statistical distributions.

Flux is an exploratory data analysis and inferential statistics pipeline processing over 3.6 million passenger transaction records from the Shanghai Metro merged with localized weather data. Proves Poisson arrival failure, fits Negative Binomial overdispersion, and validates the Central Limit Theorem via Monte Carlo simulations.

3.6M+Passenger Flow Records
388.7Variance-to-Mean Ratio
95% CI[6.01M, 6.45M] Daily Flow
16Metro Lines Modeled

Core Capabilities

  • Overdispersion Testing & Distribution Fitting

    Calculated a dispersion ratio of ~388.7 (variance/mean), formally rejecting the Poisson process via Kolmogorov-Smirnov test and fitting a Negative Binomial model to prevent underestimating peak overcrowding.

  • Empirical Central Limit Theorem Simulation

    Designed Monte Carlo sampling simulations (n=100) demonstrating convergence of highly skewed passenger distributions into Gaussian normal curves (Jarque-Bera p > 0.05).

  • Weather Impact Sensitivity Modeling

    Quantified meteorological effects, proving rain heavily depresses discretionary leisure travel (NHBinFlow) while non-discretionary commuter flow (CinFlow) remains rigid.

  • Spatiotemporal Mobility Signatures

    Identified distinct weekday dual-peak "M" commuter profiles (7–9 AM, 5–7 PM) versus weekend single-peak bell curves across 16 metro lines and critical transfer hubs.

  • Operational Strategy & Policy Engineering

    Translated statistical confidence intervals into transit policies, including gap-train insertions at residential bottlenecks and weather-contingent staff redeployment.

Technology Stack

Python & PandasVectorized Data Processing
SciPy.statsDistribution Fitting & Tests
NumPyMonte Carlo Simulation
Matplotlib & SeabornDiagnostic Visualizations
TableauInteractive Transit Dashboards

Architectural Decisions

  • Negative Binomial over Poisson distribution

    The extreme overdispersion (variance 400x mean) causes standard Poisson models to drastically underestimate peak crowd risks.

  • In-memory vectorized Python over distributed Spark

    Processing 3.6 million rows in-memory via Pandas avoids cluster serialization overhead and executes statistical tests in seconds.