0 cumulative citations
View corpus contextGenerative AI in transport gives different advice to different personas, and some synthetic crash generators distort safety-relevant relationships; combined with stark demographic differences in AI attitudes, these distributional gaps argue for continuous, sensitivity-aware risk metrics instead of binary approval tiers.
Citation observations
Cumulative provider counts captured on specific dates; providers are never combined.
Generative artificial intelligence is entering transportation through traveler-facing advisories, synthetic crash-record generation, and policy decision support. Existing governance frameworks lack transport-specific statistical tools to measure distributional risks across heterogeneous populations. We develop a Distributional Sociotechnical Audit (DSA) that integrates algorithmic equity, synthetic-data validity, and public-attitude heterogeneity into one empirical pipeline. The audit analyzes 5,760 persona-controlled queries to four LLM families across 12 demographic cues and four transport topics, uses two cross-family judges and a Wasserstein-2 Equity Dispersion Index, tests three FARS crash-record generators with conditional projected maximum mean discrepancy (cpMMD), fits a Bayesian ordered-logit model to Pew American Trends Panel Wave 152 (N = 4,538), and combines the signals into a continuous Sociotechnical Risk Index. Congestion-pricing advice has the highest persona-based dispersion (mean EDI = 1.96; highest direct EDI = 2.20). CART synthetic crash records fail all conditional tests (p < 0.001), while the Gaussian copula has borderline conditional stress (p = 0.105) despite passing marginal checks. Attitudes to AI vary across demographic strata. Distributional audits and continuous risk indices with sensitivity reporting offer a more defensible basis for transport GenAI governance than categorical approval tiers, which show a 75% assignment flip rate under weight perturbation.
Summary
Main Finding
Generative AI systems entering transport produce measurable, population-differentiated risks across three linked layers—LLM outputs, synthetic crash-data products, and public attitudes—and these distributional signals can and should be combined into a continuous, sensitivity-bounded governance metric. Key empirical results: (1) persona cues induce sizable variation in LLM transport advice (mean Equity Dispersion Index (EDI) = 1.96; max cell Gemini Flash direct EDI = 2.20), with policy-contested topics (e.g., congestion pricing) showing up to 1.6× more persona-driven variation than low-contest topics (e.g., weather-safety); (2) common synthetic crash-data generators can fail to preserve conditional structure—CART fails conditional distributional tests (p < 0.001) while a Gaussian-copula baseline passes marginal checks but is borderline on conditional checks (p = 0.105); (3) public attitudes toward AI are heterogeneous across strata (Bayesian posterior |β_k| range 0.002–0.860); (4) when combined into a Sociotechnical Risk Index (STRI) with perturbation bounds, continuous risk measurement is more robust than categorical readiness tiers (categorical tiers flipped 75% under weight perturbation).
Key Points
- Distributional risk matters more than aggregate performance: comparable semantic queries differing only by persona cues produce systematically different LLM outputs on transport topics.
- The Wasserstein-2 Equity Dispersion Index (EDI) is used to compare full-score distributions across persona groups rather than reliance on means or keyword counts.
- Synthetic-data validity requires conditional (not only marginal) checks; failing conditional fidelity can produce silent distortions important to safety and regulatory analysis.
- Public acceptance and trust are stratified; aggregate readiness scores risk masking groups with substantially different attitudes toward GenAI.
- Continuous composite indices with explicit sensitivity reporting (STRI + Weyl perturbation bounds) provide a more defensible governance signal than rigid categorical tiers.
Data & Methods
- LLM audit
- 5,760 persona-controlled queries: 4 LLM families (GPT-5.4 Nano; Claude Haiku 4.5; Gemini 3.1 Flash Lite; Mistral Nemo 12B)
- 12 demographic persona cues × 4 transport topics × 30 repetitions
- Responses scored on 8 content axes by two cross-family LLM judges
- Equity Dispersion Index (EDI): pairwise Wasserstein-2 distances across persona-conditioned rubric-score distributions
- Synthetic-data audit
- Authentic FARS crash data vs. three classical generators (Gaussian copula, sequential CART, perturbation baseline)
- 110,001 synthetic records total
- Conditional projected maximum mean discrepancy (cpMMD) testing to assess conditional distributional fidelity (marginal checks plus conditional dependence)
- Findings: CART fails conditional tests (p < 0.001); Gaussian copula borderline (p = 0.105)
- Public-attitude analysis
- Pew American Trends Panel Wave 152 (N = 4,538; Aug 12–18, 2024)
- Bayesian ordered-logit model with horseshoe priors estimating stratum-level effects (age, gender, metropolitan status, race)
- Posterior |β_k| range: 0.002 to 0.860, indicating substantial heterogeneity
- Governance synthesis
- Sociotechnical Risk Index (STRI): continuous composite that integrates EDI (equity), cpMMD (synthetic-data stress), and attitude heterogeneity
- STRI sensitivity analyzed with Weyl perturbation bounds; categorical Regulatory Readiness Ladder (RRL) tiers shown to be unstable (75% assignment flip under weight perturbation)
Implications for AI Economics
- Welfare and distributional externalities
- Persona-differentiated advice implies that AI-mediated information can redistribute welfare (and harm) across demographic groups even without physical infrastructure changes. Economic evaluations (cost-benefit, welfare analysis) must incorporate distributional impacts, not just mean benefits.
- Market design and demand heterogeneity
- Heterogeneous attitudes toward AI imply segmented adoption curves and price sensitivities across demographics. Firms and regulators should anticipate non-uniform uptake, affecting demand forecasts, pricing strategies for mobility services, and the design of targeted interventions/subsidies.
- Insurance, liability, and risk pricing
- If synthetic data used in safety analyses are conditionally distorted (e.g., CART failures), actuarial estimates and liability models relying on synthetic records may be biased. Insurers and regulators need validated conditional fidelity checks before using synthetic datasets for premium setting or regulatory compliance.
- Regulatory policy and compliance metrics
- Continuous, sensitivity-bounded risk indices (STRI) are preferable to categorical pass/fail tiers for regulating GenAI in transport. Economic regulation that uses brittle categorical thresholds risks misclassification, per the 75% flip-rate under perturbation; welfare-improving regulation should incorporate robustness/sensitivity analysis and potentially use continuous taxes/subsidies or graded obligations.
- Investment and procurement decisions
- Public agencies procuring GenAI tools should require distributional audits (EDI) and synthetic-data validation (cpMMD) as part of procurement KPIs. From an economic perspective, this raises the transaction cost of deployment and creates new markets for audit/validation services.
- Research and model-use externalities
- Policy simulations and transport-economic models that rely on synthetic microdata must incorporate uncertainty from conditional mismatch. Analysts should propagate cpMMD-detected discrepancies into counterfactual estimates and confidence intervals to avoid overconfident policy recommendations.
- Incentives for model developers
- Developers face externalities: generating outputs that vary by persona can create reputational, legal, and market risks. Economic incentives (contractual clauses, liability exposure, certification premiums) should be aligned to reward distributional fidelity and robust synthetic-data generation.
- Measurement recommendations for AI economists
- Adopt distributional testing (Wasserstein/optimal-transport metrics), conditional two-sample tests for synthetic data, and stratified attitude measures when modeling adoption or welfare; embed sensitivity bounds in policy simulations and cost-benefit analyses.
Limitations to keep in mind: the audit is descriptive (not causal), limited to the selected LLM families, topics, and U.S.-centric data; synthetic generators evaluated are classical baselines (not state-of-the-art GAN/LLM datagenerators), so results indicate risk pathways rather than a universal verdict.
If useful, I can convert these findings into recommended checklist items for transport-sector economic evaluations (e.g., required tests, audit contract language, or templates for embedding STRI-like uncertainty in cost-benefit models).
Assessment
Claims (8)
| Claim | Direction | Outcome | Confidence & Evidence | Details |
|---|---|---|---|---|
| Congestion-pricing advice produced the highest distributional dispersion across demographic personas in the LLM audit. Ai Safety And Ethics | negative | Distributional variation in LLM-generated transport advice across demographic personas |
Reading fidelity
high
Study strength
medium
|
n=5760
mean EDI = 1.96
|
| The largest observed persona-related dispersion occurred for Gemini Flash's direct congestion-pricing advice, with an EDI of 2.20. Ai Safety And Ethics | negative | Persona-based dispersion in direct LLM transport advice |
Reading fidelity
high
Study strength
medium
|
n=5760
direct EDI = 2.20
|
| Policy-contested transport topics generated as much as 1.6 times more persona-driven variation than weather-safety advice. Ai Safety And Ethics | negative | Relative persona-driven variation in LLM advice by transport topic |
Reading fidelity
high
Study strength
medium
|
n=5760
up to 1.6 times greater persona-driven variation
|
| The CART-based synthetic crash-record generators failed all conditional distributional validity tests. Ai Safety And Ethics | negative | Conditional distributional validity of synthetic crash records |
Reading fidelity
high
Study strength
high
|
n=110001
p < 0.001
|
| The Gaussian-copula synthetic crash generator passed marginal checks but showed borderline conditional stress. Ai Safety And Ethics | mixed | Marginal and conditional distributional validity of Gaussian-copula synthetic crash records |
Reading fidelity
high
Study strength
medium
|
n=110001
conditional stress p = 0.105
|
| General AI attitudes vary heterogeneously across demographic groups in the Pew American Trends Panel Wave 152. Ai Safety And Ethics | mixed | Self-reported general attitudes toward AI across demographic strata |
Reading fidelity
high
Study strength
medium
|
n=4538
posterior |β̂k| range: 0.002 to 0.860
|
| A continuous Sociotechnical Risk Index provides a more defensible governance signal than categorical approval tiers under weight uncertainty. Governance And Regulation | positive | Robustness and defensibility of governance risk assessment |
Reading fidelity
high
Study strength
medium
|
75% assignment flip rate under weight perturbation
|
| The integrated Distributional Sociotechnical Audit demonstrates that auditing model outputs, synthetic data products, and public attitudes together is feasible and necessary for transport GenAI governance. Governance And Regulation | positive | Feasibility and governance relevance of integrated distributional auditing |
Reading fidelity
high
Study strength
medium
|
not reported
|