{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CE3HVFIGVKI3HJ3OXU2AWREOWU","short_pith_number":"pith:CE3HVFIG","schema_version":"1.0","canonical_sha256":"11367a9506aa91b3a76ebd340b448eb5322ef14b682812c39e4d0e2a0f569b52","source":{"kind":"arxiv","id":"2501.10868","version":3},"attestation_state":"computed","paper":{"title":"JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Eric Horvitz, Harsha Nori, Hudson Cooper, Julian Berman, Micha{\\l} Moskal, Nathan Ranchin, Robert West, Saibo Geng, Samuel Jenkins","submitted_at":"2025-01-18T20:26:00Z","abstract_excerpt":"Reliably generating structured outputs has become a critical capability for modern language model (LM) applications. Constrained decoding has emerged as the dominant technology across sectors for enforcing structured outputs during generation. Despite its growing adoption, little has been done with the systematic evaluation of the behaviors and performance of constrained decoding. Constrained decoding frameworks have standardized around JSON Schema as a structured data format, with most uses guaranteeing constraint compliance given a schema. However, there is poor understanding of the effectiv"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.10868","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-18T20:26:00Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"d73da2b6a8d9e4c718dcd4699da6ca2ed0373f98598f752bbfe65599c04b2716","abstract_canon_sha256":"d7ce8073b7454e284e3edf9bf5e0b87b0163049ba5f5abe196b8b9341eb74c3f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:06.525123Z","signature_b64":"JCn2vJimvCNpwFIxKZDQgZXwHwHD5yALSWH0mjuofFsQM32dWShmq/yq9e6ITin6nFDI49+liHfKWkIeU8tqAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"11367a9506aa91b3a76ebd340b448eb5322ef14b682812c39e4d0e2a0f569b52","last_reissued_at":"2026-07-05T10:21:06.524426Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:06.524426Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Eric Horvitz, Harsha Nori, Hudson Cooper, Julian Berman, Micha{\\l} Moskal, Nathan Ranchin, Robert West, Saibo Geng, Samuel Jenkins","submitted_at":"2025-01-18T20:26:00Z","abstract_excerpt":"Reliably generating structured outputs has become a critical capability for modern language model (LM) applications. Constrained decoding has emerged as the dominant technology across sectors for enforcing structured outputs during generation. Despite its growing adoption, little has been done with the systematic evaluation of the behaviors and performance of constrained decoding. Constrained decoding frameworks have standardized around JSON Schema as a structured data format, with most uses guaranteeing constraint compliance given a schema. However, there is poor understanding of the effectiv"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.10868","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.10868/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.10868","created_at":"2026-07-05T10:21:06.524514+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.10868v3","created_at":"2026-07-05T10:21:06.524514+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.10868","created_at":"2026-07-05T10:21:06.524514+00:00"},{"alias_kind":"pith_short_12","alias_value":"CE3HVFIGVKI3","created_at":"2026-07-05T10:21:06.524514+00:00"},{"alias_kind":"pith_short_16","alias_value":"CE3HVFIGVKI3HJ3O","created_at":"2026-07-05T10:21:06.524514+00:00"},{"alias_kind":"pith_short_8","alias_value":"CE3HVFIG","created_at":"2026-07-05T10:21:06.524514+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.06757","citing_title":"LLM-powered reasoning in agent-based modeling","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2607.08268","citing_title":"Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment","ref_index":44,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21453","citing_title":"CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20072","citing_title":"Source-Grounded Data Generation for Text-to-JSON Learning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09395","citing_title":"Empirical Study for Structured Output Control in LLMs for Software Engineering","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01926","citing_title":"Mitigating Bias in Locally Constrained Decoding via Tractable Proposals","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14113","citing_title":"ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23955","citing_title":"From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31808","citing_title":"Large Databases Need Small, Open-Weight Language Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26731","citing_title":"It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16342","citing_title":"DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2602.15189","citing_title":"ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2603.15118","citing_title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2603.19500","citing_title":"Teaching an Agent to Sketch One Part at a Time","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14051","citing_title":"SPIN: Structural LLM Planning via Iterative Navigation for Industrial Tasks","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14113","citing_title":"ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2603.27905","citing_title":"ATLAS-RTC: Closing the Loop on LLM Agent Output with Token-Level Runtime Control","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08737","citing_title":"The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06068","citing_title":"VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00060","citing_title":"TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20811","citing_title":"Diagnosing CFG Interpretation in LLMs","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02363","citing_title":"When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25359","citing_title":"The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU","json":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU.json","graph_json":"https://pith.science/api/pith-number/CE3HVFIGVKI3HJ3OXU2AWREOWU/graph.json","events_json":"https://pith.science/api/pith-number/CE3HVFIGVKI3HJ3OXU2AWREOWU/events.json","paper":"https://pith.science/paper/CE3HVFIG"},"agent_actions":{"view_html":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU","download_json":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU.json","view_paper":"https://pith.science/paper/CE3HVFIG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.10868&json=true","fetch_graph":"https://pith.science/api/pith-number/CE3HVFIGVKI3HJ3OXU2AWREOWU/graph.json","fetch_events":"https://pith.science/api/pith-number/CE3HVFIGVKI3HJ3OXU2AWREOWU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU/action/storage_attestation","attest_author":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU/action/author_attestation","sign_citation":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU/action/citation_signature","submit_replication":"https://pith.science/pith/CE3HVFIGVKI3HJ3OXU2AWREOWU/action/replication_record"}},"created_at":"2026-07-05T10:21:06.524514+00:00","updated_at":"2026-07-05T10:21:06.524514+00:00"}