{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MPVT2QMV6HYBKT3NDOS3XYAG56","short_pith_number":"pith:MPVT2QMV","schema_version":"1.0","canonical_sha256":"63eb3d4195f1f0154f6d1ba5bbe006efa08b41e9af55725b7dd4f3792e555e31","source":{"kind":"arxiv","id":"2504.15900","version":3},"attestation_state":"computed","paper":{"title":"SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Cheng Wen, Shuaijiang Zhao, Tingwei Guo, Wei Zou, Xiangang Li","submitted_at":"2025-04-22T13:41:26Z","abstract_excerpt":"Recent work shows that reinforcement learning(RL) can markedly sharpen the reasoning ability of large language models (LLMs) by prompting them to \"think before answering.\" Yet whether and how these gains transfer to audio-language reasoning remains largely unexplored. We extend the Group-Relative Policy Optimization (GRPO) framework from DeepSeek-R1 to a Large Audio-Language Model (LALM), and construct a 32k sample multiple-choice corpus. Using a two-stage regimen supervised fine-tuning on structured and unstructured chains-of-thought, followed by curriculum-guided GRPO, we systematically comp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.15900","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-04-22T13:41:26Z","cross_cats_sorted":[],"title_canon_sha256":"86346e4424e976e8eee4cad33cd73609704cda6787e80279aeb508c9339095f4","abstract_canon_sha256":"ee3614d4f83be638dc5c9831d404561c843d27ac1c0a0eee3f1947ad430c4366"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:55:34.824037Z","signature_b64":"AN6yntmYPIKKcjHst4ChBTGtotILC4X4WC2lBTF/EUP+gbFzi91gFWHqcPFp85Izcydx6jjgTBD8uvIn5tmiDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"63eb3d4195f1f0154f6d1ba5bbe006efa08b41e9af55725b7dd4f3792e555e31","last_reissued_at":"2026-07-05T10:55:34.823537Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:55:34.823537Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Cheng Wen, Shuaijiang Zhao, Tingwei Guo, Wei Zou, Xiangang Li","submitted_at":"2025-04-22T13:41:26Z","abstract_excerpt":"Recent work shows that reinforcement learning(RL) can markedly sharpen the reasoning ability of large language models (LLMs) by prompting them to \"think before answering.\" Yet whether and how these gains transfer to audio-language reasoning remains largely unexplored. We extend the Group-Relative Policy Optimization (GRPO) framework from DeepSeek-R1 to a Large Audio-Language Model (LALM), and construct a 32k sample multiple-choice corpus. Using a two-stage regimen supervised fine-tuning on structured and unstructured chains-of-thought, followed by curriculum-guided GRPO, we systematically comp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.15900","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.15900/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.15900","created_at":"2026-07-05T10:55:34.823593+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.15900v3","created_at":"2026-07-05T10:55:34.823593+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.15900","created_at":"2026-07-05T10:55:34.823593+00:00"},{"alias_kind":"pith_short_12","alias_value":"MPVT2QMV6HYB","created_at":"2026-07-05T10:55:34.823593+00:00"},{"alias_kind":"pith_short_16","alias_value":"MPVT2QMV6HYBKT3N","created_at":"2026-07-05T10:55:34.823593+00:00"},{"alias_kind":"pith_short_8","alias_value":"MPVT2QMV","created_at":"2026-07-05T10:55:34.823593+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.27190","citing_title":"Learning When to Think While Listening in Large Audio-Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2511.20785","citing_title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21008","citing_title":"A Survey of Audio Reasoning in Multimodal Foundation Models","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02547","citing_title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","ref_index":260,"is_internal_anchor":false},{"citing_arxiv_id":"2510.09592","citing_title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16617","citing_title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56","json":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56.json","graph_json":"https://pith.science/api/pith-number/MPVT2QMV6HYBKT3NDOS3XYAG56/graph.json","events_json":"https://pith.science/api/pith-number/MPVT2QMV6HYBKT3NDOS3XYAG56/events.json","paper":"https://pith.science/paper/MPVT2QMV"},"agent_actions":{"view_html":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56","download_json":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56.json","view_paper":"https://pith.science/paper/MPVT2QMV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.15900&json=true","fetch_graph":"https://pith.science/api/pith-number/MPVT2QMV6HYBKT3NDOS3XYAG56/graph.json","fetch_events":"https://pith.science/api/pith-number/MPVT2QMV6HYBKT3NDOS3XYAG56/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56/action/storage_attestation","attest_author":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56/action/author_attestation","sign_citation":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56/action/citation_signature","submit_replication":"https://pith.science/pith/MPVT2QMV6HYBKT3NDOS3XYAG56/action/replication_record"}},"created_at":"2026-07-05T10:55:34.823593+00:00","updated_at":"2026-07-05T10:55:34.823593+00:00"}