{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:QWUJIRD23WRVONMTSGXMTICH2O","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"e4b4740921abf455aeda7194deb2c6e3ea5c50ce98b9437a822f101ce94995d0","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-07-18T18:07:38Z","title_canon_sha256":"48980a58a4e7d53b08bea136bfefe49c8b8630cfa54cbeb8521609689e9aeb11"},"schema_version":"1.0","source":{"id":"2507.14295","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2507.14295","created_at":"2026-07-05T11:57:38Z"},{"alias_kind":"arxiv_version","alias_value":"2507.14295v2","created_at":"2026-07-05T11:57:38Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.14295","created_at":"2026-07-05T11:57:38Z"},{"alias_kind":"pith_short_12","alias_value":"QWUJIRD23WRV","created_at":"2026-07-05T11:57:38Z"},{"alias_kind":"pith_short_16","alias_value":"QWUJIRD23WRVONMT","created_at":"2026-07-05T11:57:38Z"},{"alias_kind":"pith_short_8","alias_value":"QWUJIRD2","created_at":"2026-07-05T11:57:38Z"}],"graph_snapshots":[{"event_id":"sha256:b1f19157d47008341672a138f85773bc369e9663796031bd5a5fdbfa9d92cc53","target":"graph","created_at":"2026-07-05T11:57:38Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2507.14295/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Multi-turn problem solving is critical yet challenging for Large Reasoning Models (LRMs) to reflect on their reasoning and revise from feedback. Existing Reinforcement Learning (RL) methods train large reasoning models on a single-turn paradigm with verifiable rewards. However, we observe that models trained with existing RL paradigms often lose their ability to solve problems across multiple turns and struggle to revise answers based on contextual feedback, leading to repetitive responses. We ask: can LRMs learn to reflect their answers in a multi-turn context? In this work, we find that trai","authors_text":"Avirup Sil, Chenwei Xu, Han Liu, Licheng Liu, Linjie Li, Manling Li, Yiping Lu, Zihan Wang","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-07-18T18:07:38Z","title":"A Simple \"Try Again\" Can Elicit Multi-Turn LLM Reasoning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.14295","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:caeb4c1c0980072fe5064b3ebda8ecfc14f699ab25b22cb94dbd495c90de7e0d","target":"record","created_at":"2026-07-05T11:57:38Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"e4b4740921abf455aeda7194deb2c6e3ea5c50ce98b9437a822f101ce94995d0","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-07-18T18:07:38Z","title_canon_sha256":"48980a58a4e7d53b08bea136bfefe49c8b8630cfa54cbeb8521609689e9aeb11"},"schema_version":"1.0","source":{"id":"2507.14295","kind":"arxiv","version":2}},"canonical_sha256":"85a894447adda357359391aec9a047d3889aa9eac6beb89a48d41fb4e392a3fa","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"85a894447adda357359391aec9a047d3889aa9eac6beb89a48d41fb4e392a3fa","first_computed_at":"2026-07-05T11:57:38.047577Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:57:38.047577Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"RwX7pKQ1mq9QkHt4UGnp7RIvSVDr7kwYbId8pWG3nZbgFqKdrqdiW4UdG/AUaPOK0geOHmPWwMFyqhSJKTJ+Cw==","signature_status":"signed_v1","signed_at":"2026-07-05T11:57:38.048044Z","signed_message":"canonical_sha256_bytes"},"source_id":"2507.14295","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:caeb4c1c0980072fe5064b3ebda8ecfc14f699ab25b22cb94dbd495c90de7e0d","sha256:b1f19157d47008341672a138f85773bc369e9663796031bd5a5fdbfa9d92cc53"],"state_sha256":"c337d1faf7b1f1c6b8f5034c8c6751c375e98f97a4d2e733e743a1e2d40c5193"}