{"as_of":"2026-08-08T13:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:639cd60943a14e533c6c80059df1bf78736d2bffdd039ec4ef8d28172c8b73b5","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:44:36.534742Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:52:50.299350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:57:16.598004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-06T10:52:50.299350Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23407","last_updated":"2025-07-31T10:27:48Z","snapshot_observed_at":"2026-08-07T22:55:04.116795Z","submitted_at":"2025-07-31T10:27:48Z","title":"Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:52:50.299350Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2507.23407"},"observation_digest":"sha256:f1fbf84c431c77a003f56a8f75760a13feee3adfa58a31596a2a2cd2457cdad2","observation_id":"f96d3bbd-0892-49ad-9c12-ce012dde8f0d","resolution":{"observed_at":"2026-08-06T10:52:50.299350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-05T10:39:03.113610Z","title":"The Hallucination Tax of Reinforcement Finetuning.arXiv preprint arXiv:2505.13988, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:03.113610Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:ff53d26ef65bebdae9f2024d9e7610586b8e1e8c08abb2cc0dfab3220f0eefe6","observation_id":"d1ed60c3-31ad-4d33-8b55-7c3267e55276","resolution":{"observed_at":"2026-08-05T10:39:03.113610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2601.21257","last_updated":"2026-04-19T21:04:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T04:36:52Z","title":"MoCo: A One-Stop Shop for Model Collaboration Research","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:17:37.129753Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2601.21257"},"observation_digest":"sha256:31affad6bb738f750308265cc7e7561c7bcb32a7a448b13557b8fa803b055bb9","observation_id":"1d18fcaa-1364-4c4f-9724-4d6f3d7debac","resolution":{"observed_at":"2026-05-16T10:17:43.795988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:db866793ebb77a144dacd3f7fc822171cca5232a0cfc4862a4d444d51cd49440","observation_id":"7a4542a9-ef81-404b-97c1-25a1b7813634","resolution":{"observed_at":"2026-05-12T10:21:29.704183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:f51d7213e0716653f34d4758f6719049fca8a9078cf7b002ec52f9d9f32cedab","observation_id":"92e46cd5-8b6e-4d71-83a9-2633117e1cc6","resolution":{"observed_at":"2026-05-11T22:11:16.560735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:b54268d835a0c3b4e72ca6f135eabc8586743d0838f45b27201911824b3a2be6","observation_id":"1686a16f-1bbe-407e-b0bd-10c6fe6c2dc3","resolution":{"observed_at":"2026-05-19T17:02:40.737194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2605.28070","last_updated":"2026-05-27T07:28:25Z","snapshot_observed_at":"2026-08-03T11:47:22.689668Z","submitted_at":"2026-05-27T07:28:25Z","title":"Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T12:37:16.138816Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2605.28070"},"observation_digest":"sha256:777273474876003ef1d321254af9b9fdad464c8bf2474b09cd944b8a89a20d8b","observation_id":"d9620be2-8cc6-45fd-88ce-ff858571b6e4","resolution":{"observed_at":"2026-06-29T12:43:25.821929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":"2505.13988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-07-02T18:57:16.598004Z","title":"The hallucination tax of rein- forcement finetuning.arXiv preprint arXiv:2505.13988","venue":null,"work_id":"e6b7012f-8186-40df-94d5-79a25e7b19c8","year":2025},"citing_paper":{"arxiv_id":"2606.07812","last_updated":"2026-06-05T19:39:35Z","snapshot_observed_at":"2026-08-03T03:54:05.305322Z","submitted_at":"2026-06-05T19:39:35Z","title":"Scaling Participation in Modular AI Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:27.042616Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2606.07812"},"observation_digest":"sha256:693ab4dcc541fa3969e8333d383c17e30227bcd6cc81907cb82af1d8398a432b","observation_id":"74983e86-3310-4efc-aab7-7357ede6e45f","resolution":{"observed_at":"2026-07-02T18:57:16.599301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13988","snapshot_observed_at":"2026-08-01T17:30:40.711089Z","title":"The hallucination tax of reinforcement finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17621","last_updated":"2026-07-20T07:17:50Z","snapshot_observed_at":"2026-08-07T22:58:38.461590Z","submitted_at":"2026-07-20T07:17:50Z","title":"Mechanistic Attention Guidance for Agent Memory Refinement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:30:40.711089Z"},"links":{"cited_paper":"/paper/2505.13988","citing_paper":"/paper/2607.17621"},"observation_digest":"sha256:4c3083b785688ebf09216c89bb5da9377140331d150317e112f1eb06fc98af09","observation_id":"a0a77b3d-b3f9-4a9d-8d75-9ebe41e5c81a","resolution":{"observed_at":"2026-08-01T17:30:40.711089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13988/citation-record","integrity":"/paper/2505.13988/integrity","json":"/paper/2505.13988/citation-record.json","paper":"/paper/2505.13988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:29.905006Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:29.905006Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:def7828936c3b6c31268d95d410306c8994a0f79665f2f56d18d9f30a0807a45","observation_id":"ee8a17e6-6a68-4f1f-a790-a77f4d267511","resolution":{"observed_at":"2026-08-07T15:44:29.905006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:30.081158Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.081158Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:b94f1913c37e217bed9ab32a8dd2ff104abc99f6d06fb55ab9d26d12c479874e","observation_id":"1bd65997-4777-4fe7-9e09-495e03bcfbc3","resolution":{"observed_at":"2026-08-07T15:44:30.081158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T15:44:30.194934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.194934Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:54831c1a0e81e93be68d104b6ec5c04b586af3a63f74cbf3fcf90d61fbb0c934","observation_id":"995a819f-5fbc-4bb5-90c7-4cf4c8a0ac33","resolution":{"observed_at":"2026-08-07T15:44:30.194934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17550","last_updated":"2025-04-24T13:40:27Z","snapshot_observed_at":"2026-08-07T15:59:30.613297Z","submitted_at":"2025-04-24T13:40:27Z","title":"HalluLens: LLM Hallucination Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17550","snapshot_observed_at":"2026-08-07T15:44:30.304843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.304843Z"},"links":{"cited_paper":"/paper/2504.17550","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:aa1872c82c5b9ea430fd1cfc1a487d5a2faec90d2cdfe36fa86d49ba30a90e38","observation_id":"6c6d2e74-fa0b-4a8b-bb16-c419cb0eefa0","resolution":{"observed_at":"2026-08-07T15:44:30.304843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:30.416483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.416483Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:d6a35b9fea086b375677167f2df11444426562fa159247c36c482f75fa6ed6ff","observation_id":"24326b6b-640a-4b9a-abe6-962ebb645b7e","resolution":{"observed_at":"2026-08-07T15:44:30.416483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03631","last_updated":"2024-10-16T19:35:55Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:28:03Z","title":"Mitigating Open-Vocabulary Caption Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03631","snapshot_observed_at":"2026-08-07T15:44:30.575619Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.575619Z"},"links":{"cited_paper":"/paper/2312.03631","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:82c89633f122e6538afd15751f25ded202bfc45a0bf0448fef08e2897a3cc370","observation_id":"5c1703b3-86d1-46ea-9da9-93516346b420","resolution":{"observed_at":"2026-08-07T15:44:30.575619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03368","last_updated":"2023-10-25T07:49:37Z","snapshot_observed_at":"2026-08-07T22:54:09.747099Z","submitted_at":"2023-10-05T07:57:09Z","title":"Evaluating Hallucinations in Chinese Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03368","snapshot_observed_at":"2026-08-07T15:44:30.675099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.675099Z"},"links":{"cited_paper":"/paper/2310.03368","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:bbaf049c37b39824b2e506ed19c36c215ba69b6c8e551dc3b38e5253dd54cc03","observation_id":"e0c669cd-5eb0-4592-82c1-95bfa02b08bf","resolution":{"observed_at":"2026-08-07T15:44:30.675099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:44:30.756069Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.756069Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:5419831d0e4282a8a0c3a9dc3782099d667bbe0525d3c5ce112923b9c82b42df","observation_id":"41939ca4-a260-4759-91f5-d40a2cfe6b20","resolution":{"observed_at":"2026-08-07T15:44:30.756069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:44:30.864841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.864841Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:c4fd19033bb84928aec7b0434c076c80b56f4962cdf2b5b6dcb9eaec8622ce3f","observation_id":"3a56fac1-4f09-493f-ad1f-d88b1ad02e51","resolution":{"observed_at":"2026-08-07T15:44:30.864841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05904","last_updated":"2024-10-01T12:08:23Z","snapshot_observed_at":"2026-08-06T03:54:33.263934Z","submitted_at":"2024-05-09T17:00:22Z","title":"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05904","snapshot_observed_at":"2026-08-07T15:44:30.995190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.995190Z"},"links":{"cited_paper":"/paper/2405.05904","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:5c0254325404b76a6039a7feb49592477efcb84df9f9bef95ae08a65f9acacc0","observation_id":"71483c38-9e7a-49ef-8260-ff5294e1f711","resolution":{"observed_at":"2026-08-07T15:44:30.995190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:44:31.106531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.106531Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e24f0d90de6191329b84ecbaf4072311643c03d1137c42fe310e8cdd4cdad264","observation_id":"854c0351-2a20-4b30-92cb-d939b26418a0","resolution":{"observed_at":"2026-08-07T15:44:31.106531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:44:31.222493Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.222493Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6a52efc36704b45d018c194bbb459cba71fad32c156e29523115d3672cc6ae82","observation_id":"ce49eb88-0866-4122-8767-c1fdbd6c4c21","resolution":{"observed_at":"2026-08-07T15:44:31.222493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:44:31.355068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.355068Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:f6f8bd71c45445aa29696da002b7689016f574a45824cc78b75d3350d35a4140","observation_id":"819102f4-c5fd-4cb0-b98d-60b315192ed4","resolution":{"observed_at":"2026-08-07T15:44:31.355068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:31.447643Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.447643Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:02d07a4c253ccfe9ccb3938e52f690b2fc6afbdbb28909ff9ea6d74d47842e61","observation_id":"f5f2b607-eb5a-428d-ac1d-fb36a23b78d3","resolution":{"observed_at":"2026-08-07T15:44:31.447643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T15:44:31.518305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.518305Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:58a49a7f6272f8eff0845d99859deb84d18dc84875dfefc393abd7aafac5f52b","observation_id":"8f7481b6-dca4-4af9-aaed-449f5323eaa3","resolution":{"observed_at":"2026-08-07T15:44:31.518305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T15:44:31.690376Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.690376Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:3ef99c43e61dd8aa79fcf1dd8e34aa2beab69c163246cb7e406ce3d1c28faeb2","observation_id":"84052823-48f1-4594-8298-fe0688dfcfe8","resolution":{"observed_at":"2026-08-07T15:44:31.690376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:43.294887Z","title":null,"venue":null,"work_id":"1bb96512-c5d9-4144-86b8-8aaa2a8de171","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:31.804578Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:2bd63af7764ee2d551093dc7c9f4e08582d3bfa66d7a15726a51057611f67a36","observation_id":"2b37d6ff-c0f1-4c99-a109-81665178032f","resolution":{"observed_at":"2026-08-07T15:44:43.373694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T15:44:32.005515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.005515Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:57b441dfa13e78ec6ad17d9b2e89f3d856d7012c5f6d6a1e4716cd35b8c738b2","observation_id":"25972b8f-464b-49e8-94e8-f8f5994bcaff","resolution":{"observed_at":"2026-08-07T15:44:32.005515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.124833Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.124833Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:33ef8c1ac878e47597c72256d364431d06cd53cd405657d2c7d7a715d01df862","observation_id":"5f1ffac1-a515-450a-8696-fd8c930e9a5e","resolution":{"observed_at":"2026-08-07T15:44:32.124833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03205","last_updated":"2024-01-06T12:40:45Z","snapshot_observed_at":"2026-07-06T17:12:18.575364Z","submitted_at":"2024-01-06T12:40:45Z","title":"The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03205","snapshot_observed_at":"2026-08-07T15:44:32.201925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.201925Z"},"links":{"cited_paper":"/paper/2401.03205","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:74b950adfc4d2153d64e28822b23f4ff662209df2127a42c85582d45b8a7c9ce","observation_id":"911ec246-e3ca-4ef7-a54b-253350311b84","resolution":{"observed_at":"2026-08-07T15:44:32.201925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06169","last_updated":"2025-03-17T08:11:52Z","snapshot_observed_at":"2026-08-07T17:20:22.475011Z","submitted_at":"2025-03-08T11:13:05Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","version":2},"cited_work":{"arxiv_id":"2503.06169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06169","snapshot_observed_at":"2026-08-07T15:44:37.625329Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","venue":"cs.CV","work_id":"97a07a55-32ae-4206-8bef-2f85d2e2fa47","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.260799Z"},"links":{"cited_paper":"/paper/2503.06169","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:c0a1887bc823ebd6219be097bab9ad43e96f1639fbf31bdf7f14541d0db06abd","observation_id":"27b411fc-cbc0-4d0d-9643-2eeee438d1af","resolution":{"observed_at":"2026-08-07T15:44:37.888022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-07T18:12:08.883357Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T15:44:32.385679Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.385679Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:1211678bebb8bc286b7e5ddc734a93ad28dd4a072bd607e8b698cd6575207dfe","observation_id":"9418ddc7-8284-4590-81cc-d8bc205438cb","resolution":{"observed_at":"2026-08-07T15:44:32.385679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T15:44:32.534874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.534874Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:77ba96a6619a4ef46f8e71aa8c0add836d1222e14c05d3b2f7451b97185da166","observation_id":"bc76dd61-de76-4e95-b56a-b6224cd025a2","resolution":{"observed_at":"2026-08-07T15:44:32.534874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.681966Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.681966Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:897fd465326d548e270d93a86969235c6f5a6be712fea2be115fac3aff4abdc6","observation_id":"711946dc-cdd6-42db-a1c6-d3ed63c0ed2f","resolution":{"observed_at":"2026-08-07T15:44:32.681966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.895833Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"86873302-46d3-4d09-a732-d1fcffe2b38b","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.794896Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6e1d579e9663d56f5e3a542c4cdb243001f1db5088e01a5882c3dc488b02fefd","observation_id":"152c4b32-31b7-4b31-b8a7-ce1516fce7a9","resolution":{"observed_at":"2026-08-07T15:44:43.042890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:32.954751Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.954751Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6277c68bb77c1d7e4f80371428dcfbb1db11af1d997e58676d1d4f6d6f5dd1d6","observation_id":"655dcc39-5a30-44d3-ab7d-6c4fd97b7cc5","resolution":{"observed_at":"2026-08-07T15:44:32.954751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.521336Z","title":null,"venue":null,"work_id":"82ab48fe-c9b2-4786-a690-0d3761184758","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.126414Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:e5a900fbcc42c60e0d79f7b759c00d459c08a04ac19e7b8e0b6e2d820f4ed907","observation_id":"10c551ec-e18d-4b78-987f-de8e7b0ceff8","resolution":{"observed_at":"2026-08-07T15:44:42.634345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:42.244742Z","title":null,"venue":null,"work_id":"8a8ee3a8-9a81-4b32-9375-b7ecd7a338c9","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.324958Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:2b59af390eb522110c282639de8affa7018e9116124d478e99e612c9da041798","observation_id":"2ee8666a-b3cf-42e7-b1d0-e4cff21c07ea","resolution":{"observed_at":"2026-08-07T15:44:42.366454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:33.545500Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.545500Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:416cdc7a6a20ddfa1935bdeba517cb2c9f83baa5d5cfbd3d1e73937c650dbdf3","observation_id":"e825bd42-c4fd-4479-9e05-a2f9c9a63638","resolution":{"observed_at":"2026-08-07T15:44:33.545500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.825308Z","title":null,"venue":null,"work_id":"302536cf-92d7-44b9-b9f0-e445417de093","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.628322Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:38e5a3f4e9c12c29e3eecea785b60936332251de589e5267a2621b30a1d54a0e","observation_id":"4e638485-7ee6-4076-8934-97bbd59cd17a","resolution":{"observed_at":"2026-08-07T15:44:41.964745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:44:33.782472Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.782472Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:db98b82a50dc94075d5567ba85005c23159c0c3080f24daba35bd7929e2d5bb5","observation_id":"be302502-a318-4dc2-87ee-44644080a929","resolution":{"observed_at":"2026-08-07T15:44:33.782472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:44:33.894983Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:33.894983Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:ae5908f3e39e86bd1a2755aec3fc802d37c4a10a9d2b766e945b31d9bc781d33","observation_id":"7c226e53-6050-4b90-b6c2-edf442f7a5d1","resolution":{"observed_at":"2026-08-07T15:44:33.894983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:34.007922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.007922Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:d8814268b35b358cb926b2ce77d836b82cca5c3b0c76d2131380081b368394fc","observation_id":"16abeb0e-4769-4dee-bee0-62ab852816d5","resolution":{"observed_at":"2026-08-07T15:44:34.007922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-07T15:44:34.170709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.170709Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:4cdcca222db07b123dcddd5d19f5e86054a5d8c22d34454d398a2afecfc151f4","observation_id":"b6932d08-7faf-4c4a-9d61-9ad113926933","resolution":{"observed_at":"2026-08-07T15:44:34.170709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:34.272336Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.272336Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:b5bde167d3ee132abb72268c70733b64aaae94d50b36210f4c67e4b8d0d7bb5a","observation_id":"d8527608-d5de-4952-b276-8553a0ab47df","resolution":{"observed_at":"2026-08-07T15:44:34.272336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.474022Z","title":null,"venue":null,"work_id":"9fab5b26-4ac8-4c16-b763-86e768d9d14b","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.448645Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:9c9622a006ebc1ce59bbd652859600b168f26d241bf2865b54200e99589e135f","observation_id":"ed215d06-63d0-4e1a-96ed-001d416d4174","resolution":{"observed_at":"2026-08-07T15:44:41.595034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T15:44:34.610778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.610778Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:5743e463de881888bf0d229da54fc4e86c40b13e791f22c43fe4710d9cee9038","observation_id":"1e62e25e-fcd5-4aa5-9bbe-597e3bacba13","resolution":{"observed_at":"2026-08-07T15:44:34.610778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:41.144744Z","title":null,"venue":null,"work_id":"b3d5b738-2e81-4698-8714-863e00e4ceaa","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.775008Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:4efb6f93fb3208b86b1a5e265cc63eaa06076bc91e5e23cc3b54ae566466f9aa","observation_id":"1e57963e-b949-4603-86b2-f160291ca989","resolution":{"observed_at":"2026-08-07T15:44:41.284869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01313","last_updated":"2024-01-08T16:19:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T17:56:30Z","title":"A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01313","snapshot_observed_at":"2026-08-07T15:44:34.912984Z","title":"M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Anku Rani, Vipula Rawte, Aman Chadha, and Amitava Das","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:34.912984Z"},"links":{"cited_paper":"/paper/2401.01313","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:0d81de7b048a5dea030a387801429f5a765a8d0bcaee9c30865ef6989893b0d9","observation_id":"fdd7360a-d90f-4de7-905a-48d9044a6cfb","resolution":{"observed_at":"2026-08-07T15:44:34.912984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T15:44:35.037495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.037495Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:4d1cfd2a7aa8061823786f125bd731bf51208ee25900aeed870ce9f2989830da","observation_id":"1e86e968-b904-4aa8-af69-2222fd6b1be5","resolution":{"observed_at":"2026-08-07T15:44:35.037495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15777","last_updated":"2025-04-22T10:38:00Z","snapshot_observed_at":"2026-08-07T16:00:16.874744Z","submitted_at":"2025-04-22T10:38:00Z","title":"Tina: Tiny Reasoning Models via LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15777","snapshot_observed_at":"2026-08-07T15:44:35.167445Z","title":"O mer Faruk Akg \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.167445Z"},"links":{"cited_paper":"/paper/2504.15777","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:ed753f1de0feb29397736210e25327609ba7965ed8afac92cde05dccaf95e89b","observation_id":"9e7e68fb-7fad-46bd-a097-8001bb4f84c5","resolution":{"observed_at":"2026-08-07T15:44:35.167445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T15:44:35.310902Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.310902Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:a4247c07512392d79085d635bc917cf6eba563c7ddc09ba0c49cfb809625cb1a","observation_id":"ec9d1ffe-a12c-470d-9379-96f40be417bc","resolution":{"observed_at":"2026-08-07T15:44:35.310902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03958","last_updated":"2024-02-15T01:03:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-07T23:48:36Z","title":"Simple synthetic data reduces sycophancy in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03958","snapshot_observed_at":"2026-08-07T15:44:35.430765Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.430765Z"},"links":{"cited_paper":"/paper/2308.03958","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:9d3a45e81b388d650fb8f823a2f6b59397659d5fb01a11b3e87513cc39a4e95d","observation_id":"176734b8-7600-48fd-a725-72d93dc4c722","resolution":{"observed_at":"2026-08-07T15:44:35.430765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.872639Z","title":null,"venue":null,"work_id":"e7184901-b25f-447c-947d-76a15bb255de","year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.515063Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:7672969911c081e8f1f02f65eccbff44f9e34aee78d8bc7ddef55e95f8564b7c","observation_id":"9aebf6e4-c24a-47e1-9f0a-9503c9f6beb1","resolution":{"observed_at":"2026-08-07T15:44:40.994636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T15:44:35.621729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.621729Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:6a0de58fbba90a150b25f69fef421acee398c6ceaa09ff02bae02190f56e44a2","observation_id":"007b1964-85c9-4886-b1c9-f9788c4ad213","resolution":{"observed_at":"2026-08-07T15:44:35.621729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.509514Z","title":null,"venue":null,"work_id":"8ba77bcf-b599-4b84-b885-a6f548b763cd","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.719317Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:26e1d7b27f7192bb966c9d41e628407c7112a2943541d07005370dc62d654aa3","observation_id":"7be9aab1-c81d-42c3-9abd-b00308dcd272","resolution":{"observed_at":"2026-08-07T15:44:40.628475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18153","last_updated":"2023-05-30T15:14:06Z","snapshot_observed_at":"2026-08-04T22:37:22.983682Z","submitted_at":"2023-05-29T15:30:13Z","title":"Do Large Language Models Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18153","snapshot_observed_at":"2026-08-07T15:44:35.850344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.850344Z"},"links":{"cited_paper":"/paper/2305.18153","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:f926838a42066354a82807833d1953bf1490c9ac169026cb13332934cdea5a13","observation_id":"16848e90-3df9-41b2-bccf-5254ad9f571f","resolution":{"observed_at":"2026-08-07T15:44:35.850344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:44:35.961914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.961914Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:18c5f32b973cb0923cf03b7efd7f27c878488a5e37adb95e1e217b58d11394fd","observation_id":"b778e018-1636-4f23-891f-dbaaaa36b509","resolution":{"observed_at":"2026-08-07T15:44:35.961914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:44:40.325570Z","title":null,"venue":null,"work_id":"cc0d4ca7-5652-47fa-899f-d5cf514a6bca","year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.094973Z"},"links":{"citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:bc157ed05445c0883083788c402b32be176a49bd233dc67bb65c08fa7232e217","observation_id":"9a8df657-c924-449c-b6ab-22dd12a69bd1","resolution":{"observed_at":"2026-08-07T15:44:40.383837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13534","last_updated":"2023-05-22T23:14:28Z","snapshot_observed_at":"2026-08-07T11:11:55.921516Z","submitted_at":"2023-05-22T23:14:28Z","title":"How Language Model Hallucinations Can Snowball","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13534","snapshot_observed_at":"2026-08-07T15:44:36.213918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.213918Z"},"links":{"cited_paper":"/paper/2305.13534","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:87e1125a6046a591154fda08e4f48b7478d6cbc07a5b5f255a7e1a384ff7f952","observation_id":"9268f459-e4da-4b2a-901c-79f32205026e","resolution":{"observed_at":"2026-08-07T15:44:36.213918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T15:44:36.354899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.354899Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:3cdc52e0e6665c11f881cca4701004672971665c9468ea6e08e769dc54627217","observation_id":"f32edaa0-bd51-4cb7-81a7-533956c446c1","resolution":{"observed_at":"2026-08-07T15:44:36.354899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T15:44:36.534742Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.534742Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:158d2b843fa6fecf8e4b5b18bad664719d947e60f9c940c55fab6bd0629d0389","observation_id":"13000c1c-0526-4a67-bb6d-f74ffe031b72","resolution":{"observed_at":"2026-08-07T15:44:36.534742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:01:49.125904Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 9 inbound Pith citation observations for arXiv:2505.13988."}