{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6294866ee57ba43aa908176c637a4d104d1afcd54631a9a6019e67d46474f52b","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:59:49.564233Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:07:34.112333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:09:47.204727Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2506.15522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15522","snapshot_observed_at":"2026-07-04T11:09:47.204727Z","title":"Linxin Song, Taiwei Shi, and Jieyu Zhao","venue":null,"work_id":"e0397d77-6e77-41fd-b0b3-34d740ca8b71","year":null},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2506.15522","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:c76485ca9503dcab4d668b4138ff49ca17f6b06ce6cb3507364da27ed61e8f07","observation_id":"49264500-90d5-4536-82ab-ac3512717904","resolution":{"observed_at":"2026-05-18T14:26:28.297833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2506.15522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15522","snapshot_observed_at":"2026-07-04T11:09:47.204727Z","title":"Linxin Song, Taiwei Shi, and Jieyu Zhao","venue":null,"work_id":"e0397d77-6e77-41fd-b0b3-34d740ca8b71","year":null},"citing_paper":{"arxiv_id":"2606.23915","last_updated":"2026-06-22T20:25:36Z","snapshot_observed_at":"2026-08-05T22:11:08.423779Z","submitted_at":"2026-06-22T20:25:36Z","title":"Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T08:07:34.112333Z"},"links":{"cited_paper":"/paper/2506.15522","citing_paper":"/paper/2606.23915"},"observation_digest":"sha256:69f45d26735e535f705f373262c9caf7681404a046bf35f9ce7453c8bf538058","observation_id":"dc08d080-03c2-41cf-88a2-737c511970a8","resolution":{"observed_at":"2026-07-04T11:09:47.206413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15522/citation-record","integrity":"/paper/2506.15522/integrity","json":"/paper/2506.15522/citation-record.json","paper":"/paper/2506.15522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:59:50.449062Z","title":"I apologize, but I couldn't find an answer to your question in the search results","venue":null,"work_id":"d917b81b-2a1f-4adc-93ab-7df35f1e6638","year":1976},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.564233Z"},"links":{"citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:7d58e62cc5be379dc7bfbcd1328317f64b9b4ebec6f8fea90c10755face8c96d","observation_id":"35225b90-78d7-4752-be6b-ec1e6cd2e9f6","resolution":{"observed_at":"2026-08-06T23:59:50.547041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:59:48.123573Z","title":"arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.123573Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:c5b5ff4b6085cc882ac9bc4b260f2e123a9bdf0482fa0e2691498ab60e155847","observation_id":"0230525b-aa15-4555-b9e9-234d6bde6b96","resolution":{"observed_at":"2026-08-06T23:59:48.123573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04315","last_updated":"2024-08-30T18:24:27Z","snapshot_observed_at":"2026-07-06T17:26:27.288834Z","submitted_at":"2024-02-06T19:00:40Z","title":"Training Language Models to Generate Text with Citations via Fine-grained Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04315","snapshot_observed_at":"2026-08-06T23:59:48.358493Z","title":"arXiv:2402.04315","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.358493Z"},"links":{"cited_paper":"/paper/2402.04315","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:675298c44fd63b52d1ce95a2e6d9e3dc64a93356479ac682de48d75d5af4b23c","observation_id":"45617367-ef31-4fb2-9d91-6a7148d34bca","resolution":{"observed_at":"2026-08-06T23:59:48.358493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12881","last_updated":"2024-12-17T13:05:36Z","snapshot_observed_at":"2026-07-06T20:08:34.216137Z","submitted_at":"2024-12-17T13:05:36Z","title":"RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12881","snapshot_observed_at":"2026-08-06T23:59:48.438690Z","title":"arXiv:2412.12881","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.438690Z"},"links":{"cited_paper":"/paper/2412.12881","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:4a2aa9901b3d70a134a0b96d143e603e13bb031515dcc4eaf342f5c9961b4e4c","observation_id":"3daa139d-305f-433a-ab13-407f4c4408fc","resolution":{"observed_at":"2026-08-06T23:59:48.438690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T23:59:48.887449Z","title":"arXiv:2305.18290","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.887449Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:d1ffb31fbf98df2fe0c37a904f9d0af45bd091dd526c467feb645fa29bdce6fb","observation_id":"300387b0-b5d7-485e-a35a-6b66106dc482","resolution":{"observed_at":"2026-08-06T23:59:48.887449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17104","last_updated":"2024-07-04T08:07:58Z","snapshot_observed_at":"2026-07-06T17:50:31.162054Z","submitted_at":"2024-03-25T18:41:47Z","title":"Attribute First, then Generate: Locally-attributable Grounded Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17104","snapshot_observed_at":"2026-08-06T23:59:48.945371Z","title":"arXiv:2403.17104","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.945371Z"},"links":{"cited_paper":"/paper/2403.17104","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:4bf0a6f24aeb8d7fc7731f60b284c8f130c3ce6ed0823c365204c06d979b487b","observation_id":"a7343cb3-fb7d-42ca-b9e2-6bbd434ee48e","resolution":{"observed_at":"2026-08-06T23:59:48.945371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T23:59:49.122177Z","title":"arXiv:2505.09388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.122177Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:c652a7bacf0ee19c9c46cd8764f3505d81a4008f7462e65aa86fa83254809fee","observation_id":"38d883f4-49ef-47d8-9173-84b1fcecba0e","resolution":{"observed_at":"2026-08-06T23:59:49.122177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01796","last_updated":"2025-05-23T04:38:57Z","snapshot_observed_at":"2026-07-06T18:39:56.856612Z","submitted_at":"2024-07-01T20:47:47Z","title":"Ground Every Sentence: Improving Retrieval-Augmented LLMs with Interleaved Reference-Claim Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01796","snapshot_observed_at":"2026-08-06T23:59:49.203531Z","title":"arXiv:2407.01796","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.203531Z"},"links":{"cited_paper":"/paper/2407.01796","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:1fe2789ea01ca7329b8c13665c112f7590632a9d74409cfc9d164b237b271bf5","observation_id":"9a973654-1c0c-499d-bdfe-82e746fde4a2","resolution":{"observed_at":"2026-08-06T23:59:49.203531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04408","last_updated":"2023-10-06T17:55:36Z","snapshot_observed_at":"2026-08-05T10:28:11.033488Z","submitted_at":"2023-10-06T17:55:36Z","title":"RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04408","snapshot_observed_at":"2026-08-06T23:59:49.286759Z","title":"arXiv:2310.04408","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.286759Z"},"links":{"cited_paper":"/paper/2310.04408","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:acc601e13a03ef1a855ee4943163ace46632883eef40848389fde04fa66201e7","observation_id":"bc6b8e4e-2b09-48c3-8f94-c45a11e00523","resolution":{"observed_at":"2026-08-06T23:59:49.286759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09533","last_updated":"2024-04-02T20:04:01Z","snapshot_observed_at":"2026-07-06T16:48:21.364659Z","submitted_at":"2023-11-16T03:22:25Z","title":"Effective Large Language Model Adaptation for Improved Grounding and Citation Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09533","snapshot_observed_at":"2026-08-06T23:59:49.340475Z","title":"arXiv:2311.09533","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.340475Z"},"links":{"cited_paper":"/paper/2311.09533","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:aba386352b9268a71bbaa39ac55f34353de1d4204444f7af1f6ce7eaae95bf37","observation_id":"18acf74a-00a1-4c3b-9ccc-2daf31e15d24","resolution":{"observed_at":"2026-08-06T23:59:49.340475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01558","last_updated":"2024-05-05T15:58:24Z","snapshot_observed_at":"2026-08-04T12:45:28.903998Z","submitted_at":"2023-10-02T18:52:35Z","title":"Making Retrieval-Augmented Language Models Robust to Irrelevant Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01558","snapshot_observed_at":"2026-08-06T23:59:49.441945Z","title":"arXiv:2310.01558","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:49.441945Z"},"links":{"cited_paper":"/paper/2310.01558","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:c80c9fd5ab644c42101c32cd4a1255775c82872b8c6033459ef2e8e698068d46","observation_id":"125741e5-9e1a-47bc-8313-69b1c8f423f7","resolution":{"observed_at":"2026-08-06T23:59:49.441945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:59:50.670901Z","title":"In Webber, B.; Cohn, T.; He, Y .; and Liu, Y ., eds.,Proceedings of the 2020 Confer- ence on Empirical Methods in Natural Language Processing (EMNLP), 6769–6781","venue":null,"work_id":"4812c39f-f6e4-430f-ab25-f1bd22953fb8","year":2020},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.580786Z"},"links":{"citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:fb7561699bed6e1ff54fb8de7853e59864f94755360511b3baea93a0aed55007","observation_id":"d956c89f-400c-4804-9a74-e5be51119b0c","resolution":{"observed_at":"2026-08-06T23:59:50.767047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-06T23:59:48.657029Z","title":"arXiv:2005.11401","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.657029Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:b759476c1e489eeea83d507f0bcbd40be81c70a3b23b2bd36523ddb188eba888","observation_id":"ee134af0-4c9d-4123-91d5-14d8f7f6ab1d","resolution":{"observed_at":"2026-08-06T23:59:48.657029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T23:59:48.756238Z","title":"arXiv:2203.02155","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.756238Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:f54a6c532a4ace0ef4402b76ca7d2acb8908473a5ff4e1ad196ab7e88483fe20","observation_id":"9c66798b-d9aa-4d47-8cd1-81052fcb18f4","resolution":{"observed_at":"2026-08-06T23:59:48.756238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-06T23:59:47.915712Z","title":"arXiv:2310.11511","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:47.915712Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:98b6505f8e9094e207d188b10095109959e57eba2e9c18f462a93893339acc18","observation_id":"96fcc4ea-7249-48d0-9135-ca1ca25c81ce","resolution":{"observed_at":"2026-08-06T23:59:47.915712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:59:48.240829Z","title":"arXiv preprint arXiv:2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:48.240829Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:12b721eb3f2f53902ff068a3848da1a520fc680d1b3a6af15380a2064633bc18","observation_id":"9fe83f6a-6464-4523-bb30-8bd7adb02a88","resolution":{"observed_at":"2026-08-06T23:59:48.240829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-07-06T20:58:19.305457Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-06T23:59:47.976127Z","title":"arXiv:2503.19470","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:47.976127Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2506.15522"},"observation_digest":"sha256:4463a19a4b3cfb0a53957a0daead4f5a92dbe5b13e5e31b505d170b9b0f218e6","observation_id":"fb49ac51-e732-439e-9968-a068c4997491","resolution":{"observed_at":"2026-08-06T23:59:47.976127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15522","last_updated":"2025-06-18T14:58:13Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:51:45.224663Z","submitted_at":"2025-06-18T14:58:13Z","title":"Lessons from Training Grounded LLMs with Verifiable Rewards"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2506.15522."}