{"as_of":"2026-08-09T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89fc1b56e57d4cab1024e30800b425a21fccbb0cadcf0091654cb0aa395451ff","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:37:30.520795Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21560/citation-record","integrity":"/paper/2506.21560/integrity","json":"/paper/2506.21560/citation-record.json","paper":"/paper/2506.21560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:29.512978Z","title":"arXiv preprint arXiv:2412.15287 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.512978Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:528328c95bfbccc4b67cefc58e2c9d0c4cc74f363f83a6ec624ca6222dfe5ef5","observation_id":"67b22cb6-de3c-4a24-b323-b1a84269d16e","resolution":{"observed_at":"2026-08-07T04:37:29.512978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-06T11:34:00.528900Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T04:37:29.746418Z","title":"arXiv preprint arXiv:2404.03683 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.746418Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:75d7b9614c5dedb94b1cb8543a986e5ddd8f67be2a06ca865fb697bb094cdd80","observation_id":"b4301b55-41a7-4964-a3b9-40574ff41443","resolution":{"observed_at":"2026-08-07T04:37:29.746418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T04:37:29.805270Z","title":"arXiv preprint arXiv:2410.02089 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.805270Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:16431a3a8b859fad269227fdee9d81780e8bc5216f0a2c86f794b1905bdf9af5","observation_id":"3b9a162a-60ac-446a-8ddc-30c8f0d508da","resolution":{"observed_at":"2026-08-07T04:37:29.805270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T04:37:29.960575Z","title":"5-coder technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.960575Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:a40ea8e87cedbec0e3c5905290ae3db8c720eb243287c92901c0500f3d1cc351","observation_id":"46b454a4-95ff-474f-bee4-d78c48d97283","resolution":{"observed_at":"2026-08-07T04:37:29.960575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:37:30.042682Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.042682Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:8223e3fd9e08a6cb48f6a92523d8641c1ca1349155104bd3a67225154f8fbfda","observation_id":"59233e2a-8955-4a6b-a21e-f05e28ca516c","resolution":{"observed_at":"2026-08-07T04:37:30.042682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T04:37:30.178554Z","title":"arXiv preprint arXiv:2303.17651 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.178554Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:194459104b1e1d29d2d138402982f150a776eac62bf6f906f8a1e31179368b74","observation_id":"9e941f99-4fb5-4202-af35-0900f6a5caa0","resolution":{"observed_at":"2026-08-07T04:37:30.178554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T04:37:30.234365Z","title":"arXiv preprint arXiv:1908.10084 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.234365Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:51dfb3cdb21214dac41a2f63f91a3fa6961be17404847974f10a64387dfa016c","observation_id":"259ad9ec-5d56-40a1-b865-db09449d6c89","resolution":{"observed_at":"2026-08-07T04:37:30.234365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T04:37:30.328965Z","title":"Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.328965Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:1bb990531d973be8169eb59078c50eb68fe5ad737bdbe67d92b1dda77f480af4","observation_id":"1ac134b5-0f06-4d92-bcf6-248a6fe79e99","resolution":{"observed_at":"2026-08-07T04:37:30.328965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:30.928944Z","title":"Advances in Neural Information Processing Systems 36 (2023), 68539–68551","venue":null,"work_id":"ff00a0f8-0fdc-4f3b-aee1-40a8cbb6205c","year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.416102Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:3aa94a6845dd1f40ab879277e9d8d9ab1af89e9c091667a4a4ccc571abc312e1","observation_id":"a2596d1b-9eaa-4455-a10c-3bd2053ee55f","resolution":{"observed_at":"2026-08-07T04:37:30.992778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00238","last_updated":"2023-09-01T04:08:45Z","snapshot_observed_at":"2026-08-07T23:02:41.899815Z","submitted_at":"2023-09-01T04:08:45Z","title":"ALJP: An Arabic Legal Judgment Prediction in Personal Status Cases Using Machine Learning Models","version":1},"cited_work":{"arxiv_id":"2309.00238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00238","snapshot_observed_at":"2026-08-07T04:37:30.611863Z","title":"ALJP: An Arabic Legal Judgment Prediction in Personal Status Cases Using Machine Learning Models","venue":"cs.AI","work_id":"f81ebd5f-21db-4762-86bb-d1a785df58e7","year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.462054Z"},"links":{"cited_paper":"/paper/2309.00238","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:410ae1430325cc0862b97640ba941b7c3b9c20c00fa4d0e65a5d6ac60d818aae","observation_id":"640b320e-fa86-4451-90c8-29f6488264bd","resolution":{"observed_at":"2026-08-07T04:37:30.687681Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T04:37:30.520795Z","title":"arXiv preprint arXiv:2205.10625 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.520795Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:e8697a7ba7152f540eacc50c1eeea48961a7c641e1568c1a5b60000427eaad79","observation_id":"366625d7-fecf-4096-be1e-d31814a019e7","resolution":{"observed_at":"2026-08-07T04:37:30.520795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:31.034189Z","title":"In Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers)","venue":null,"work_id":"5f50e50d-1388-45b0-b17e-0a79590c539d","year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.669550Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:2dfa7f23025f6480caab3856912616671272ef4b446c4e48d97969d80b32b19e","observation_id":"02b4070b-e6d0-4dc9-9a42-fcc2995941ff","resolution":{"observed_at":"2026-08-07T04:37:31.172059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T04:37:29.907111Z","title":"arXiv preprint arXiv:2006.03654 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.907111Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:86e57b2614dccc415d06adf6abd0d68d71283f2a63ab01922481a2838201fe09","observation_id":"5a2ca701-2b9b-4b81-b3e4-abec734aa4bc","resolution":{"observed_at":"2026-08-07T04:37:29.907111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T04:37:29.608840Z","title":"arXiv preprint arXiv:2310.01377 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.608840Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:a9247cf4b309373dfa6bac4b812f8198862eb488542a32695369462ca94b7274","observation_id":"787ecde3-dc8e-4df0-b6c3-4c3626bb138b","resolution":{"observed_at":"2026-08-07T04:37:29.608840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T04:37:29.438985Z","title":"arXiv preprint arXiv:2402.14740 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.438985Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:f689e3f5c68b47f23b968d7130019bb73959cb233f90eb441f5278f116da5126","observation_id":"5a339a03-76b0-496e-9880-10cae60cd3d1","resolution":{"observed_at":"2026-08-07T04:37:29.438985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T04:37:30.121543Z","title":"arXiv preprint arXiv:2503.09516 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.121543Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:2879c3451fa90a7166dbf5f28495a36898343b18b80bf853a18bcfdff24921ee","observation_id":"072ae991-3bc8-4471-9ed3-6a86b39a3cf6","resolution":{"observed_at":"2026-08-07T04:37:30.121543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2506.21560."}