{"as_of":"2026-08-09T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c37b0f8dffdfdd48e3e9157c07082e3c406486534771127d023dcf2d61947b2","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:16:54.724511Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11371/citation-record","integrity":"/paper/2507.11371/integrity","json":"/paper/2507.11371/citation-record.json","paper":"/paper/2507.11371"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T17:16:54.103748Z","title":"arXiv:2504.04736 [cs.AI] https: //arxiv.org/abs/2504.04736 Google DeepMind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.103748Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:e6ec12de8b7aa5d4e3396b1db59ba28f50f792ba24485705d7475e08f0f4a610","observation_id":"cf99c4e5-03f3-4284-9d33-bb448d99d66f","resolution":{"observed_at":"2026-08-06T17:16:54.103748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:55.222558Z","title":"https://blog.google/technology/google-deepmind/ gemini-model-thinking-updates-march-2025/","venue":null,"work_id":"31ebe30b-a124-46d6-bbb7-5dbe7e08fc51","year":2025},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.188238Z"},"links":{"citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:62cbecd3e5da21aab88ecc751c377ee3361492ffdfba25526f9596a410573376","observation_id":"e776e815-70d3-4daf-b3d0-c24dbcbab051","resolution":{"observed_at":"2026-08-06T17:16:55.296994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:55.049545Z","title":"https://huggingface.co/ datasets/openai/gsm8k","venue":null,"work_id":"218d7c44-54ef-42b1-a0a5-dfb20a663467","year":2025},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.411381Z"},"links":{"citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:6d95d3c6afe40212f01c74ef51f2c0fc483bf15073fecd3305da485c4550d8fb","observation_id":"f24182c9-8ee5-44c8-966c-b95f9f94199b","resolution":{"observed_at":"2026-08-06T17:16:55.130338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:16:54.490994Z","title":"arXiv:2303.08774 [cs.CL] https://arxiv.org/abs/2303.08774 John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.490994Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:981a1115575f78aa0a8495b3ff58c15e0c32c38731cc86f37c4bafd9a2853a15","observation_id":"952aac95-37b0-4b0c-95d4-ebdef36b2c5d","resolution":{"observed_at":"2026-08-06T17:16:54.490994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T17:16:54.629011Z","title":"arXiv:2406.01574 [cs.CL] https://arxiv.org/abs/ 2406.01574 Zhilin Yang, Peng Qi, Saizheng Zhang, Yoshua Bengio, William Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.629011Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:bdbaf88f060b6fd56d6d569a4d63153eee13d833edb17b609b10ef7384550742","observation_id":"d6989800-c228-4a3f-b99c-6821732c4721","resolution":{"observed_at":"2026-08-06T17:16:54.629011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T17:16:54.545256Z","title":"arXiv:1707.06347 [cs.LG] https://arxiv.org/abs/1707","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.545256Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:0723bf17c1c012597588cccd9671fa0ffdb024403e46fcf9e7f123e4e3bab02f","observation_id":"c7587c99-1d5d-47c4-9e83-219e3ae2d350","resolution":{"observed_at":"2026-08-06T17:16:54.545256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-06T17:16:54.724511Z","title":"https://arxiv.org/abs/1809.09600 11","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.724511Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:0cc316443652fce453c4aaca566d3c6947c4d3d4404156c5d302ecf573d330e5","observation_id":"18dd0e8e-ab3a-4dba-bb3a-4293995890b6","resolution":{"observed_at":"2026-08-06T17:16:54.724511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02790","last_updated":"2021-11-12T02:08:50Z","snapshot_observed_at":"2026-08-08T22:05:29.111493Z","submitted_at":"2020-08-06T17:57:36Z","title":"Decoupling Exploration and Exploitation for Meta-Reinforcement Learning without Sacrifices","version":4},"cited_work":{"arxiv_id":"2008.02790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.02790","snapshot_observed_at":"2026-08-06T17:16:54.843807Z","title":"Decoupling Exploration and Exploitation for Meta-Reinforcement Learning without Sacrifices","venue":"cs.LG","work_id":"d834c09a-9e48-40c5-a345-498da1e5e7aa","year":2020},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.347712Z"},"links":{"cited_paper":"/paper/2008.02790","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:e9aa8e66a2566c978f1ba9d101be63f0968f3fb279cae69c269a769b98175094","observation_id":"ea1729d6-1ea2-4783-b31b-a345da004d31","resolution":{"observed_at":"2026-08-06T17:16:54.917862Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T17:16:54.311385Z","title":"arXiv:2106.09685 [cs.CL] https://arxiv.org/abs/2106.09685 Evan Zheran Liu, Aditi Raghunathan, Percy Liang, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.311385Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:aa8574e13f6ccddb19a5d34445e90699fe048f4f3db7bcd8bb4aff179b29d2a6","observation_id":"89ce7c00-fcbd-4ec7-b525-fa7822e75dd7","resolution":{"observed_at":"2026-08-06T17:16:54.311385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:16:54.251389Z","title":"arXiv:2407.21783 [cs.AI] https://arxiv.org/abs/2407.21783 Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.251389Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:8ac6705536c48f5fe02f5d5f3388c960ca33f3eb918146af694d68e8f32987c8","observation_id":"29ebef4f-ecef-4e45-b5a4-aa5c07f5675b","resolution":{"observed_at":"2026-08-06T17:16:54.251389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-06T17:16:54.028227Z","title":"arXiv:2504.11536 [cs.CL] https://arxiv.org/abs/2504.11536 Anna Goldie, Azalia Mirhoseini, Hao Zhou, Irene Cai, and Christopher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.028227Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:ee3a20d1010507ad6ef75e5183f58ce82ed2479e4fb5ef4a4c9587a6c2b53ba2","observation_id":"710a76c4-7641-4292-b7a5-a0056b1c0155","resolution":{"observed_at":"2026-08-06T17:16:54.028227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2507.11371."}