{"as_of":"2026-08-07T05:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38017e2fd56f2a8d8a03d727455e595f646095ec87d2546a394fd80078d8c1a3","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:04:28.418120Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:02:30.513908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T07:24:21.975072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":"2605.28014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-06-30T07:24:21.975072Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","venue":"cs.CL","work_id":"38ae18a8-28fc-4cab-8c01-96bf651ab798","year":2026},"citing_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T07:15:44.387347Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2606.29502"},"observation_digest":"sha256:e298bd0749a86450cbdf523cc6b176a0b4e24e0c9bbe314814ae4f23a45a01ce","observation_id":"c0065342-62a5-46b4-9a64-867016beeb23","resolution":{"observed_at":"2026-06-30T07:24:21.976321Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-01T22:30:30.736777Z","title":"Rosd: Reflective on-policy self-distillation for language model reasoning across domains.arXiv preprint arXiv:2605.28014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15736","last_updated":"2026-07-17T08:15:35Z","snapshot_observed_at":"2026-08-04T15:39:09.890128Z","submitted_at":"2026-07-17T08:15:35Z","title":"Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T22:30:30.736777Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2607.15736"},"observation_digest":"sha256:ec1175c81e7333344850d8d9df28cd9ce20f4f0342c99a0b2def4820162d21df","observation_id":"aae79c50-4483-4cf4-ba8b-7467a79da262","resolution":{"observed_at":"2026-08-01T22:30:30.736777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-04T22:02:30.513908Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.513908Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:1911ac7735c4e2bb1e59d892dd248cd62086491ee3aea09bb9ceb5554940d093","observation_id":"83bc18b7-8f62-4c40-8af9-570efdef245b","resolution":{"observed_at":"2026-08-04T22:02:30.513908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.28014/citation-record","integrity":"/paper/2605.28014/integrity","json":"/paper/2605.28014/citation-record.json","paper":"/paper/2605.28014"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":"2604.12002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-10T01:46:41.091851Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","venue":"cs.CL","work_id":"075fcc48-23c0-4231-bf6e-c629eb2a169b","year":2026},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:a83152d102224e25cf15d45ab0475a95ecb754446ab2b02b474b49c5a01ab3cb","observation_id":"694fa727-c843-4f24-9b90-031be593f824","resolution":{"observed_at":"2026-06-29T13:13:27.608752Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:41e72dbd8e23a6772e7f3d43e28f819defe3959d153116c97618c52cc76dd2fc","observation_id":"33fc5d03-48c0-49bf-ac87-454fd7af2792","resolution":{"observed_at":"2026-06-29T13:13:27.605975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:04:28.418120Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:318fb51fb2284b2bfabfb1a0327b21b6c376dc1752949466d11d7f7a1fc7ccc0","observation_id":"757a8a5d-70cb-46ba-a8cb-3b268cb123bb","resolution":{"observed_at":"2026-06-29T13:04:28.418120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:e4ec074f3a19e8cb21e64ba698bd04282a6ad7ae81a0d0ee42bcd3b3609cf2ad","observation_id":"e583b04d-c8f6-4aa6-b446-f8750df598ba","resolution":{"observed_at":"2026-06-29T13:13:27.598454Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:b6f3a1226f10619942af7cc5ffcc883e7013d354667b0528762d31e3be752150","observation_id":"f4896633-0afe-40a4-85b8-5d790a753626","resolution":{"observed_at":"2026-06-29T13:13:27.600926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:db3f4ba08a52860767c4427f318f1a5446d2e95a4adc51d343364b4bb1b4ffd5","observation_id":"07462d50-c2ce-4b3a-9c40-c63d1c7c4cd1","resolution":{"observed_at":"2026-06-29T13:13:27.603192Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:04:28.418120Z","title":"We train for 10 epochs on the science question-answering tasks and 5 epochs on the ToolUse task, using a training batch size of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:0f658c2b2da7735cb6d20a15b6d45c57fb556c40c7fce5ad5fbd4438acf1f2ac","observation_id":"df8451af-bf00-43f1-a93c-0c814ed66c77","resolution":{"observed_at":"2026-06-29T13:04:28.418120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:04:28.418120Z","title":"All algorithms are eval- uated every 10 training steps","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:10c36f40adfbddcf5d41e48938dc42c8a56eed8dba2c9c1a117c42ffb9d04d39","observation_id":"b6d584bb-b163-4f66-980e-b89179123d6f","resolution":{"observed_at":"2026-06-29T13:04:28.418120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:04:28.418120Z","title":"Given a question and four options, please select the right answer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:04:28.418120Z"},"links":{"citing_paper":"/paper/2605.28014"},"observation_digest":"sha256:522b6478b6013e029fe1f2aa9ddc6a4ed2ef7e9ede59e22d746e01e44aa271de","observation_id":"a56641b6-f4fb-46fd-b6e2-b7a47ffb13ba","resolution":{"observed_at":"2026-06-29T13:04:28.418120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 3 inbound Pith citation observations for arXiv:2605.28014."}