{"as_of":"2026-08-11T12:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81844a62d2096f43a56a6c0057bf8aad5137e946411e3dd8d8e3c309e9a38df8","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T14:37:28.660097Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:06.584525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:39:08.145196Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09348","snapshot_observed_at":"2026-08-04T15:12:55.703451Z","title":"2026 , archivePrefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-09T08:55:51.965628Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.703451Z"},"links":{"cited_paper":"/paper/2606.09348","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:4b1614c2897d6aeb5cabfc57cb5b939d19b8e3d290c16ca450932b0bd1f8fab4","observation_id":"78c16054-15cb-4cd2-b031-3895e2104ec9","resolution":{"observed_at":"2026-08-04T15:12:55.703451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"cited_work":{"arxiv_id":"2606.09348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09348","snapshot_observed_at":"2026-08-06T16:39:08.145196Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","venue":"cs.LG","work_id":"6ce41a0f-002a-43b0-bcdb-01b1f55b0c17","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-10T02:49:16.716182Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.584525Z"},"links":{"cited_paper":"/paper/2606.09348","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:eceef3b54b3779863f083bd2198a788d40e82651ae7c30d5c9e4e1209e8fa5c7","observation_id":"38de8315-b88a-46a4-82dc-19a2ec9350d9","resolution":{"observed_at":"2026-08-06T16:39:08.247916Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09348/citation-record","integrity":"/paper/2606.09348/integrity","json":"/paper/2606.09348/citation-record.json","paper":"/paper/2606.09348"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:0dd8f7472c7b4fde81b66e84e33f4afcde70cdaf9e504963ff3670ce1b001809","observation_id":"271df1c1-b80c-4a90-8d7a-cb2c275ae08e","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:270c939b9cf2aa9bfa68e5d0ccf8d9723107891c127151a43857a357a64a2e2d","observation_id":"b7838f1c-c8e0-472d-a45d-f95616640fa4","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Tongyi deepresearch technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:8c647e1d8396bc94dea337a8505dd10e86911c17f6341601f33572a08630edaa","observation_id":"d41e2f70-1e2a-4bb4-982c-1fc5d55cb135","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19859","last_updated":"2026-04-21T17:59:02Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-21T17:59:02Z","title":"DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19859","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Dr-venus: Towards frontier edge-scale deep research agents with only 10k open data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2604.19859","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:a97f85ba004dbbaaf47ca41e856cf80519ef9da60b54cb6b5ec5fbea0cde5bc3","observation_id":"8eaafdb3-a240-47d2-b17b-b3e3fc1c1559","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05185","last_updated":"2026-05-06T17:50:38Z","snapshot_observed_at":"2026-08-02T12:07:09.741466Z","submitted_at":"2026-05-06T17:50:38Z","title":"OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05185","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Opensearch-vl: An open recipe for frontier multimodal search agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2605.05185","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:f1f6c3533c08ab788d2b05b8e29dc01a2a4c50238ad00ff608974f17336feb49","observation_id":"99a86f73-10da-42c2-8c65-79136130593a","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:81392a1e0193f208a21df2b2ad0d3471ae95468805b082852bd778876c54e266","observation_id":"a3dbaaa8-63a2-4dda-a5d8-d83ef8d110e2","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14518","last_updated":"2026-04-17T01:58:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:20:06Z","title":"Mind DeepResearch Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14518","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Mind deepresearch technical report.arXiv preprint arXiv:2604.14518, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2604.14518","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:f8a64977a0072892a73a35d2819595936fb034cd8c4fb4f158f477c2b7598ad5","observation_id":"58275e48-cd67-4043-9df3-9981930d8b7a","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Tree search for llm agent reinforcement learning.arXiv preprint arXiv:2509.21240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:7d66176ac86332b2af5cbb1c2e6abc20b84d6b286d13be0417573ddb340bb34b","observation_id":"3bc5bcf0-576b-4e6e-9b8d-6c589443d14a","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Treerpo: Tree relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:42ea175a4dd6720988879412b1e058224029ec356c78085ce7f41f7356f51c82","observation_id":"bcba510f-3d50-43de-90b2-ecabedac86b2","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"On-policy distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:980dfd2f1f013daf458dd48df341ae2bebed394941e9fabff35467d1b8c038bd","observation_id":"9783179d-9fc5-4e62-a5b6-1fb73bd651b9","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:ec1a7b5761cfff77cfcc8e6402bd5d075fc819819f9ff6624bb9b75ef2254950","observation_id":"56b852a0-4995-46d8-96a7-ab4d6300a29d","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-10T11:34:20.766987Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:76e4f2649b0307c6f0b2c7c605c4a3020095360e5469b7175bcfcd03e521115b","observation_id":"3f5ce916-b75e-4304-b226-4d294cf7e800","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Self-distilled rlvr.arXiv preprint arXiv:2604.03128, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:0d5533b79d14828f2f1ea05a7f16d770d458ce88c3008cceb3f55d9f73901ab7","observation_id":"f2dfa813-82f0-481b-a68e-f9b11a85bd46","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Criticsearch: Fine-grained credit assignment for search agents via a retrospective critic.arXiv preprint arXiv:2511.12159, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:6c9c0b1f0358c81d1e83e9ed3fedc620b8e5bedeea63de608ab3e0b3a6528ac9","observation_id":"18c5bcec-c127-4fb6-85a2-f1f253c40672","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10899","last_updated":"2026-05-11T17:40:38Z","snapshot_observed_at":"2026-08-02T11:48:00.587789Z","submitted_at":"2026-05-11T17:40:38Z","title":"RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10899","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Rubricem: Meta-rl with rubric-guided policy decomposition beyond verifiable rewards","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2605.10899","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:48d2df274bd50082414c16b7e31653659382627605d59234f745d992c6c4128e","observation_id":"bb4595ac-9b8f-46c8-83b3-5f2d32aaf597","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Reward hacking in rubric-based reinforcement learning.arXiv preprint arXiv:2605.12474, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:22318399b2b1512d3f97ac28fd1b5357e042a89dd9bc1a31b0ce23e46ffd0477","observation_id":"76d81e20-033a-4f34-8979-905514cf5d4a","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-08-07T15:21:40.079260Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:d026c95464def65eace6da22185a6d9be2698f29d21d4e1bba9f5da380637b83","observation_id":"d52464a9-a930-4b0c-8ca9-24415466a351","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Reinforcing multi-turn reasoning in llm agents via turn- level reward design.arXiv preprint arXiv:2505.11821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:9c10ade99648e15a0ddd31cc7760df375b7c7eaac874a198aa9f64f402ac7300","observation_id":"41f54242-efd5-4ed6-86d4-1e1e6898a2bf","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:83a4a92999dea85d096959673bf9d8cab8a6aad37ceb1f232807f1fd974d76ad","observation_id":"9d89e011-167c-4caa-8076-607574450878","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-11T02:54:03.247102Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:07e50fc57fc5927330389ca60fb196b6282622d54b0f004559ae10cabb4d2c34","observation_id":"50974593-1df5-4bcb-9e25-714769de15db","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Reinforcement learning via self-distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:27db0208baa0a106aa12d1fd17d8bbee5ef01dbe956b80a754536e1c5b48fe77","observation_id":"80f0789b-3f89-47f5-beef-54f3a5c6a7bf","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-08T15:46:07.719139Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"On-policy context distillation for language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:c83cc6d2e289efa49bebc276136d6a34fcd91c070e6b69162fd3a806a6419357","observation_id":"4d30b6a0-8e11-456a-bc58-0883f2291ac4","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Self-distillation enables continual learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:7842c00520006a3f23f039b6db70e1571e0ce0a8531b3f5ddb279b1697c1943d","observation_id":"450dffd7-2cd8-452e-9bbb-3b7aa4e0e614","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Privileged information distillation for language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:722a354d3ed515dfbc71f993aba310a519d0c56a25d636a68a713e957b30d3ec","observation_id":"45ea532e-4e9c-45a2-a9f5-3c661072cda0","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-08-10T22:36:17.106659Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"On-policy self-distillation for reasoning compression.arXiv preprint arXiv:2603.05433, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:12b527fcccf8dc1d64341b7a25b6140c8a36bfdfc9b4f68f0d197a04e90bcdb6","observation_id":"2d906c2a-4658-45fd-99ba-3880d5d2aa2d","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Mirothinker-1.7 & h1: Towards heavy-duty research agents via verification.arXiv preprint arXiv:2603.15726, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:c772a800838d6d08c966640ee95ee9d3e243c37b4cf79ca27017f68b07cf9f1f","observation_id":"fcd0fced-f996-43da-a381-533a4679ee28","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.11793","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Mirothinker: Pushing the performance boundaries of open-source research agents via model, context, and interactive scaling.arXiv preprint arXiv:2511.11793, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2511.11793","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:a938836fbb7264439df45abeb3ea52e36bc701adf5ce11804af8e36f7e5e900e","observation_id":"f6fd1f05-858b-4506-967e-3d4fcd0c2ded","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:e5a9ed7e9e46b9a821cb1e1985ffe821c7d9c4e55590265d5ff7e86b57bb80a2","observation_id":"ea4bd47a-ef63-47f5-abe3-b9d1912d3f56","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Deep- researcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:50a1e8a426dd894177d615e617a55814c76ab7695c03a13b2c64635927b8bc39","observation_id":"2ad92bf4-9342-408e-bb14-2e64635209c3","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Stabilizing moe reinforcement learning by aligning training and inference routers.arXiv e-prints, pages arXiv–2510, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:7662db8af1fcd7b9a1c5677efe849b671ef46fa3250a119eab51cb1f9684dc0d","observation_id":"e37dbe36-d3a8-4805-b5b3-099961d9c22c","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Openseeker: Democratizing frontier search agents by fully open-sourcing training data.arXiv preprint arXiv:2603.15594, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:77d18c467b3034535a9d2b621cc30407a4507116a8fe2eceb107d74cb6ee4886","observation_id":"f70d8dba-4c17-4acb-a0ff-3d1b11f825a1","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents.arXiv preprint arXiv:2504.12516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:00e14911aff489cadcd22c842925824501d1299a3aec60a1022de19149b90aaa","observation_id":"797b6d42-dc69-4b74-8c2c-8de9f105a1d6","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:0e60ced6ca893c37deb1697a6e4efb1cc3cd349e59e6f8957443a22556dd56d8","observation_id":"bfae2e42-f81b-471e-862e-5d10667694f3","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:113d6d844a62e7b5bc4b022af56343fa68496bf41e0fd487f14ce96c1abf15cc","observation_id":"919d60fb-cd25-4d14-90cf-075ace980846","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13651","last_updated":"2025-06-16T16:16:14Z","snapshot_observed_at":"2026-08-08T21:36:50.159357Z","submitted_at":"2025-06-16T16:16:14Z","title":"xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13651","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"xbench: Tracking agents productivity scaling with profession-aligned real- world evaluations.arXiv preprint arXiv:2506.13651, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2506.13651","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:a13325a19e0ad3fbe7fde99e02f253fe9fadcbad30af2281ec08af0d27a18949","observation_id":"154f2951-df48-4eeb-9675-884235253d8d","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"gpt-oss-120b & gpt-oss-20b model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:e9ce68bbc74da5270da189e0996e262e844b6d5d28afa3b8745d4a3842b10388","observation_id":"c575b97d-a4a9-459a-b111-0819f8277cba","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:1fc9af845c339928746481d59dc11d3da33dc3039fc5d9dd1b10e27ad61863cb","observation_id":"4f27c5fc-cbe5-48ff-b64e-ab4e7b4beb19","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Llamafactory: Unified efficient fine- tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:c1efd1344bb9a878139e42a08e07ad1a1220244badfb881dd079a885ae4d5034","observation_id":"8e5b875d-1eb9-4d53-b3e7-1a80f05fc2bb","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:2b7722863fbc20dfe5d176a9cbd2f8b2e4f5b33aebe8972561601a2928d9f526","observation_id":"d9bfc50b-5b94-4024-9a0f-5603a5456c53","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"param1\":","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:ccd7d5c1b0dfe6e845a4caba01e8f6c0d264769a3a8fc88d78cd37922f543b68","observation_id":"937f6d50-f92b-4c9a-8b42-ef06584cd3f2","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2606.09348."}