{"as_of":"2026-08-07T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8463434519123c6e8fb64fa8476b9756a8ee13c6c576ec3b1d633099117fb4dc","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T17:00:27.470652Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:31:28.359753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T21:06:34.864775Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"cited_work":{"arxiv_id":"2606.09091","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09091","snapshot_observed_at":"2026-07-09T21:06:34.864775Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","venue":"cs.LG","work_id":"62b1e185-dede-4c05-b96b-352b73c8dd94","year":2026},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-06T23:24:47.535990Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T21:05:08.742517Z"},"links":{"cited_paper":"/paper/2606.09091","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:03de5f2c8b958d3bfc3baefef22efbab42177e51d562e9ebf5533959dfd9efbc","observation_id":"805214e0-fea3-4981-8d19-8576cc2ea1d3","resolution":{"observed_at":"2026-07-09T21:06:34.866406Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09091","snapshot_observed_at":"2026-08-02T08:11:30.643493Z","title":"Stabilizing On-Policy distillation for MLLM reasoning with global normalization.arXiv preprint arXiv:2606.09091, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-06T23:24:47.535990Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:11:30.643493Z"},"links":{"cited_paper":"/paper/2606.09091","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:40465354dec83dee5770f92609739446190c86c498a3e5e9cc83cd27b8fe3c69","observation_id":"d717d121-d88d-4ef4-9070-020e680ce662","resolution":{"observed_at":"2026-08-02T08:11:30.643493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09091","snapshot_observed_at":"2026-08-04T04:31:28.359753Z","title":"Stabilizing On-Policy distillation for MLLM reasoning with global normalization.arXiv preprint arXiv:2606.09091, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-06T23:24:47.535990Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T04:31:28.359753Z"},"links":{"cited_paper":"/paper/2606.09091","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:cf67e8b7f9f5ae8718bf55e2689e95631ff024088f67b6ad9a8a151cb03b2d34","observation_id":"ea182ca2-dfdc-4776-9ad1-d58d91bb13c3","resolution":{"observed_at":"2026-08-04T04:31:28.359753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09091/citation-record","integrity":"/paper/2606.09091/integrity","json":"/paper/2606.09091/citation-record.json","paper":"/paper/2606.09091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Patterns , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:2a7435cb1f47bdbb4b224d2f7a22dd59e43b18ad3357958dd15daf142abb1d2b","observation_id":"89f62cfd-3a59-4fca-bc7b-41ba9789c30c","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"On-Policy Distillation , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:5c6baeb6419fb0ee12a1ab449b8d12a29a0bce7ba946bc3f9b03ced03fca334b","observation_id":"3264bd3d-f7e4-4d8e-a785-1d71e9c4ea56","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:ceb1fb07cf06b5a1e4004d8e8de40404ebad9099588ac06118539818352ac386","observation_id":"c404bba6-4ddd-4dd2-9b3a-203b122af082","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:edac69ebd3e1b783e0c8cd1e1e2bd5e8cee57df4505cf0926ba8378be14a4b37","observation_id":"e36d51da-751c-47b3-b213-ff2fb17455d4","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:d02f38a8c0e0aecf1a4e8ec73e8e1858e0b6ce4dea52f6dd460f2818bcd7cb75","observation_id":"96b66c85-19b1-4c1a-8c79-a4469555fca3","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:0d13287d79dfa7862f987fee47915c509fee9907f40731d843580e71058bfe6b","observation_id":"d7b8dd2c-05ad-4b24-83e9-db7a4fe472eb","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:75e025b13938b3612d1f5b2825cf0ae6ad5f9f544c25f6a0865be0dee4dba5ad","observation_id":"0844dd0d-958c-4f30-a78a-534e1749e14c","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:6b6bd5e0f44c5a7ea3413ef159ab075054b81010b9402f92cd35a963242994f8","observation_id":"f4b842b3-7bf1-449b-a313-2bf5efa1d0ff","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:57aab5bba3faf8ce6fb869532fd712fdd9ea51a29296489933f98ad97d588066","observation_id":"40380170-e16e-49bc-88c7-44b3db7c6a4f","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:0ce6316914422f2764be572aeb2beb9eaf92a046eafbd2f4441994c1ca4ada5d","observation_id":"c197d39f-1636-49fc-bd2a-c97274a74916","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:d5dce5764187f2d6ae23e9ab2afa11d64f4d8592f5b3df7d9dbddec98945402d","observation_id":"58f83384-fce4-43a5-969e-cc9501a3e8f8","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:805ad7ab2da735ff6b065c03046278953c4c5ec409b3c0ea6c903d0a5c6447fc","observation_id":"7e33330c-c5d5-4674-b0ba-5b345d075017","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:c2455190682e3d7104bd11b1b78deaf4e7739246600b2ffbfaf6586226108cc2","observation_id":"92044b17-f724-43e4-a847-35969e704a80","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:601a13650c5e115596aec04681058cad1b537a6c5e953ab5e3cc266680a71070","observation_id":"a8c03c86-8b4b-4fe2-8952-f5df5bb6c440","resolution":{"observed_at":"2026-07-03T00:47:30.742884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:19b46571e1c832edc4a76bd35dc98987a420d13611c5dcbcc85fe7f67fa5959b","observation_id":"ca7e3c06-774f-4322-bbb6-8d21a8588f8a","resolution":{"observed_at":"2026-07-03T00:47:30.739442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:9142fed4e3c0829054d6957fd459d8413e57b3d2cf21666f9f498d67f084f5da","observation_id":"dfc9640a-db54-4c3d-8b8d-68393423a875","resolution":{"observed_at":"2026-06-27T17:01:07.380473Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:fef1b61497aad3fb5d92aea961bf8ba5262c490f794536e3cc757588a2f9f960","observation_id":"1f03a053-494b-4d04-8a4c-632c8217a803","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:f1d17c6ad98aef581fa7bd50248627c8253cbcd66eefb374329c7be152398e2d","observation_id":"5b8413bb-bcdf-49c0-af75-835bb074ed99","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:5b4f03ea4c57c7b927a34a3465ddabb86afdbe42260d328d41b59689aa89c34b","observation_id":"7b70b5fc-b7dd-425d-a011-4e0254bba9b2","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:23b306f9a0ad2fe7ed610aa012e66ba00ef4f24a7d30d9ac814cbacb17838150","observation_id":"57fb54f2-f49e-4572-b183-35b1ddc555ae","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:a9afc5c0ee3424018eb8f7b8c37bceb76e299f203a5df82a9b9061eebb959581","observation_id":"f0c9b342-0793-4557-ac5d-17e6d5145fa4","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:af26eeeff0e720c74c480a0da1e549195153bf8d25c395f3ba395ce1c12462fb","observation_id":"9c386c36-8e4b-4c48-88a6-3d4bdfb3eb3a","resolution":{"observed_at":"2026-07-03T00:47:30.739951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:6a7392d34e74fd0fc15839f6b67d78f6c82a1f181255024bc54a9c12423e6705","observation_id":"2be3b757-67c8-415f-9bee-a0e7abf21ef5","resolution":{"observed_at":"2026-07-03T00:47:30.733874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:ee3232f3884dc8fcb22e5abf38b6b6c5b7e2d9e0f0eb28411a919118f160d51b","observation_id":"ff109550-ac01-44f7-b28b-4da36e05c27d","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:aea8225365427f03702e494b1a28bef31108826bd48fd6ef5d50f20e03320ed3","observation_id":"45e791a6-ad54-4c74-bf1c-9c134b88f0b8","resolution":{"observed_at":"2026-07-03T00:47:30.731079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:7ecfa559b02be2bbc8b079e1e7e8190545ba1c0967d4d2702763a3b99954ce61","observation_id":"f8ed9d86-420e-420c-ae58-c717b61b9c16","resolution":{"observed_at":"2026-07-03T00:47:30.726481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":"2407.04973","doi":"10.48550/arxiv.2407.04973","metadata_source":"pith","pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","venue":"cs.AI","work_id":"d1811506-9b67-4c64-ae5a-4abeaaec10f3","year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:88f1889a2b31a1c1f112e0985f69c8aee9f05e38fc16d9fc9177e788faa44b10","observation_id":"fb44728b-6bce-4096-83f8-dbf8996cfdaf","resolution":{"observed_at":"2026-07-03T00:47:30.729396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:1dac63fecd4b5f2280a9b0185726eedb4b519a183708137b0feb10481b7e46b4","observation_id":"87c2d490-6ec4-4121-b0cb-e53c8289ff8d","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:46f32f15805a981ff1e79da2d2dfe0fb97572245576a031ea22a768f22ec9298","observation_id":"50e22fa0-11b0-4118-8134-107b9f9ea331","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:40617b786c67d06cc7838a823c1ba87766a0b2a2afa1232dc3de94b3a1dfe732","observation_id":"b1c9bccd-d32c-42eb-889c-a9521c07d760","resolution":{"observed_at":"2026-07-03T00:47:30.728242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:00:27.470652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T17:00:27.470652Z"},"links":{"citing_paper":"/paper/2606.09091"},"observation_digest":"sha256:471b598c9ac2ad3599d90e5f7f75696adf72ef008971aefff5ee3b537c046cf7","observation_id":"8fd47925-4a0f-481a-b598-c054cc0956bf","resolution":{"observed_at":"2026-06-27T17:00:27.470652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09091","last_updated":"2026-06-08T06:41:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T06:07:09.307583Z","submitted_at":"2026-06-08T06:41:31Z","title":"Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 3 inbound Pith citation observations for arXiv:2606.09091."}