{"as_of":"2026-08-06T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0d9f643460e7efba478f74c71da2d3c747c482ab5bc42555242db95e8cfc083","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T02:56:58.321943Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28590/citation-record","integrity":"/paper/2607.28590/integrity","json":"/paper/2607.28590/citation-record.json","paper":"/paper/2607.28590"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:51.603880Z","title":"2015 , eprint=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:51.603880Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:085cd1567867bfe46bb986ce5eaa363a89d674ebd6a01a8bc9be9c37c5507353","observation_id":"a387e034-fcee-445a-8521-a19c11473b38","resolution":{"observed_at":"2026-07-31T02:56:51.603880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:51.769941Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:51.769941Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:ce02020357331a919101e8eff7f37770b0a484cb6addb5ec5146db9684011b8a","observation_id":"c7c44410-f026-47be-91fc-460cd082ec35","resolution":{"observed_at":"2026-07-31T02:56:51.769941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:51.838304Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:51.838304Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:593479be8fc12aab5274f8ab23393e64d26e013e0bf61d35467125feab523374","observation_id":"13f5a1f2-e943-409e-913a-af86f8fb0dc7","resolution":{"observed_at":"2026-07-31T02:56:51.838304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:51.898625Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:51.898625Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:4106a20737458534c88e25a7dc1dd3b0a3e434f73aa862f0c0e95d380fa75fae","observation_id":"e45ed18f-e725-4fda-9401-5d05556582b7","resolution":{"observed_at":"2026-07-31T02:56:51.898625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:51.958674Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:51.958674Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:bb3eb45ccb6c9d3dcdda5929cf03121a705663c0d9a9bf2ae3d4ffa840588605","observation_id":"d8246cb3-95ee-4cba-9f63-a698d0d2e7e4","resolution":{"observed_at":"2026-07-31T02:56:51.958674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.014306Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.014306Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:3a84315ed3a677bef2b7b53f82a88cbf6e478dd1a56fcd8c0b2ce33e69a1fb1f","observation_id":"c5b04e63-a357-4e47-9e53-a58c70d6d4ea","resolution":{"observed_at":"2026-07-31T02:56:52.014306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.160849Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.160849Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:8ea7e051194e1ecc04d2bc0e7eb6f997ab1ce6c7dc65b58fc641fb72fcc72ec7","observation_id":"1d751689-020f-43ad-90f8-b7f738b8082d","resolution":{"observed_at":"2026-07-31T02:56:52.160849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.249557Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.249557Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:950f9f4bc267d7469f1cbe02947179f8f4261e8fecaf3bff82430004053a0c1d","observation_id":"775c6036-8af5-46bd-969d-85ba917221df","resolution":{"observed_at":"2026-07-31T02:56:52.249557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.334165Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.334165Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7fa240e40ec5a0bcd2095e589cd009a9ddfdd2bb8d6f3b764f582dbb16ed681e","observation_id":"d775d955-791c-411d-be1c-9fe49a1e83f2","resolution":{"observed_at":"2026-07-31T02:56:52.334165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.428511Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.428511Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c4c7b1f1a2a7784106a92ccca7cee29f3426269a04f901d429a2dd1511c00c03","observation_id":"b6d9869b-3471-4cd2-b1b5-a75dcef6acd0","resolution":{"observed_at":"2026-07-31T02:56:52.428511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.606698Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.606698Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:954316339753cfd84631213f73acff3ad2dfb989432514212a34e0c1c19d47fb","observation_id":"101f9169-3cd9-4e91-9084-2fc724c5fc34","resolution":{"observed_at":"2026-07-31T02:56:52.606698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.672035Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.672035Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:89bb4279ebd496e6fa859ffeaeb38c92749d2fc7484966cde2357afde01c4dff","observation_id":"296f07ab-ee6f-4066-a6f7-f8e5d7215ba0","resolution":{"observed_at":"2026-07-31T02:56:52.672035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.726731Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.726731Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:a3df0a7f91e52079d35ed6049b43855d7747b5dcb8f96033a434ea3c1585977a","observation_id":"438dcbba-7977-4ef8-b51d-bf6a5febe3d5","resolution":{"observed_at":"2026-07-31T02:56:52.726731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.794479Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.794479Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:233f069cd6fab5c6391f8c9a93ba5a825e3c6138a7b50e58fb16d699dcb5bd2d","observation_id":"80388580-485c-418d-a4b7-83ce3de7222a","resolution":{"observed_at":"2026-07-31T02:56:52.794479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.844657Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.844657Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:580c2bde877733e1b68e8cfcbecf5c94d3c99ec883b82a17237ae977a548935f","observation_id":"5c120f74-fa82-421e-b096-c17eecf9175b","resolution":{"observed_at":"2026-07-31T02:56:52.844657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.909718Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.909718Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:354f31891ad914debeb583b76ad73fd892082970971dd2fde97e869901096ccc","observation_id":"ad3da30e-c502-4a77-a6e1-e4718e141765","resolution":{"observed_at":"2026-07-31T02:56:52.909718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:52.998495Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:52.998495Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:79c982b2b5d8c6cf728514f2a6b70f5916dc21940d37b5e4a1976c0210a82b9a","observation_id":"900a5af7-bd68-49e0-ad93-e0bb97aedf9d","resolution":{"observed_at":"2026-07-31T02:56:52.998495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.087068Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.087068Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:44f566a4f2dcd1527a754d3af2d4673b28be1aa661431c93057abe53c8225fcf","observation_id":"ac85da2f-73be-4f84-af69-d6ae59efd5fb","resolution":{"observed_at":"2026-07-31T02:56:53.087068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.153981Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.153981Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:a72a41f4953e44c2169e26f25ee193d1f1717026011637cfd288a2111a20cbdf","observation_id":"d1627e28-be58-4b89-bed7-a4e13860324c","resolution":{"observed_at":"2026-07-31T02:56:53.153981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.238266Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.238266Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7e71702d59296431f970d2b4a9584103448a26346494a67fa5e0747165e8b9b1","observation_id":"b8c103dc-acfd-4160-9618-feacd07c1d9b","resolution":{"observed_at":"2026-07-31T02:56:53.238266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.332401Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.332401Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:16f5607ccca8ca8d1d6d5e2449ed12b5e6bc66c632e0c11cd645a9a6ca645431","observation_id":"06466097-af7f-4b6f-871b-8d9d5076ea3e","resolution":{"observed_at":"2026-07-31T02:56:53.332401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.465378Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.465378Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:0a8fe620a7a858dea3a037fa6bfef389c072360e185e6247c63f96d78537ab24","observation_id":"8a87aff6-9cb2-4a1f-8c84-84454789813d","resolution":{"observed_at":"2026-07-31T02:56:53.465378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.613940Z","title":"MiniLLM: Knowledge Distillation of Large Language Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.613940Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c7d0b48367308daed65bf6b27fe36cdd8e8ebb375b16df6a4b6929dd9973e210","observation_id":"fbdc0947-e415-4a64-a8c5-cfac4d11a728","resolution":{"observed_at":"2026-07-31T02:56:53.613940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.732302Z","title":"2024 , editor =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.732302Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:160cd67258f4368541b546c154588af6acba58e00823b64942029dbaf317df50","observation_id":"2ce2fa63-c8b7-46f7-8be9-64f4d341d266","resolution":{"observed_at":"2026-07-31T02:56:53.732302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.853292Z","title":"2025 , editor =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.853292Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:14d697483b10ee7b4c39c9e0f817d95885248912e5c51dc164fc7a53f512d0c7","observation_id":"3fa76670-16ce-4aee-a302-5dc26f5ad98d","resolution":{"observed_at":"2026-07-31T02:56:53.853292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:53.968553Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:53.968553Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:33a51975d62bef8ec293c822f2f61246086cf7a7d30626cd60d74b6e2c4c41d7","observation_id":"332ee0d0-cc18-4b5c-872a-6abd0e8d00ed","resolution":{"observed_at":"2026-07-31T02:56:53.968553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.095439Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.095439Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:4391f3424a708b06106835087d5f48a2a0988db27d6974caef03cab7a6e66be4","observation_id":"65b8193b-6e56-4853-872b-d47431d2663f","resolution":{"observed_at":"2026-07-31T02:56:54.095439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.235776Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.235776Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:2e4c0f470b92789f527fe072a984d2af3bd592d53bc20a4befca56cb2f9c5c00","observation_id":"c7312312-a6e7-4007-a367-c83644ad461f","resolution":{"observed_at":"2026-07-31T02:56:54.235776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.322610Z","title":"Z oom E ye: Enhancing Multimodal LLM s with Human-Like Zooming Capabilities through Tree-Based Image Exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.322610Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c7aaf484cb8d10d2bf3b55a75a2ddcdc945c555a3eea9259ea9cab8e0b92e740","observation_id":"ac097d46-05f1-4f81-b090-6c332c6e57d9","resolution":{"observed_at":"2026-07-31T02:56:54.322610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.439920Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.439920Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:b6ac45df3fe2cd87d6420906b11c70222af90ffb5e1a486630085333ca9c2755","observation_id":"038328f3-90f4-4cf9-8d1c-d4a6f8395b49","resolution":{"observed_at":"2026-07-31T02:56:54.439920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.558206Z","title":"Thinking with Images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.558206Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:148ca1feac1dee06cf8a961510573d4450d8480ea7de9c5fd14e8e171c6f15c8","observation_id":"0a746129-2a21-4d33-8f45-6578281f02bb","resolution":{"observed_at":"2026-07-31T02:56:54.558206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.659683Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.659683Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:94fa9b375de9acd20775482e70bb2524cdbd904306bbea3648c0ba997a8e3f7e","observation_id":"5718387f-4155-44ed-985f-ffae335d429c","resolution":{"observed_at":"2026-07-31T02:56:54.659683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.794511Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.794511Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:176bcc34fce69b9b4155cc8bbca95f88189ad238d795fe8ac8073b9fa5436002","observation_id":"9dc4a51d-8c50-4b99-a85c-0c72678263a5","resolution":{"observed_at":"2026-07-31T02:56:54.794511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:54.910315Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:54.910315Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:76c676dab48574f6b522f4075ca8000d5055d198be655e5058e6cc8c0799f8d9","observation_id":"0b190101-bde2-405b-9fac-298517c583f6","resolution":{"observed_at":"2026-07-31T02:56:54.910315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.023879Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.023879Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:69256d2563ba8698107f7a6f86d3bddedc2b0404bc2e28b733e9a9b6244e2424","observation_id":"70868d82-ab1d-418b-8a01-fda6ff8dc8e5","resolution":{"observed_at":"2026-07-31T02:56:55.023879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.082239Z","title":"2024 , editor =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.082239Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:738e282fb3740c46e12d65ca9bc9037ce380488ab82968f3127b5d49d5c74a4a","observation_id":"513248d4-59b6-440b-8bdc-17a20dabafed","resolution":{"observed_at":"2026-07-31T02:56:55.082239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.131875Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.131875Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7f7f561012afd1edae13af418e8c80564b19c8519b22317237e1e1c275b3097d","observation_id":"a04a5816-0c96-4b1d-8088-9751d2250cb0","resolution":{"observed_at":"2026-07-31T02:56:55.131875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.187346Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.187346Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:668e01a7baac8a709ad2307148d81c182fa4c42fd54d38d9479534541d827af8","observation_id":"b067e561-9dc4-4fc5-9e58-73542515b02b","resolution":{"observed_at":"2026-07-31T02:56:55.187346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.283957Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.283957Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:36a7607108fd34a8abf6e34f519086cab5590deeff8131cdde6e01401b0443ef","observation_id":"4fd0e318-580f-42bf-8b40-a96b0dac46b0","resolution":{"observed_at":"2026-07-31T02:56:55.283957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.346902Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.346902Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:2cd35d2d8db064116b617ab347b859cbb3cdca87e2a6f24c3f44457963fd07eb","observation_id":"018113aa-2621-4c52-a69a-7deb8e6bef00","resolution":{"observed_at":"2026-07-31T02:56:55.346902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.432799Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.432799Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:f3ee6d5af11a91859139923c70c5c6d959bbb87b56261e913297300098833c8b","observation_id":"451b73b6-0a13-4c13-9e69-329c0545da46","resolution":{"observed_at":"2026-07-31T02:56:55.432799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.602974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.602974Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7265297c9fd10924aedee288ad5b71baa7b15b90c65bedd06fc52f12ab8f7219","observation_id":"d44c8b8e-e3be-4e59-8ab5-3dbb0aa1baa9","resolution":{"observed_at":"2026-07-31T02:56:55.602974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.654826Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.654826Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:1e8999a48a000d83f05021dc96b45afe18719030abb99ff91b73d7ba227d3f66","observation_id":"0d8100ba-7859-4530-998f-f5ce6117c450","resolution":{"observed_at":"2026-07-31T02:56:55.654826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.722342Z","title":"2025 , month = dec, url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.722342Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:6ec98a4371e6c695a4d001302f921ea14cd27934f2b627d3e188861efbf33a55","observation_id":"e6c9aa16-9af4-4c6b-8ea4-b6dd1bd111b5","resolution":{"observed_at":"2026-07-31T02:56:55.722342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:55.794643Z","title":"2026 , month = mar, url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.794643Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:cf3f3435fc3890d02873bbe1ca1a8065a7d432f5ac5c75b4ee3cb66ada598ef0","observation_id":"7f862e55-f281-486b-81b4-fea5cd230bad","resolution":{"observed_at":"2026-07-31T02:56:55.794643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-31T02:56:55.865931Z","title":"doi:10.48550/arXiv.2508.10925 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.865931Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:84c3fd804034c5748900d00e47ba03cbb1f85e2313f51a26f861bc9406d5ad17","observation_id":"e655b7a6-4b7f-416d-b9af-74149f092054","resolution":{"observed_at":"2026-07-31T02:56:55.865931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-07-31T02:56:55.930939Z","title":"On-policy distillation of language models: Learning from self-generated mistakes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:55.930939Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:e6dfbfe9f043c39dc767f3e28828cddc9ba629441c92eed0197766bc9b7755d7","observation_id":"1938315e-b872-4745-a975-8a8034d2a6c4","resolution":{"observed_at":"2026-07-31T02:56:55.930939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-31T02:56:56.011512Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.011512Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:6a0651f1fa4ecaf8049412b5f1b24f899413744cd55ba7c10b7e0ae90e264b45","observation_id":"2e93543f-b346-455c-8fe8-8d64fefd2f6d","resolution":{"observed_at":"2026-07-31T02:56:56.011512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T02:56:56.082602Z","title":"Qwen3-VL technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.082602Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:a0d275dd097dbb5f0c0a36d18dde679c1633530019adb3035dd3e882ced67867","observation_id":"1d26f997-8c89-48bb-a4a9-4df95d2769da","resolution":{"observed_at":"2026-07-31T02:56:56.082602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T02:56:56.144169Z","title":"Qwen2.5-vl technical report, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.144169Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:969f7e60064ad7a1b1a72e887996b83a5e1ea8ad860e706bec5d22a6dba21b88","observation_id":"f5b8d6b5-c501-49de-8289-d59457e1b00b","resolution":{"observed_at":"2026-07-31T02:56:56.144169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-07-31T02:56:56.215062Z","title":"Are we on the right way for evaluating large vision-language models?, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.215062Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:39de6d063c2c574c4276f75bce86b73fa788f853877a80d97b85d9f95b7e057b","observation_id":"4548282f-c229-4924-b451-8d15dbf63cfd","resolution":{"observed_at":"2026-07-31T02:56:56.215062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.290766Z","title":"HALC : Object hallucination reduction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.290766Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c81db1604d72eff2d284974f31b7390f948a39703a7ea06a8d46662518b5ddec","observation_id":"3218f434-ea87-4e07-8468-b59c004dcb80","resolution":{"observed_at":"2026-07-31T02:56:56.290766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.332882Z","title":"Sensenova-mars: Empowering multimodal agentic reasoning and search via reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.332882Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7e8383f86ebbe67234a23d1cd1c9e43bb7ea39a298e72fa8689e1c39eff88444","observation_id":"ea88f219-adae-4354-9401-d06e604a6473","resolution":{"observed_at":"2026-07-31T02:56:56.332882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-07-31T02:56:56.391695Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.391695Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:08844970d5ff651e3bfe9b7699aa058667e1ea5f514aaf6c7b8e5b72192ad75e","observation_id":"165a4110-47d4-47bc-bb99-e5adb046a304","resolution":{"observed_at":"2026-07-31T02:56:56.391695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-07-06T20:18:53.977126Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-31T02:56:56.445550Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.445550Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:11c560173054be729265b1c136fe2f9a71cc35c814457fba74e1a7c23d99def1","observation_id":"84d35572-6fcf-4aa5-89c6-796679fd1500","resolution":{"observed_at":"2026-07-31T02:56:56.445550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.482479Z","title":"Thinking with deltas: Incentivizing reinforcement learning via differential visual reasoning policy, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.482479Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:71685ebabeef3056d588ff5f009154439e6225206b51505eb0220500aad73e36","observation_id":"7bcf449f-18a7-4723-80d1-e290462b7e9d","resolution":{"observed_at":"2026-07-31T02:56:56.482479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.551166Z","title":"Gemini 3 Flash : Model card, December 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.551166Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:a67aadeb72caaa2b20f93fced1a508192ae28450fe5ff472f3ec81e07e8a076d","observation_id":"6ff9db73-4674-407c-ba9f-198d89862a74","resolution":{"observed_at":"2026-07-31T02:56:56.551166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.584562Z","title":"Gemini 3.1 Pro : Model card, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.584562Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:7c51d703dacddfa0b0cffe10100d3b84c42460a26cd90510d39cd53e96d7e55f","observation_id":"ea7c6b6f-6d8f-41d3-bd5f-73d881148b81","resolution":{"observed_at":"2026-07-31T02:56:56.584562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.648037Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.648037Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:1ea265657f9343990322991f396cc8e676fdbab49e2fa1dcdd3272c8eb0a8d35","observation_id":"442adfdb-05ff-4489-9cb7-b23f6b3728aa","resolution":{"observed_at":"2026-07-31T02:56:56.648037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-31T02:56:56.690989Z","title":"Distilling the knowledge in a neural network, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.690989Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:953cc0072bcc1456e2196336da3bcfe85df8f99cbe844b7c7f6673f9df980d4a","observation_id":"329ff58e-4ee0-41f8-a2ec-9df6b85eb0c4","resolution":{"observed_at":"2026-07-31T02:56:56.690989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-07-31T02:56:56.780851Z","title":"Deepeyesv2: Toward agentic multimodal model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.780851Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:980b24e11d13290986d61004671ecb15ba143f665a9dd5cb3764ac2d5ef671cb","observation_id":"73f3ba72-d8c8-46b2-900d-02b0538646af","resolution":{"observed_at":"2026-07-31T02:56:56.780851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.868155Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.868155Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:1fb93b99623f0afb7c87a0ad9c2dc50747c946afeffde9a83878d5be399532fe","observation_id":"45bab644-faa5-47cc-954e-4fbad2161d51","resolution":{"observed_at":"2026-07-31T02:56:56.868155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:56.931558Z","title":"D isti LLM : Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.931558Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:907ef529affe797d85ad4b094248e6eb94c2cf968094929998ebf2b0783261f1","observation_id":"80bbd39a-cf24-40d5-9453-2472813fa6c8","resolution":{"observed_at":"2026-07-31T02:56:56.931558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.012108Z","title":"D isti LLM -2: A contrastive approach boosts the distillation of LLM s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.012108Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:5164f8fbccc2c55ef83be57fbc5f23fc15869f4816205b59962791a3ca0b3b1e","observation_id":"c062be7e-f3f2-40c4-a765-da27d7c36d59","resolution":{"observed_at":"2026-07-31T02:56:57.012108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-03T12:39:46.859532Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-07-31T02:56:57.075696Z","title":"Delve into visual contrastive decoding for hallucination mitigation of large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.075696Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:bef87fec84d72bfb846bfdd4adbc3c8395555f44f73a29b162916b3efe3eec31","observation_id":"b6858d32-aa28-412d-bd2e-cee69eb4cc7c","resolution":{"observed_at":"2026-07-31T02:56:57.075696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.131651Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.131651Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:184a5679489f0132c7767245ae2819fb482efccd46f86d8406f84e254e9566ee","observation_id":"1df67567-5be9-4880-878c-5abc0ff7e2ad","resolution":{"observed_at":"2026-07-31T02:56:57.131651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18974","snapshot_observed_at":"2026-07-31T02:56:57.208674Z","title":"Visual-opsd: Cross-modal on-policy self-distillation for efficient unified multimodal reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.208674Z"},"links":{"cited_paper":"/paper/2606.18974","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:aee145d380a88bc6ccffc026efd2a719e522af47980e12abd80927229f28100a","observation_id":"67276e56-415a-41ad-9373-38500b1dd3b0","resolution":{"observed_at":"2026-07-31T02:56:57.208674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-07-31T02:56:57.285409Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.285409Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:ca1e479466d5c572f39973cc775e7230d692f086c8d07abaeba281a18fe88f50","observation_id":"fd8e593d-2e06-4536-aaa7-cc41438a6358","resolution":{"observed_at":"2026-07-31T02:56:57.285409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.363077Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.363077Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:a606a9e11cf3f90d60ccc8a8f64eed01600f68cc7580d8d074f0d85db6a568d5","observation_id":"3f81486b-f60c-44e4-8373-71115d5f6971","resolution":{"observed_at":"2026-07-31T02:56:57.363077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-31T02:56:57.408087Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.408087Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:be2c040c5c54901cecad56673e1f88ccd60adf2d8dc971456794f23f4673d96f","observation_id":"f05b5c04-abc4-444d-b1b1-3962501fb568","resolution":{"observed_at":"2026-07-31T02:56:57.408087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-07-31T02:56:57.472108Z","title":"Visual-advantage on-policy distillation for vision-language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.472108Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:26a94e72b582cc9487ed4f837d13f2dbd43c801be4b6b4980110aa76a671561e","observation_id":"eccef601-1aed-4070-909c-bcfbb4451ee3","resolution":{"observed_at":"2026-07-31T02:56:57.472108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.527641Z","title":"Kimi K2.6 : From code to creation, from one to many, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.527641Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:52a37771e6376fa87fe2e9343a0b53f9b44d29d7a5a41d1995dc52c60d289c7c","observation_id":"545b15da-5973-4bd1-90e5-fccf113ff2ba","resolution":{"observed_at":"2026-07-31T02:56:57.527641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.607311Z","title":"Introducing GPT-5.2 , December 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.607311Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:91b30e07c3fba0ab4c36f0101f9623a55e507ad96cd5c577e9c3394342c31798","observation_id":"22accd0f-5391-4938-bbfa-116cf476a044","resolution":{"observed_at":"2026-07-31T02:56:57.607311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-31T02:56:57.764209Z","title":"gpt-oss-120b & gpt-oss-20b model card, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.764209Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:580ade41055c19878e64124dee90943a9f29894a5cd311d75223e39caeaf4cfb","observation_id":"f1c5199d-3f8f-4b06-8c1d-0545cb99692e","resolution":{"observed_at":"2026-07-31T02:56:57.764209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.892121Z","title":"Introducing GPT-5.4 , March 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.892121Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:b3fc02ef904536a08f843cec5f1adb088ff4effd91c5d2c222f7a159048e39b3","observation_id":"3896b2fd-ed49-4f9c-b460-e3889988510c","resolution":{"observed_at":"2026-07-31T02:56:57.892121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16303","last_updated":"2026-07-14T07:08:28Z","snapshot_observed_at":"2026-08-06T11:35:34.358058Z","submitted_at":"2026-07-14T07:08:28Z","title":"Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.16303","snapshot_observed_at":"2026-07-31T02:56:57.969468Z","title":"Med-opd: Improving medical vision-language models via evidence-aware on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.969468Z"},"links":{"cited_paper":"/paper/2607.16303","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:143aa62b3ae7a326ec59d7fbaf828f0572d93e424a216371d43eb59979d37df4","observation_id":"3691bb4b-f122-4d6d-95e0-233853627d8c","resolution":{"observed_at":"2026-07-31T02:56:57.969468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:57.980547Z","title":"Qwen3.5 : Towards native multimodal agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:57.980547Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:33bdfb88e92fd35d254c9d49c024b64433eb588b650da8f1495ab0f8647164ba","observation_id":"871248b4-97d7-41ca-b2b4-0e36a7fa58d4","resolution":{"observed_at":"2026-07-31T02:56:57.980547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-01T13:40:35.820857Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.19046","snapshot_observed_at":"2026-07-31T02:56:58.020990Z","title":"Contrastive on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.020990Z"},"links":{"cited_paper":"/paper/2607.19046","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:b36dd449341600dde867761610e8ba42fd28228ba97a30a2413004bee5931dee","observation_id":"b0a6f67f-5f37-47ee-b93b-757d35002dfa","resolution":{"observed_at":"2026-07-31T02:56:58.020990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T02:56:58.083276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.083276Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:56156ff72aa673e2bc63bc79fab8ffcda30621485df45b0ab79c2ac2d0f1833a","observation_id":"3885d9c3-41a7-4246-9b0c-2aba11a7e8bd","resolution":{"observed_at":"2026-07-31T02:56:58.083276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:58.138959Z","title":"Z oom E ye: Enhancing multimodal LLM s with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.138959Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c7a507cb7091f860cbf3a6ec3cf8182149090c96b43960abc181e8e62fee5b23","observation_id":"0c862bbf-7c48-4d1f-83e3-ae75f2f57609","resolution":{"observed_at":"2026-07-31T02:56:58.138959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25319","snapshot_observed_at":"2026-07-31T02:56:58.221049Z","title":"V-zero: Answer-label-free on-policy distillation with contrastive evidence gating for fine-grained visual reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.221049Z"},"links":{"cited_paper":"/paper/2606.25319","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:24f3c85e123fe5ddc500a85a43888bebb095bda5c92ade6e896c1ce5ea1aafde","observation_id":"9e2b0aa4-67fc-4abb-8979-e74dafd249f7","resolution":{"observed_at":"2026-07-31T02:56:58.221049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05718","last_updated":"2026-06-04T05:18:13Z","snapshot_observed_at":"2026-08-02T23:26:06.327596Z","submitted_at":"2026-06-04T05:18:13Z","title":"ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05718","snapshot_observed_at":"2026-07-31T02:56:58.229599Z","title":"Vicur: Visual cues as recoverable privilege for multimodal on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.229599Z"},"links":{"cited_paper":"/paper/2606.05718","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:05b5657ca333dbefe6f3308e24d46757e8823297776d8e944ba90d977add9a03","observation_id":"09280411-966e-4d8c-a076-0dd7cf940adb","resolution":{"observed_at":"2026-07-31T02:56:58.229599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-07-31T02:56:58.232934Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.232934Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:00f9e5578549094559d4b1414016a745c4691902404f3e978fc478b813b68251","observation_id":"c27224aa-c90a-4f59-9ba0-3012d76638f4","resolution":{"observed_at":"2026-07-31T02:56:58.232934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-07-31T02:56:58.277821Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.277821Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:26c5acfd6156ce6e34aee0699024ed03d457ac6bffd5c9eb3333a7bac4aa1c85","observation_id":"9c1a1b0b-26a0-4323-8fdc-0a01a5581cfa","resolution":{"observed_at":"2026-07-31T02:56:58.277821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T02:56:58.281180Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.281180Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:8c96fbb8dff0d2080ec4d115bcb151c6dd3208ae7fe1fc39e723836d49d4bf2d","observation_id":"bbbe4ac2-9d5d-4ab3-93b2-e42a2be2ae85","resolution":{"observed_at":"2026-07-31T02:56:58.281180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-07-06T19:06:58.753073Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-07-31T02:56:58.284636Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.284636Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:d5e9edb244d61f3c179bc6e60931bb5497cb10d5aa83082d0cc1696b174d8001","observation_id":"aa723826-0f6f-48dd-8d98-7c120e7a0deb","resolution":{"observed_at":"2026-07-31T02:56:58.284636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:58.287800Z","title":"Zooming without zooming: Region-to-image distillation for fine-grained multimodal perception, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.287800Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:89be0a1c9e51b1d3e2ea13aa4137188a70269a6f43fc9f19cf3ac24cf47f8a2e","observation_id":"1d826726-eb9c-4bb9-9e48-ddf678d1c1e7","resolution":{"observed_at":"2026-07-31T02:56:58.287800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-04T14:26:27.153017Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-31T02:56:58.290582Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.290582Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:875353de8e065f432c553751bfaddd19c62c4eb9b3c76bdba5c8ef823c643b9f","observation_id":"54c1de77-47be-4752-be6a-b354061bc3c3","resolution":{"observed_at":"2026-07-31T02:56:58.290582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-07-31T19:27:58.432169Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-31T02:56:58.293552Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.293552Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:359dc7c8a915b7bc455e6c344620bfa5d152d8ef865259e7ecf66da3cf3cd77f","observation_id":"ba25bc3d-d543-41ea-ba6b-fe2f83f6904b","resolution":{"observed_at":"2026-07-31T02:56:58.293552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-31T02:56:58.296731Z","title":"On-policy context distillation for language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.296731Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:0a0fc4db6f14094cafc2eb4d17c0c0afd351ca7ed917729798b2227ff2232a03","observation_id":"75de6691-3794-49ce-b24a-ec0718e3da4e","resolution":{"observed_at":"2026-07-31T02:56:58.296731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.00564","snapshot_observed_at":"2026-07-31T02:56:58.299832Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.299832Z"},"links":{"cited_paper":"/paper/2606.00564","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:08c7832a3410288f7bd6fc87ab54a725fd1e4445f65d36ac4b8ccf10e3ebad97","observation_id":"013c5385-6923-4caa-8a0b-a02bbe89f442","resolution":{"observed_at":"2026-07-31T02:56:58.299832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30626","last_updated":"2026-06-29T17:55:53Z","snapshot_observed_at":"2026-08-04T05:52:55.612701Z","submitted_at":"2026-06-29T17:55:53Z","title":"DOPD: Dual On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30626","snapshot_observed_at":"2026-07-31T02:56:58.303219Z","title":"Dopd: Dual on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.303219Z"},"links":{"cited_paper":"/paper/2606.30626","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:99c29c627b02284229bc5542f41fc7c3a4d8c74702a1944d097219fc58d695be","observation_id":"66e6eee0-0aa0-4e89-8203-c7d410b9830b","resolution":{"observed_at":"2026-07-31T02:56:58.303219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-07-31T02:56:58.306518Z","title":"Vision-opd: Learning to see fine details for multimodal llms via on-policy self-distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.306518Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:c3c25ead963819af42535bfba5bcb6649d64de7c0607754a95d65c3a3c3067b7","observation_id":"b32ffac7-2ea5-4350-ac06-453c93634aef","resolution":{"observed_at":"2026-07-31T02:56:58.306518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10385","last_updated":"2026-06-09T03:51:41Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:51:41Z","title":"Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10385","snapshot_observed_at":"2026-07-31T02:56:58.309825Z","title":"Beyond absolute imitation: Anchored residual guidance for privileged on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.309825Z"},"links":{"cited_paper":"/paper/2606.10385","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:2bcefc6dc00ee325501833ff4667fa6838cf6190dc3efd25c39fce2cdbc9ff34","observation_id":"e3402560-1af6-4622-9e36-881501a522be","resolution":{"observed_at":"2026-07-31T02:56:58.309825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-07-31T02:56:58.312918Z","title":"Thyme: Think beyond images, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.312918Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:00050722d64fc2a4d2a0957a0cb2d300a293c62dc9df45b2d9397e4a6740526d","observation_id":"19032e72-684c-4f86-9ac2-7bba4df5be2a","resolution":{"observed_at":"2026-07-31T02:56:58.312918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-07-31T02:56:58.315965Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans?, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.315965Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:976300beb4e6ffadae465a5596034a9febc47c086eecf16f7a7eea4eec77d174","observation_id":"abce2db9-c536-4818-acb4-c9452cf76313","resolution":{"observed_at":"2026-07-31T02:56:58.315965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-31T02:56:58.318844Z","title":"thinking with images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.318844Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:55464affaae4845f5d7c96f536cdcbcd3075f5c0584eb06aaf50dfc16975117f","observation_id":"c830f302-c0eb-490a-aa94-92c4d7244101","resolution":{"observed_at":"2026-07-31T02:56:58.318844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:56:58.321943Z","title":"GLM-4.6V , 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.321943Z"},"links":{"citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:af1553a67cd9c03b77320c98527f05f164a4e093160a27945d6b08434dc90e7f","observation_id":"f2f392b0-7c3d-4817-98a6-4c1d460746d8","resolution":{"observed_at":"2026-07-31T02:56:58.321943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2607.28590."}