{"as_of":"2026-08-09T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a08d5b2bf5ea36580a505680efde85c73b051a6a78a655f0a6e98f4ade774ad0","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T09:26:29.033271Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02593/citation-record","integrity":"/paper/2607.02593/integrity","json":"/paper/2607.02593/citation-record.json","paper":"/paper/2607.02593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The Twelfth International Conference on Learning Representations (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:f740b9d00dec0e3e4598bd771696e4ab28b9b78ef2708455b956ddf18d070d5e","observation_id":"58d73325-0b48-468c-a3a1-ed1744c875e0","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12965","last_updated":"2024-12-14T18:40:10Z","snapshot_observed_at":"2026-07-06T14:34:54.567584Z","submitted_at":"2022-12-25T22:27:32Z","title":"BD-KD: Balancing the Divergences for Online Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12965","snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:2212.12965 (2022) 10","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"cited_paper":"/paper/2212.12965","citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:141ccbc56c766d7ae78a348f1d3ce839bfa2934fe4e6b1b95d7dcecaa3c0e1b1","observation_id":"c6e331ac-e63a-44d1-b919-665aff10ba00","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Jang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:fa9f51a6a9a39f5983cae10ef33a64f84decd79244a0d1ee4bc4c2d95ef65111","observation_id":"60a72bd3-e090-45fa-b59f-87aa7f2f9b3f","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:26462baeddab33bce3e3799250555ef7bf12014d2798759d237d98465491e0d6","observation_id":"82aba099-b0aa-412e-85c8-ec512d18b4db","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:01c34cf242a9575652489731535b6dff3a153c609d2849197d28b4abaf483388","observation_id":"db8b735c-98a8-4f32-8e4c-abb5783e836c","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:2602.09483 (2026) 3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:ddee5364651e29fd267fe8e72e1cce77ddddff4ec817029786c6b113c994b7de","observation_id":"f61cacce-e175-42bc-9506-ea3b54b0b06f","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:2503.01773 (2025) 8, 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:81a472a992821d3cdf59cf23de4841897f667b6d9c1de0a6a01d58052f87a3ea","observation_id":"0152ab51-d6bf-4cc9-921e-681cdb785fa3","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Scientific Reports (2026) 8","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:6a3d6517f9ce33f1562aa16fa7f66b2fcec813b4352c6f26435048ec8a53f60c","observation_id":"4a35c71e-bfa1-401f-804e-d3d5f088be0b","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:0badaa563ed26dae0d44d50a7733c6915f7068be06610db5242c8abad6a2a73e","observation_id":"453c6014-6e0a-4acd-9318-f564a1eb8d1a","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:7370baa64756d8482199af65fab1b58e91715d3b905f799e1efc30cf75d8b429","observation_id":"141f3f52-237c-405f-8774-5853f2eef546","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2025) 11, 22","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:d0d389a09857f85a9c847f20cb3ef284d715339f9352a71ddf72d3bd48261307","observation_id":"b4bc6b5b-10f0-440c-94c4-e23bc1ff3330","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The Twelfth International Conference on Learning Represen- tations (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:0b0072d597e423ccc1ba24b54d5b5536db50fd2b7319ca2008b9e59ad741fa6c","observation_id":"1d63e10b-ab3a-47e9-b094-99d9d7bfa121","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Image and Vision Computing146, 105020 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:62961b10cf7b29e93a7bf45ee3470fc203eccc3606f9766a3098a573d0b6e9d7","observation_id":"915b37af-adf1-4796-8326-5c3e21fc226c","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:dde642ac7262156eaa65ed2066d256246a4c282fd1500c6c16bd640888314048","observation_id":"0838025f-b421-4635-be6a-d8590ace867e","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:1606.08415 (2016) 11","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:c999e88070c4a7f4b6e998a401bb13bbd89eaed2bb747c9375c8b985be6708cb","observation_id":"70a16c5b-0303-4681-8cab-f092fc0be3b3","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:4ba289459fe7f323bd054320abebc468b1b57150ee9237fbe80540f46f869106","observation_id":"3515f1e9-96d7-437f-ac0b-0134f858d751","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in neural in- formation processing systems36, 31096–31116 (2023) 11, 21, 22","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:88758e0a3fa2fd1b0cdf634c5285af2b8b21591e99933ab8a594ab0e2d2fa208","observation_id":"223bb2d2-99b1-4d15-8244-451d2133af1a","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF confer- ence on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:93262b30a2464e2b1627be98ff27f9e165232436b35e5d564f9ddedb12e21665","observation_id":"54168d2f-c6fd-47c4-912d-eca6238cd6be","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The Fourteenth International Con- ference on Learning Representations (2026) 2, 3, 5, 6, 8, 10, 13, 22, 24 Token-level Response-visual Attention Guidance for MLLMs KD 17","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:e4792041a71aa612f0ae6922f9953ecd973476fdfe57f7c9bef4d8d1fa8f1a9d","observation_id":"28d6eaa1-e126-4e83-a239-d45845f2624d","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Forty-first International Conference on Machine Learning (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:02c8ceee5555854790c2a945e9d663fc32e25c12ba9a031704474da65bdb5010","observation_id":"21bb65d7-d824-4af4-a27d-5686d78c322f","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The 2023 Conference on Empirical Methods in Natural Language Processing 11, 22","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:464ef457d316e697100d4f10033afb5b66d386c9e6598f393f74d8b1fac8df3a","observation_id":"8426b147-8cb7-4310-8a1f-ede94743c189","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:d5205551f1bd221308127c6ef22a45cbc591d6a9a76a7e22b1990247c0ad9b41","observation_id":"1450bcb7-6075-472d-8c90-58c686232123","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:94a84198f3494928e5a0c6a463056fc85763a07da71a802107b62bed959bd2e3","observation_id":"b8c90f58-ad53-4163-8029-22730a179f4d","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in neural information processing systems36, 34892–34916 (2023) 1, 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:c55dc33b9642d03423f6ac39edd12f88bcedba0e2a199a82dc2d654b628dc4e8","observation_id":"42f02d38-cd49-406a-8b55-fce3df53bccd","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:d472554565882689132163b04a1ea6a3398bda944536bbc89edda1165e2623d2","observation_id":"fa12e0d8-e266-449f-856a-c23fe769f5b9","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:2403.05525 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:7f71efa00f2ab3a9a0a4845a75525046a9dd0d079f88718effb6ce3c295c19df","observation_id":"cba19a9c-0cba-421b-973b-1b615c90b766","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in Neural Information Processing Systems 35, 2507–2521 (2022) 11, 22","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:43501861767c6336247deb624453c464761dccb5cf4310c4720fb4bd60d5f1a2","observation_id":"c1ac0dc3-37fc-4cc8-b3ef-34022f314e5a","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in Neural Information Processing Systems37, 101880–101904 (2024) 11, 21, 22","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:3abed393c3dc05b2dd092b453174240a7bd75b0093e5e491e8f49e13c8f0e084","observation_id":"9fe202d8-92f4-4fd6-ba03-04c0882657b1","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: International Confer- ence on Learning Representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:0c9565d41d5e8b87ab0ec2c8adacc90f66eef6970eb314ec355f7911d5b433bf","observation_id":"be5d2b2b-517a-4aea-a6d5-e8d9fbb4bf35","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Pro- ceedings of the 61st Annual Meeting of the Association for Computational Linguis- tics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:22dfe5227fe443a5c233da67b30976ade79afa23a1be1e769c8285927f9986d3","observation_id":"33870b8d-7d11-40c6-82e4-2e68cfff7963","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: The Thirteenth International Conference on Learning Representations (2025) 3, 22","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:ae4d6d176b48a946de4aec513523de01160683abee4b14aa1f1a75ef357e923b","observation_id":"38213dc0-8e6a-49a5-b0ea-f3d261464658","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:cb2336cab8f53026a53df5185aebe1e6f7f9b5d966feb10ba94f68565be58529","observation_id":"f4fc5747-ab7a-4d80-accb-27c52f540972","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:7b22cde93520bc579ad6dcbd3f9e3c7f4441d8035ecdac1dedc7e3959fb216e3","observation_id":"06929c93-75f7-4822-99fe-d15ad45c097b","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in neural information pro- cessing systems30(2017) 4 18 J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:c87b2538b8c52e9a3f088385a011dc6ae6889682fc1e89e49bd9980c5c1edfa7","observation_id":"c2651038-4c34-4a58-9ee7-4e3cdf7ed84f","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:7ba2363cc0cdd8b1f3592fca123e3458990d7682c76e4186113d9163ae6a327b","observation_id":"cf240ae3-4bad-4a29-af40-a31a80e633b2","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Advances in Neural Information Processing Systems37, 114553–114573 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:5427a2cc708d6af3b8a8f7366e327e95aa5cbd252bdf81bd65525fa0a638c66e","observation_id":"5369a142-9f7d-4250-9e29-d4bd22171cc1","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Pro- ceedings of the 31st International Conference on Computational Linguistics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:29eb8dfa7f73b2c6ecf8ab220cdf8ca0f988f39184b9cdbea1cfaedea2fddd8f","observation_id":"e33c5704-2d33-4d22-a808-9bfd0a7d1bb1","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19409","last_updated":"2024-07-28T06:10:47Z","snapshot_observed_at":"2026-08-08T00:44:59.660812Z","submitted_at":"2024-07-28T06:10:47Z","title":"LLAVADI: What Matters For Multimodal Large Language Models Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19409","snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"arXiv preprint arXiv:2407.19409 (2024) 2, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"cited_paper":"/paper/2407.19409","citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:9e834acb606bd76bc8d535a351f5b9546513d1964a941493cf75ca0d8050555d","observation_id":"1c498e38-1e41-4d7f-b5b7-1153890db0ff","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"Scientific Reports13(1), 18369 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:8a0e6b923d8905df673849be5feedfce6f2d0d989a82415d5fd82bd12781c2c6","observation_id":"42a707c8-37ef-4f14-8173-f3f425cb0be4","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:b1e937aa1d55af000dfe206a40f4ed1469c19245b9db319af0efb3ee0c7f5dba","observation_id":"f91d8a65-7cab-498b-91cf-fc3c479db2df","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Forty-third International Conference on Machine Learning (2026) 2, 31","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:0081000b2666104de754a65261115bf19901a3ef84466708fe18f64399f93e82","observation_id":"20b604cc-e141-42c3-8c60-34634e86c90e","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:f5bb51022147854f4d6193ee16e8dca836591df5910bff481aa14a7830d9bfcf","observation_id":"f8a2189d-94d9-4530-b86c-ea12f3d4a513","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Interna- tional Conference on Learning Representations (2017) 3","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:e1a0f523a6811e11d651419086517b1a391fa59e7ab8fa1558b47b5f240a514a","observation_id":"a8cf291d-6305-4e88-99a5-7d6c1ebe08c9","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:13517f98b5939f8f017c1894f458892785cdbce60309ed61fcd0a2146e8dc0d1","observation_id":"98a3b12d-5662-4771-ad2e-4ff8ae2f8c94","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:26:29.033271Z","title":"an airport","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T09:26:29.033271Z"},"links":{"citing_paper":"/paper/2607.02593"},"observation_digest":"sha256:fedf80814533fdd11e25d17acadce076cf2d18e8c39c0c07f16def5339e79c7c","observation_id":"777a44ec-d2ee-4fd5-a2e6-e6e42772a763","resolution":{"observed_at":"2026-07-12T09:26:29.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02593","last_updated":"2026-07-01T08:03:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:50:41.424633Z","submitted_at":"2026-07-01T08:03:30Z","title":"Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.02593."}