{"as_of":"2026-08-09T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f11ed60cdba13c510a610fb85f88142d24d7d664d173d4ec7c107b22ad2a68e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:20:19.874172Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04605/citation-record","integrity":"/paper/2607.04605/integrity","json":"/paper/2607.04605/citation-record.json","paper":"/paper/2607.04605"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:0f32cf15d835d42e11d8cfb3035ea8453793bf7c4f81751c08c1e748621a9973","observation_id":"d69e9b98-ba0a-4fb7-8bb8-3afc01558228","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:691e47d2e164a46ffcb843e888e52a903eab1ea10671f2df8dbccceba11469a5","observation_id":"c3db9897-eddf-421d-913c-50aeaa3018d4","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2407.01449 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:e5873e5dba85ca515cceeec8702ec1349e70e1c0aed87e528ea0d6a4d8b8a194","observation_id":"e9abbfd0-264e-45b9-b99f-5ba875813938","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:f982dfc731eb9b0e3e70714d8d028fc92e8bffb3829907b440c65a959f52c805","observation_id":"614baf50-3197-4e6c-a184-e83cc3385e28","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:39d85d3a9aebec5f5415a375256e36256d1a5acade37c2e07bdf4c5c1e58f333","observation_id":"e6459299-2443-4e5d-bf89-3fddb94388f4","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04997","last_updated":"2025-06-05T13:06:01Z","snapshot_observed_at":"2026-08-08T20:58:54.038947Z","submitted_at":"2025-06-05T13:06:01Z","title":"Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04997","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2506.04997 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2506.04997","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:7e49458682e7e85eb85497c6d885478afa53cee89c86b53de507a335aa38670e","observation_id":"72881047-42d5-48b4-ae9d-5f032e5f9f77","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:baecb15280dcb68eccb2b39f631436ba1b8c8524574597b5bc0bd9999f0718ec","observation_id":"2b44ce88-7803-4bd0-bb2d-2987fc49004f","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b80c86316114cdaa1d1af60c4e41b83d868633b4bb5af2008267a5e1d04f1400","observation_id":"c5d226f0-ce47-4fe1-8b2f-30c48a48e1e0","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:ac28b577b7c13f257a998b43797e90286b971f93498c2f9a2eec9e7d006c75d2","observation_id":"7703ee07-54d3-43de-b8f2-4f0b2f26142f","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b195354ec4ef16a871252de6efddff5a760478165710feed0193f17aa95f7e53","observation_id":"dc1234fc-5b86-48a6-be92-0163d25f7af0","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:ee1f069b78b9c3dae4c0fd40ef69541bac20fef4e05f4cc2d57d1be6910fdd41","observation_id":"e80213c8-c79a-44db-a381-bb22539273e3","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:748056c5147bd7aa8342714bc5b89d11d7d27eece7e29120d5b19dbb2fa9f4e0","observation_id":"4ac8931e-7d9d-4a42-8e35-459216666c32","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10086","last_updated":"2021-09-21T10:43:42Z","snapshot_observed_at":"2026-08-08T05:03:09.211766Z","submitted_at":"2021-09-21T10:43:42Z","title":"SPLADE v2: Sparse Lexical and Expansion Model for Information Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10086","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2109.10086 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2109.10086","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:4841daf0886e74d634a10c3c865eeda57c772a8dfbf29c2a67662e5d727fbe06","observation_id":"09587334-a962-4f58-b348-dfc3f3705406","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 31st ACM International Conference on Information & Knowledge Management , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:f4ce4ba65c58a364dddf0da91781bf1df7d457ed6b30cc06ac7dd2a614bc361b","observation_id":"48358023-8a27-4865-8203-861a2b2f349a","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 48th international ACM SIGIR conference on research and development in information retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:e2a02c40cd6d46e506c676cd2550a00b7b4351ee7f99e686ac7dde4604137be8","observation_id":"f1bdc37e-1621-412a-8f23-79f1bf2b187f","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:83f01a8589338abd0dd10a0a4fcb6ae066d9c667230efc2e34c2971dd15f5d3f","observation_id":"9266dbf4-b5f7-4987-9eda-3006827c5273","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:dc32c398352823691a791f29e35d6bb3424515dc0ae47955eea3639bdc013569","observation_id":"9449c600-a6b1-46f4-970d-158ea7559a7c","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b6095d171009f70f0e3012a49469fdc1d16c48680f83b94e512c7d455893688c","observation_id":"39c3bc25-6d97-4a42-8a7d-5398cd0f68d6","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2410.08584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:36e011d460955aa08dbdfc1c280fca791e16084548e9761088ef0993bd3acc69","observation_id":"670d5b3d-9b21-4e27-9358-59f543957974","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-02T10:13:33.319984Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13178","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2605.13178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2605.13178","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:86348d399ec685deffa9980f58761f34123d3a8271d112619eae3d7871cecd1f","observation_id":"ba733c62-eea7-47ec-ae6c-25dc6e4a0a15","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:791e38e1379e73b717444419593073a2f3c3ab578084b79db5b511b103d3ba60","observation_id":"1ac10463-127a-45d7-b11c-e78b436dfdff","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:de40532bdb54a1fd45fff59cb69d9b0d128be1be7a2b54d193db8493dc3bb5e0","observation_id":"809f288d-ee8b-41b1-851b-d3d07b433fbd","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:39d52c100c49418583b66385762bd1ecf8d902d7eda1d1f61217907ebcd670e3","observation_id":"12098874-ec8f-4ca9-988a-52382304447c","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-03T10:48:50.688044Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:1505.04870 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:040267afb6bf161681c989eba15e989835b76abba0f55595fa7f7c58921caeb8","observation_id":"70a783c4-b83b-49c6-b3a1-bf9c97b06cb4","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"European Conference on Computer Vision , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:8daa9280834e7309cbe3751f2ebcc788d93266a851cfc31e6b774a3698451b9d","observation_id":"60b43be1-021a-4c63-8c88-cc95ab52d0b8","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:f3731d0530c46870cb21da17403bbd99c91ee8959064ef1c6c1c4d7fb06dca63","observation_id":"2ad16f05-d915-4fa0-b319-46bfaae20e41","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15867","last_updated":"2022-03-29T19:18:12Z","snapshot_observed_at":"2026-07-06T12:54:23.881336Z","submitted_at":"2022-03-29T19:18:12Z","title":"Image Retrieval from Contextual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15867","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2203.15867 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2203.15867","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b6eb02a9573dee0aa3d5e585390a6ce18361de67bd4ed864384401653c961aaf","observation_id":"e0eb666d-a6bc-4003-b48a-ee38e51cb817","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:2ea24e32a41331bd6a76bb04099be7e6c291661175d79fbfdcd479e66ebcc160","observation_id":"1cac47bf-ff03-43c1-868c-ccc2e7c41ce8","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"European Conference on Computer Vision , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:fcdac765e21ae3a2f3eedd233654b7f47c0797b621577d9eb08f216bdbec2bde","observation_id":"add979f7-4818-4453-af91-c5d782d59624","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:74af51248ae3d02f32c16c39864ef79c8370ab3481423bdbc370d1b45c88ed04","observation_id":"8513aa62-b565-4949-a652-732b1da7900e","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:05c203bac2fffca5e44a9e637b8574f25fa816e54ecc7c9704028a07f33cfcab","observation_id":"a1735af3-c2dd-4dae-816b-f95839cfb5de","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Demystifying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:f7715e64468d07d314b04bda03b1bcaffeafd4d25fa2738a1519f9d1cb002a24","observation_id":"b15c0d7a-21d6-4694-ab37-c72993e0f7f5","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2303.15389 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:320c3c51e9a36560dfcad6e478faa72567c3e275b9e79dc721fa656881235526","observation_id":"fce11417-3c5a-4d9b-8770-bb7346f16fab","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2309.17425 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:c834b31280b3aa7a0fad20eaff341216553df5f81819fb9377712feeb0ed5859","observation_id":"3284f6fb-af5d-41e2-abd0-011f00031f52","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2502.14786 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:dc51413499a201c08f51eefe4edce4a4c18a1a77b1fe90b1fdc89e60c9006006","observation_id":"be27854f-dab2-4f0f-9551-9a0f353d78fc","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:a41dfa14a3751dfec564a84901c6bec5c4c7c5e36d6fe553bb7e4da1833591db","observation_id":"e11db6d0-a67e-4419-82ce-a54400f900a8","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2412.16855 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:e87c27b6b85f956938ed9dd5bca1a8c142c18b95d0cec03615d2cf8e58c8a2f2","observation_id":"2a4f119f-b87f-4274-a54c-eb44ec712845","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:bb52188681b9bdd85d945890ca1bd62ae9ec423c5af06141f7f15291a9ebbf40","observation_id":"2093b4af-f076-44b3-be8c-cac7b1b3fc25","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:638443e9f17fad7a536782c8a09f3c27c71aef58a56d5bd59a948c322c35ef59","observation_id":"89aff243-e945-455a-badc-a74de29dede0","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19128","last_updated":"2024-04-29T22:06:17Z","snapshot_observed_at":"2026-08-04T02:46:39.581200Z","submitted_at":"2024-04-29T22:06:17Z","title":"Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19128","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2404.19128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2404.19128","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:88985918e8e15318b4e66576066f47516e98f4bdbf3bbd45477de18c27552a2f","observation_id":"d6f69e71-bdc3-4e4c-be96-b8a33365b224","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:0121c608ced988d4dbddfb02de50d288d38789ba69f0411675f7189f555c6b6e","observation_id":"63c43d9d-f918-4abb-bc8d-6d9fe6106649","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:3903f9b994df1fddf8ac12000848b45ade25db2111538a8d4d6bb89e1fdc8386","observation_id":"6e07c2b9-3d19-496d-9eb2-d3df3499d24a","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:8753d923bf70939fc82f629603d07e736e1ec5c9bb936e856fb1192113fb8a3c","observation_id":"ca750301-05a1-4f8f-b567-07d07ef89b58","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International journal of computer vision , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:a82eea563f64e6043d886490305ea941c39b1319e706b4037ef37c2dca9252ae","observation_id":"33d6b6a4-3f95-482f-8501-340b202a0e67","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:fe46cdf37de1f17f4130aa975b22e6f817cf58eb34c3c049568a9f0195a2fc9f","observation_id":"e1643704-35b0-4bae-a2fa-af4f52a4ac79","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:cbf487c584769312f96821ffccdd9d397cbf4bc48c1b8c58e14d5342b0d5b9de","observation_id":"9ada24e3-bb8a-437b-9214-f508d1bb776a","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b3b645d40a28b321c22bf178e21a8ef5c2d27892c2a68dcf20c706645c667792","observation_id":"bec6475e-e5dd-41ea-a8d4-a8d073976247","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:91d7198f22130685792f1460b2fcdbf3abbacaa1a233357911bf34753dfd0927","observation_id":"d5f3c0f1-6f25-4cf9-b2af-10f80fbbf73b","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"European Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:d5768279d6f869ea409fb64527e0456f6ebebeb0d558b028b00a6b9495aa6d27","observation_id":"855dbae7-fd2f-492f-8af8-23e202e544a5","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:6bf071a46bb6e1072c636d19dfb6b15c0bfa88e75b0bf9d9ea39ef6eac2eaf82","observation_id":"c5fccd8b-8d63-44a8-ba83-20b216e24dae","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:bc8d075c60aecf4be37ca9a9cdd4ca8596283e2b219ba456493dfafed94ce0c9","observation_id":"507d476f-c002-4c6e-9e12-cd8785215232","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:51d4fac5d9b96d3348ca3302c6ec55311b6c4b32b55354d398efe3250a8df418","observation_id":"b592cfa8-028d-4429-84a4-754274ce5bb4","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:cec127a5fe99d30669f30f1e13fe7a71f4ad5e60963580ad363426e395a4bae8","observation_id":"ffea91b0-0d09-4c19-9b2e-94e75984bced","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:128694fc4f17755e6fc3fb2c3309ee6b38e9b2f8b71796c5440de85a34672694","observation_id":"3f1faae1-c479-4901-b8b4-7231f7803286","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:713820f9b5c736ef592138565ad2669ecbafb1e6e7f387761af946dc5dfe2f39","observation_id":"cd18aa89-36ae-415c-bdd9-d87f34618c89","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21601","last_updated":"2025-07-02T03:32:17Z","snapshot_observed_at":"2026-08-09T02:54:25.548492Z","submitted_at":"2025-06-19T08:45:52Z","title":"Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21601","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2506.21601 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2506.21601","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:3fd6ee2914fe49d2cd1e59ff7a0e16b9c8f64f44700ab212e8081740bec80473","observation_id":"8426ecb0-5c54-48a3-ac15-08cc4b119d94","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:d6c61c9e65a3a13c9af5151364aaa4f1137b8929a7b09025ebd5a8c9cf4a06fc","observation_id":"4ce0c88e-ec0b-4238-ad56-e06169975b3b","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2602.21202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:b4585de6a5f51c6b967a30fdac8e7c2ee26b7537e7554078f700aae9503785c2","observation_id":"c8c7517a-ecdb-4aa0-8fe8-e89abb0f064e","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:1807.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:1a400fe633dfb8110120e04908136231f76bd9902cf299c004b304ebc9217496","observation_id":"33f6898f-e8c1-46b6-a794-b7fb5ad3a4ab","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:cd78b6ba91dec659949d910f0d47143bc51b075d04f9ebb2feb5ee47839ed55e","observation_id":"c6cf9eae-3f4a-466a-b2c9-dd54554f0904","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:c0f1342ffe7431acd0de138b5b0d8f1992abf89312ac60d7d9d329c41ef6ea28","observation_id":"d298ddc2-cea4-40df-ae3d-2ae99672d71e","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-04T23:09:53.876810Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.04605."}