{"as_of":"2026-08-09T20:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50d26750d322741c90ef9351fec25fc49f4df6df72bdc62497e09736365bcf61","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:32.385290Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.573559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:04:01.690792Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-08-02T20:14:05.183330Z","title":"Laco: Efficient layer-wise com- pression of visual tokens for multimodal large lan- guage models.arXiv preprint arXiv:2507.02279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.183330Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:5495c8a8de9cc5ab7f2fd3077bc1d6b074443c35fc45fb5b01623d6463a18fc4","observation_id":"de24ad38-9c42-4984-a9d0-dc8f4eec8aa1","resolution":{"observed_at":"2026-08-02T20:14:05.183330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.02279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-06-29T23:04:01.690792Z","title":"LaCo: Efficient layer-wise compression of visual tokens for multimodal large language models.arXiv preprint arXiv:2507.02279, 2025","venue":null,"work_id":"b4d83a8d-3ad0-4b23-bef3-915d3f3127ce","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:3f32d5bd0227b3290d5b29dcaf940d4aaa8a128aaa550f24a37f533ab7a41707","observation_id":"181c232c-4435-47c8-bb9d-5b6f28653334","resolution":{"observed_at":"2026-06-29T23:04:01.692379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-08-04T23:46:51.573559Z","title":"arXiv preprint arXiv:2507.02279 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.573559Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5300c094490614183b0c0c0335bb6a793b65c5369d6306f6c12d87fe014d01ca","observation_id":"a3c4e44a-af0c-4238-9ed0-9d3ae8b95f91","resolution":{"observed_at":"2026-08-04T23:46:51.573559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02279/citation-record","integrity":"/paper/2507.02279/integrity","json":"/paper/2507.02279/citation-record.json","paper":"/paper/2507.02279"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:38:27.564674Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.564674Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d02f84a72d594edd4217f336f663718fafddadf066a5b1deabb91414bb81e945","observation_id":"45eb87ab-6ff5-493e-a973-cf7ec64bea59","resolution":{"observed_at":"2026-08-06T20:38:27.564674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.745863Z","title":null,"venue":null,"work_id":"91873c39-f082-4fcd-ba64-34ffff7dea98","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.608723Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:f2814adc9de0cdaec05f9fdf7af92bcd9291670c01654a1d8c79fae2697cda89","observation_id":"96eb1822-64cc-4d7c-84a2-ac44ece64baf","resolution":{"observed_at":"2026-08-06T20:38:36.847545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T20:38:27.710290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.710290Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:35832ef77ed3c30e5e7f5021049d41f70260b25f5aae48c882262133bbc895ef","observation_id":"7d6fbd43-f331-4876-80a2-74e42192b808","resolution":{"observed_at":"2026-08-06T20:38:27.710290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.571370Z","title":"Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yuxin Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"f8125af1-b66b-4eeb-815e-c32c16e88e75","year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.786377Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:2572a3cf87c1ed2c0e90a36afdf8c8fd7df364c579547930a59cfa08e2523d03","observation_id":"56be8d51-f16c-42ba-8ff6-0a3146a356c9","resolution":{"observed_at":"2026-08-06T20:38:36.660592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.369944Z","title":null,"venue":null,"work_id":"c3abaf50-d97a-4bea-8eed-1f85dba7982f","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.867184Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d31d6f9976e1d2e89788de1c2a0e290dae19365a4ccde7549b0a5ff686aa7454","observation_id":"77b8ae74-2198-4544-ae4a-36cf17682180","resolution":{"observed_at":"2026-08-06T20:38:36.463665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-06T20:38:27.955343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:27.955343Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:40603b9c310f0364c928a62ddc059f9905255caac2573e49163fe575e7972b9a","observation_id":"4bd692fd-34dc-4c9c-b8cf-9769beced048","resolution":{"observed_at":"2026-08-06T20:38:27.955343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.186684Z","title":null,"venue":null,"work_id":"b52f3885-0232-47d4-939a-718b90a01cb1","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.050513Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:95c9d9a71553ce82c4ed8db939eb6e05ad97747c6f5975714aa9d3c4bb36e059","observation_id":"6613ff63-f640-43a2-9ede-d4c90e2959af","resolution":{"observed_at":"2026-08-06T20:38:36.279083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.026641Z","title":null,"venue":null,"work_id":"90cf60fd-ff0f-4fd6-bb0b-71e5ba0dbe13","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.116856Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:bc78b56f16f10180449b0d734bcec27c71ac4cdd0f00b119eef0c6c6f25039b9","observation_id":"75d88921-2c27-4bab-85c8-9e2c495c3aa1","resolution":{"observed_at":"2026-08-06T20:38:36.099822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T20:38:28.170493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.170493Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:7f8699847b1b7c822adaaa3a8ef01d8b967fd0d8baab588d938396ceae265534","observation_id":"caede71e-f96d-48ed-a41c-f6beb86262e0","resolution":{"observed_at":"2026-08-06T20:38:28.170493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T20:38:28.234804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.234804Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0380e66fc76c4558cbf607cba0146cc0d704069b5e4879d778f69f20520d7fed","observation_id":"e1e7c77a-1365-4953-b547-1bc2f226a3bb","resolution":{"observed_at":"2026-08-06T20:38:28.234804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T20:38:28.279660Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.279660Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:5ae6cd10495f5757c02f4d4ef3e93bfd03e6716efef8cc2befdb5c8943d1fa42","observation_id":"cd48b81d-8482-4fdd-a5c7-a0573699a3de","resolution":{"observed_at":"2026-08-06T20:38:28.279660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-08-06T20:38:28.365050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.365050Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:42d58c9412d942edab5745c0df734f8aa15c95367b197878899e1c192cda444b","observation_id":"bd4da050-87f3-4fbe-a149-ff457942a408","resolution":{"observed_at":"2026-08-06T20:38:28.365050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T20:38:28.429443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.429443Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:6c395c4de11a823802b45890ca7ec4bcbf279aebf980d5267ea565cd454af3fb","observation_id":"6f6ae646-e0b0-4d41-84a5-e53dd7dd9545","resolution":{"observed_at":"2026-08-06T20:38:28.429443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T20:38:28.510632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.510632Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:87b839beb9ccea7769194a010da0180beb1771314192e207e14cacdc7c033d64","observation_id":"bc6868f7-3f3d-4eb3-beb1-bd800e08d314","resolution":{"observed_at":"2026-08-06T20:38:28.510632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T20:38:28.573025Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.573025Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:dfec2938eb81630bdeaade20c9e8eaa071df8a506a3f75ad2caf506932de02f5","observation_id":"c3e5d3dd-996c-4798-870b-8f3b917fb0bc","resolution":{"observed_at":"2026-08-06T20:38:28.573025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-06T20:38:28.632831Z","title":"Susskind, and Alaaeldin El-Nouby","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.632831Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d1083a1558258afda5878ad317f31aba0a93ef2ea006e27931492c867258a349","observation_id":"a26c49c9-2976-4085-b180-0cb9d3af72cb","resolution":{"observed_at":"2026-08-06T20:38:28.632831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T20:38:28.675201Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.675201Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:969368e58f77e6bb890b9d1f0df4ee0718b9b04da08ace8830463da9efa83cda","observation_id":"d9b2e771-522f-4535-b467-592bbc13bcc1","resolution":{"observed_at":"2026-08-06T20:38:28.675201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T20:38:28.730737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.730737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:dc1679fb130c1a0452eafe3d1088ad9d5ed48aea0e6620a636fde02e8570fecf","observation_id":"e1a4f98a-1838-4266-8391-2cfa32afdb38","resolution":{"observed_at":"2026-08-06T20:38:28.730737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-03T03:13:48.042761Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-08-06T20:38:28.791020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.791020Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:0662c1565b622cd1156a71ddd9ef1d763888dd84a6c8f833d439d3a310dd2f0a","observation_id":"f6c081ea-a824-4099-9d7e-dffb9f08d1b4","resolution":{"observed_at":"2026-08-06T20:38:28.791020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10584","last_updated":"2018-08-31T03:15:28Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:15:28Z","title":"Learning to Describe Differences Between Pairs of Similar Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10584","snapshot_observed_at":"2026-08-06T20:38:28.839944Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.839944Z"},"links":{"cited_paper":"/paper/1808.10584","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:fab3a2e7b44269775da5c31a70071c10c4f3b76ff1d49ca22e50bd0be74d95f8","observation_id":"684a27d0-e59a-4b31-838d-91b7f8f1041e","resolution":{"observed_at":"2026-08-06T20:38:28.839944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T20:38:28.915132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.915132Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:fbb462fffbee6f5f69e005bf84009bf90a0be31d51294e43607973b4681f4bde","observation_id":"96fb4c26-88ca-4001-acb5-51d0716555fa","resolution":{"observed_at":"2026-08-06T20:38:28.915132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-07T19:22:55.853637Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-06T20:38:28.998815Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.998815Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:670b85026f8fafc29869a0f23818f330c268fb55093b4c8089cc31b39d03236e","observation_id":"18b1bc50-ac44-491b-acfc-06a6ae011c74","resolution":{"observed_at":"2026-08-06T20:38:28.998815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02745","last_updated":"2025-08-06T07:03:19Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-09-20T10:50:21Z","title":"AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02745","snapshot_observed_at":"2026-08-06T20:38:29.091565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.091565Z"},"links":{"cited_paper":"/paper/2410.02745","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:7c09006c05684405a19ba734fe95488463d9fa2fd829f6b7f5b6978aa4e1710b","observation_id":"ea5fccea-bfb3-473f-a75a-2b4aa61e554d","resolution":{"observed_at":"2026-08-06T20:38:29.091565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:29.185593Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.185593Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:73e707bd32661993aedc05942e6c7a6347dd4defbfd73e6c489ff84928006617","observation_id":"a9809df1-5b6a-4630-8349-c8edef12dc28","resolution":{"observed_at":"2026-08-06T20:38:29.185593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:38:29.262223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.262223Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:aaede87dbd142ddcf2d1eba437881dd91b9261a2b0d071e5ebdfb2b793eb6b16","observation_id":"01d5f8f4-2618-49d7-8e6d-ff9664f1b977","resolution":{"observed_at":"2026-08-06T20:38:29.262223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T20:38:29.356941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.356941Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9e0cd9bf6e1e047234324669dcfea1c755f8c252e43eb67c920091d93f05133b","observation_id":"f51bc516-a37c-4429-bd80-b08dcedba05f","resolution":{"observed_at":"2026-08-06T20:38:29.356941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T20:38:29.433115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.433115Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:89b8e8369fbdb52148e5c58181ff1ac9a4efef2d4bb70c2bd8d280ed8abc86af","observation_id":"34958276-5601-46d2-a9fe-fc054773bdba","resolution":{"observed_at":"2026-08-06T20:38:29.433115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.926453Z","title":null,"venue":null,"work_id":"e82db2b7-0cbf-44d8-8446-cb593775e557","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.493720Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:53d730af8b7ea3692fab3347feefac53c30399d94109dce9485f4353816493ff","observation_id":"ff1baa90-96ec-421e-b2f2-4d87c4cdd1f2","resolution":{"observed_at":"2026-08-06T20:38:35.974131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T20:38:29.543299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.543299Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:88a72439f0d16d3fac71826c0bb4218e9d1f0acbe32ce5588311a5616ce68bba","observation_id":"c934db64-3e50-42a6-b795-2596f8f744e4","resolution":{"observed_at":"2026-08-06T20:38:29.543299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.766090Z","title":null,"venue":null,"work_id":"28d67c8f-bf75-420a-90ad-798767510fd6","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.601889Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:249e57cde2272eac450f4c58eb5bee105f04ac3d6c51c6737e5e5cb0faec58ac","observation_id":"3402898e-e1b4-46ec-bee6-7ef9ab791b52","resolution":{"observed_at":"2026-08-06T20:38:35.857868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.560684Z","title":null,"venue":null,"work_id":"0d633d8b-cb27-428f-840d-b9c656776131","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.707324Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:ad24add2a3f1c3a7647a1af7fefd94a9588b52cbe89a0a9d05a127e0fba30f50","observation_id":"f2a2ffec-66df-4cda-a57d-fab3e0840b24","resolution":{"observed_at":"2026-08-06T20:38:35.670119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:29.802220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.802220Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:f26f3a31b266a1cfb1d23ad7a859a554d6ae5e4c5e4c72bf44689c894cb3bbc8","observation_id":"e87ff870-e169-4340-b05f-d5365e1ee444","resolution":{"observed_at":"2026-08-06T20:38:29.802220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T20:38:29.866140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.866140Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:5b3c728007134f1e420f43ac08599513ea57b30ad33f3483aa9bc046f5902bd3","observation_id":"9ce3b2bb-fc0d-4ffc-9dd8-2b404bf4b475","resolution":{"observed_at":"2026-08-06T20:38:29.866140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07306","last_updated":"2023-11-13T12:52:29Z","snapshot_observed_at":"2026-08-03T21:40:55.534458Z","submitted_at":"2023-11-13T12:52:29Z","title":"What Large Language Models Bring to Text-rich VQA?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07306","snapshot_observed_at":"2026-08-06T20:38:29.985659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.985659Z"},"links":{"cited_paper":"/paper/2311.07306","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:3b37d95bedd6d18a8b821f742107ef8aa7a9c94e02ac98dbd5996c0f90f1d427","observation_id":"6e178c9b-eb14-4504-aba2-7da9adfe3b1b","resolution":{"observed_at":"2026-08-06T20:38:29.985659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.292864Z","title":null,"venue":null,"work_id":"8b73116a-0d5a-4da7-ac33-0ba1ea83ee4c","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.023977Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:262a84bc21f0e47f1cb8e0035e19dcdade2aaff366f00dd7c0e9cd6596dcebc2","observation_id":"8b7a0d1f-f32b-45fc-bde1-3cc079cb8293","resolution":{"observed_at":"2026-08-06T20:38:35.424039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-06T20:38:30.064975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.064975Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c18481eb5525c303802d7bc7cc614dfa0f0ee3f720bf7590ec1cb535d1b045c7","observation_id":"48ae9154-6455-4740-9750-a32c2ad19818","resolution":{"observed_at":"2026-08-06T20:38:30.064975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T20:38:30.134630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.134630Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:262b25f7a64dfc6a389ddf5a3442de84d2f57ff92d855cd66918ddf23a287967","observation_id":"468d22ad-8ab8-4b9f-b59b-9d312cb0db29","resolution":{"observed_at":"2026-08-06T20:38:30.134630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T20:38:30.194895Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.194895Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:8b63ac2a96c46bfa5aabfe78bbb10505d968453a9f83b9cf172db2da25de0aa8","observation_id":"b1200b95-bdb6-409e-ab62-b0f44ef5bc3e","resolution":{"observed_at":"2026-08-06T20:38:30.194895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.044066Z","title":null,"venue":null,"work_id":"805ae31c-9d93-436a-af8d-c9d83f4ee2f6","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.266880Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d9b2ade2b6de9c4e9c83ce5d0c3f4a4a5add66c8ab271c701ba74056085d0517","observation_id":"23e8eb76-4365-4923-9169-307a01d86f3e","resolution":{"observed_at":"2026-08-06T20:38:35.163832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.824349Z","title":"Manmatha, and C","venue":null,"work_id":"89b329a1-699f-47fd-bce3-fe65ab49575c","year":2020},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.391497Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:decdaf46e7bf2b0a7577bd3e8f6a517314ec436d44512403afdb0e7ca4cf10c2","observation_id":"430a8010-0505-408a-a53b-b1ddfc928d89","resolution":{"observed_at":"2026-08-06T20:38:34.905992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-06T20:38:30.481104Z","title":"Koster, Junlin Zhang, Stephanie Winkler, and 5 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.481104Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:9b9affabee2e3f99128468ecaaa4801a7b34ed514cd37440a276044fa983e281","observation_id":"bdd09533-6b82-46f0-921e-33d77498e756","resolution":{"observed_at":"2026-08-06T20:38:30.481104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13706","last_updated":"2022-02-06T10:20:16Z","snapshot_observed_at":"2026-07-06T12:22:43.206246Z","submitted_at":"2021-12-27T14:28:04Z","title":"Multi-Image Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13706","snapshot_observed_at":"2026-08-06T20:38:30.602789Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.602789Z"},"links":{"cited_paper":"/paper/2112.13706","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:b1d933488ee20cd8d3c874cf62c9b33d70a6df80a97d04308fb1aa4efa627b3e","observation_id":"f0c5378c-1977-4616-9ceb-5d27526d1c01","resolution":{"observed_at":"2026-08-06T20:38:30.602789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.603086Z","title":null,"venue":null,"work_id":"c4d6bf40-e8c5-4725-9bd6-096b952e75b9","year":2022},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.689621Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d3f67b7890d1bc53b8fc417da7b367bf6b66d9878a25c8b2b05de8d8d5efc717","observation_id":"f07f6cfb-786e-498d-83da-39dd7c4785f2","resolution":{"observed_at":"2026-08-06T20:38:34.718389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:30.765419Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.765419Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:4d6deb9a40025eb64c041ed752257d8663be6e11e5dfeff0b4b41ae6369b9b77","observation_id":"067556ee-575c-437a-be1d-9ef6674c6a55","resolution":{"observed_at":"2026-08-06T20:38:30.765419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.380941Z","title":"Aitken, Rob Bishop, Daniel Rueckert, and Zehan Wang","venue":null,"work_id":"237d03a9-bb53-421d-919e-c338607cbfbc","year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.808494Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:e690994466c062c9e589d2081f08b3f3c178948367a6f01924d1755ac9a68e14","observation_id":"7e27a2d7-5a94-40e4-92bb-6e9d5a6a233a","resolution":{"observed_at":"2026-08-06T20:38:34.482370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.149054Z","title":null,"venue":null,"work_id":"9ca68383-b8d4-41a2-8f95-2b945d277550","year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.870943Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:db72acb0f8455f3a1463b072729c0b9c60dff2cf7ded2a012cfd4f6738624ac1","observation_id":"d92d97ae-7ffb-4016-9bdb-12e8a7830f2e","resolution":{"observed_at":"2026-08-06T20:38:34.257481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10411","last_updated":"2019-09-23T15:10:41Z","snapshot_observed_at":"2026-07-06T08:23:53.657345Z","submitted_at":"2019-09-23T15:10:41Z","title":"NLVR2 Visual Bias Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10411","snapshot_observed_at":"2026-08-06T20:38:30.958476Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.958476Z"},"links":{"cited_paper":"/paper/1909.10411","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:525b68cc31a1c8072c01b50c88a59113c06454c3521fd0999b75aa07dd24a4fa","observation_id":"7482c423-93bf-4643-bbc4-1e277a0f76ca","resolution":{"observed_at":"2026-08-06T20:38:30.958476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.03968","last_updated":"2016-04-13T20:27:43Z","snapshot_observed_at":"2026-08-05T23:43:02.349652Z","submitted_at":"2016-04-13T20:27:43Z","title":"Visual Storytelling","version":1},"cited_work":{"arxiv_id":"1604.03968","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.03968","snapshot_observed_at":"2026-08-06T20:38:32.542046Z","title":"Visual Storytelling","venue":"cs.CL","work_id":"6d37914b-f659-4970-9d74-117ec20d3bb3","year":2016},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.090662Z"},"links":{"cited_paper":"/paper/1604.03968","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:bf94e7d0b4f7a275de18c4654325c7feec34688b703070e501496104e9000951","observation_id":"b850ff87-f508-44f5-92d4-3fc5b3d01f4d","resolution":{"observed_at":"2026-08-06T20:38:32.685743Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-06T20:38:31.214733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.214733Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:fbed6800af925a06cdb8f3836c4424e9974320292192677328cb3d83f1ae63b7","observation_id":"7c35b610-cf1d-493e-9a50-fdb95330df3d","resolution":{"observed_at":"2026-08-06T20:38:31.214733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:38:31.337702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.337702Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:4b41dc7c34c89eff68758502c75b497f92033ff1203d625e790a173b84d1e8b1","observation_id":"e360d848-1f3e-45bf-bdc2-152f0015cf5e","resolution":{"observed_at":"2026-08-06T20:38:31.337702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T20:38:31.429497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.429497Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:570cd8dc695382f11c9eef86418e4e449235fc29781b052b8283affeac9f61fd","observation_id":"a47cc575-87af-4819-83cc-515df417841f","resolution":{"observed_at":"2026-08-06T20:38:31.429497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-06T20:38:31.498256Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.498256Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:f75e007c96acc59925cae2409024240f1906e10e4040cb7f6f7ed1e0739411d1","observation_id":"a3c78e87-7777-4fb2-900b-a218944e0aef","resolution":{"observed_at":"2026-08-06T20:38:31.498256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.916301Z","title":null,"venue":null,"work_id":"a9851adf-dd2d-48e2-a653-8e482e387c04","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.606539Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:a37a7432a1dc08cb584612f9d5b21d4cee42b67173f4ec05d2f6d5a95c060698","observation_id":"2f4c5067-3c3c-4df1-a3a6-4bfeb82af34f","resolution":{"observed_at":"2026-08-06T20:38:34.028934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.678076Z","title":null,"venue":null,"work_id":"3b3413a2-7fe6-4a09-a68a-4a733656faea","year":2021},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.676473Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:cccaf24dbbc0f131220ccbef8b2ff71579e1a70d57015be10b64c3d65445bfab","observation_id":"add12b7a-b9fe-45c0-9bb7-5b3f252d9128","resolution":{"observed_at":"2026-08-06T20:38:33.776607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-06T20:38:31.752838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.752838Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:be7d95b95aa4d4b1f8398aa690e3e9cb5f07b0c39aabc3a7c8cfc8f6ebacdb80","observation_id":"35d14d73-0835-4788-9491-3e49152ba743","resolution":{"observed_at":"2026-08-06T20:38:31.752838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T20:38:31.911548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.911548Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:5857f75f73d26139f6632f20ef44cdb121f25cfb494d6092f624e1415fbc4d19","observation_id":"dc5ccaf7-9a03-4a84-91d1-53fc6ca88fb7","resolution":{"observed_at":"2026-08-06T20:38:31.911548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.457568Z","title":null,"venue":null,"work_id":"07ce893d-678f-4068-948f-98b298a5922d","year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.007214Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:a0973e3d7e2601baec23e9ee176ab6e119aa25165aaed1ccf44ef11fdba136f0","observation_id":"b038f03d-4685-4341-9e43-c500f903b73c","resolution":{"observed_at":"2026-08-06T20:38:33.582663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.253720Z","title":null,"venue":null,"work_id":"4869be9a-5d0e-4801-a94c-1129d70f0f34","year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.115722Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d0ca4f288ae170fe179a6f797ab375b660aeb79c5812ef5275690ba39c4f6955","observation_id":"2329d619-41dc-479a-beb6-cceeeb518c2e","resolution":{"observed_at":"2026-08-06T20:38:33.337407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:38:32.171118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.171118Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:e1b4a4f774edbafc5eb2f7e444fae86869f2a8743092b59ab915c0c60a8c3565","observation_id":"2041be15-4664-41e7-ab12-8b3cc899a4d5","resolution":{"observed_at":"2026-08-06T20:38:32.171118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.267160Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.267160Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:aee1fd1b62b69c2c062eb8cc3551288c19d5df06c94922d7a66d14bc1b14d58f","observation_id":"7fb6840f-d5aa-4419-bcfa-772a6a478385","resolution":{"observed_at":"2026-08-06T20:38:32.267160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.385290Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.385290Z"},"links":{"citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:c6f610dc0230278bbd0bd31fbf67e8630c472ff2a3a5027a0e259485b6c68776","observation_id":"0d020b1b-b650-46dd-942d-733f1c32d85c","resolution":{"observed_at":"2026-08-06T20:38:32.385290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 3 inbound Pith citation observations for arXiv:2507.02279."}