{"as_of":"2026-08-10T16:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86dc31c4f7ca17694ea874edef4e9416c681cc66072e07a2784d72a3b5e7e2ac","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:57:56.333595Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01503/citation-record","integrity":"/paper/2606.01503/integrity","json":"/paper/2606.01503/citation-record.json","paper":"/paper/2606.01503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Token merging: Your vit but faster, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:c8f02f88123ce6b6e0f6858cbb529726c459f5cdbb143106e358d3f337756126","observation_id":"bbfd7d18-a573-4d64-a687-e89dd65c2022","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:56a9647e260e9baec143dd4ed159755498e3fa28a90889c4608d189e7fe3258a","observation_id":"5182b6d0-8fae-42f7-8347-08ec0a408930","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:5cb4261fdf0daa195b73c45c429aa882641c7b8788af230f28838f9bc4e53fce","observation_id":"faa7894c-0022-48b4-a455-4aed482fb906","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:a0167ba0312d76cf758ea2110cb18dde627bcf78a98e0fdaeff7db444a5dda48","observation_id":"770372eb-6b43-4e78-8d0e-72b8116ef617","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:d043b18caf5a47b51ae439945357d9da2f81f366de2e5b9e0fe3a8eabb902cf7","observation_id":"ea0ef4b0-f621-4a27-99ac-9cade3a0fa49","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:48171ad5974604570475c974b16fd8602fdda4c4eed2d5dc65caa9f132fcc8cd","observation_id":"58521017-b486-4c5d-9016-065457d67803","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:ea27a41cf616eb9d0b19dd98d57e6e7a132855f92e0a68f42de16e5d0d96e7fe","observation_id":"44ff07d6-1c22-4cf0-9af8-e9d4234b7a7a","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:cc06c2a55e018f9c043755f5137f702e59bdfd4fcbf78eb42ef082d9d23ebe2c","observation_id":"38cf4303-dc7f-441a-8193-7b90a452f987","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Making llama see and draw with seed tokenizer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:061f8f36a11ece272967fce3eba6bf122c3cbc30ef994ceed82cde580672fbac","observation_id":"4db44839-f96d-4531-8039-1693ce4b100d","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":"2410.10781","doi":"10.48550/arxiv.2410.10781","metadata_source":"pith","pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","venue":"cs.CL","work_id":"ab480e70-3517-4875-81ef-6cc6fa6db46d","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:871758bd09aa492e54214ce970a25d94fd6a86ade82d77b0701606eab5d457ad","observation_id":"a8bcef66-4e17-4cc4-a754-1eb5699ce92a","resolution":{"observed_at":"2026-06-28T17:02:24.305996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:7e878faad7acb7a67913823b4a31aa7e24efda94f124adcd58dafeae6b6c39e3","observation_id":"f4be08c8-aa4a-428b-8a45-1e8138c42d1a","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Matryoshka query trans- former for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:4de386d73630f7faea976be8c65f134d74be1f697514307851c797de7549c1f1","observation_id":"157e9bb7-b29d-4280-af17-4e1a4c143bc3","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:00778251d50a880c734227e6ca8ac6fda75b408da20c5592e755f870d89ba502","observation_id":"ed59ce8f-b34b-40a4-8569-5e2f1db43333","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Unified language-vision pretraining in llm with dynamic discrete visual tokenization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:46830abafc3c2cb45f8c77aadfa8cd7a03cb238d3e76323bee63a67b2eee14c6","observation_id":"afdfbab7-b92a-409a-9f15-ace553f9f1a4","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:4f1bf63632577d7871fde5e4a2087334dd7c79b51da0a130e3554bf1c7f3ba43","observation_id":"42b01c53-b1aa-48ea-879d-453a84b3f40c","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:ee77e0e32ab6e6d77d08d7177c6b0858eded34f09959d9cf890c157649c47088","observation_id":"89ad5c31-298a-4fe0-8615-788fbc0fa72e","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Tokenpacker: Efficient visual projector for multimodal llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:ee92b1306c2e7cf3f1548c307412f6a9271074fe9be5421398acfd764c90f97f","observation_id":"98055ec9-bb71-4cd4-b80f-211c61d6739f","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Evaluating object hallucination in large vision-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:82cfd290350f05ba0ae87f6f9eb92e8a4a2d0b24850bf92e0a8e27a338f326f9","observation_id":"ff3921b5-542c-46d0-9329-ce3915b223b9","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:4c375756804c54add01860919084352fc022a773dcafa5e41bd20c5d2603317c","observation_id":"57a49fa9-51e9-4bd3-beb3-457280b55024","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:80d4db9cfb8aeb242d0cf2057ea25e94f771936d18b9efa21bf335d912eb635f","observation_id":"d5eef721-4e82-4b5d-8470-f6b1b6d05811","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:c644db7a861bbd09ec30f8e58699125440bdc1ecdaa2b73d07b36441c1b68096","observation_id":"fb79f693-dbb4-4cf6-ab19-5298c61918be","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:40da8e9782c905df1f175f6b7bd97b97d4193b78d014fac73e15cb3904e9effb","observation_id":"6c014e12-a6f6-4551-b5aa-80c8205add77","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:617229c3175393967e9e886eb62a10321dd44908b665eb8b5798f3666e5f76db","observation_id":"088db68e-ca28-4070-b332-7c9a29264fb8","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Cheap and quick: Efficient vision- language instruction tuning for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:25cfc989575e7303a40fe873d678f8dfb2d1e0efb785cff4da706feefa523980","observation_id":"c979e0a2-1a8d-47ba-90bc-5afa477b54bd","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Unitok: A uni- fied tokenizer for visual generation and understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:f67f62122ada8f99375859479b264db5be901e676442668b4b51c84929d76e53","observation_id":"a8922ebe-c7cf-4373-a6e2-f50dcad78f6e","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:01a463a9d38a406e42a9bd13d050405d3da45571bc561b99029472cb818ce90d","observation_id":"bbe35b9d-02d7-4e02-a0e8-9838de9541ca","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:f4a2b3659fe107136168e5dc15245ba37476a6d76a2fb9649df59c7b648bc937","observation_id":"ce0a3167-fc2c-44e5-aeae-5cdc2e55d129","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:3de28d54de3d7b064128b1fccbd8adf52c9b7cca395b33268fcb695555e3c1a1","observation_id":"591136e9-8ab0-4bb3-aecd-f36072565446","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"High-resolution image syn- thesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:a4247b9f6dd0710d5a3b88f729847fb78ea88c6094c76ee75a8cab6f93d78629","observation_id":"785be7f9-7aa4-4659-93e8-89dcb2eaaf4a","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.15388","doi":"10.48550/arxiv.2403.15388","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"6da9a077-fa9e-4020-bdb4-f30c9ebb0fc8","year":2026},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:f28c27f7aeeefd287b7a19e2e3bb66bb115adccaf5620bd8bdce4a8651ab82fb","observation_id":"e7be0623-05e1-4c85-9800-da718381a4ed","resolution":{"observed_at":"2026-06-28T17:02:24.309040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Journeydb: A benchmark for generative im- age understanding.Advances in neural information process- ing systems, 36:49659–49678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:907824bca5bc0dba0c56c159c7f616fb5e57ad6fdc2ee7f30f07bf19e5f0c88d","observation_id":"37ab29a8-aa8c-4d0a-9d2b-2eea94331399","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:508d533004cd25e387ea70f16f9ee171f74eecfb9ff5b77030834afab159c1ec","observation_id":"fddad9bf-4462-490c-a628-42401bd01eef","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:4771332071ef7ad11dc0ce8763ea9b64053608e872e457c1e889a3ca37f48f3c","observation_id":"5698df56-b8a2-4c2f-8be6-58ea4f5cf83e","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:b5258da0bacc86a0cb901ffe6e504b20a3eebd9887e3ef7852253b2b529ba6a4","observation_id":"066be97a-8f72-4f14-bf20-9d31fc2136d2","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:1d37773069405b91e6d8438fbb94a9c8c6cc972d293424a86d543482e414bc0a","observation_id":"98f9b6ff-325a-46dc-84d5-ef746b640c5d","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:0462a03156b861bf10a2990767c23199565e9afd03f676384f819fd37e8bf921","observation_id":"0f816c86-b247-4de3-8ea8-20d3a015286c","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:41e4d92695f2c1723403a73e6d9eb64bfdc541c2239a3c7b04eb2b13e1b8e366","observation_id":"2ab1316d-da58-49bc-8104-3f5b5c10c13e","resolution":{"observed_at":"2026-06-28T17:02:24.303829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:8ab4558fa5ce626f1b017588533aac4eccc0282cd6f2cc6e026510517ffb2ca6","observation_id":"510d55b9-c96c-44f8-8248-8422ac28ebf1","resolution":{"observed_at":"2026-06-28T17:02:24.295561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:b5d4cac3b9e089d2ac82730f65cbba4e9def107f60fd1f7f8886f5d9bac3c43f","observation_id":"6761f90c-f3e8-45aa-9e7c-f7abb418ae2c","resolution":{"observed_at":"2026-06-28T17:02:24.298245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Efficient streaming language models with attention sinks.arXiv, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:1ed28a9f1d0a7a55b31bb3757df1f42833bf785aa35d1b4fd99676b324376a51","observation_id":"af1e59da-4e95-4b36-a7f6-51e418c045df","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:8e7faf47bafea9a58ee83035e384c10fb2f52455f00a196300354968f956208c","observation_id":"85ede03a-5ba7-4186-8ab4-3cffc56e2544","resolution":{"observed_at":"2026-06-28T17:02:24.300518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Scaling autoregressive multi-modal mod- els: Pretraining and instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:7ed71046fcbbe13f9d58c15f88b74330308d615f697aafd0a7e1c1015c5ef774","observation_id":"248ee663-a3b4-4695-83a8-cd9e1cb45e9e","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:ea64026e2911a7e0c48e4ebac9680afadc6a7953a77c3e9d52e7cb411854aa5d","observation_id":"5bf6ecac-c1a9-4436-afa4-14e1ea516849","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"A-vl: Adaptive attention for large vision- language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:2e0679aebd7892676e332340f79a95788874c3884db9a231e25a5bc96fefe73c","observation_id":"3fcab27b-cfc4-4226-84c3-cffd89c4de0b","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:8c87941205f0f455b65b5d14a25ac6f9c725548e5647a89390c5f97a4f4229d4","observation_id":"3202d961-ff2e-4165-b8cb-f45f634bbcd5","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Himix: Reducing computational com- plexity in large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:3cb5fe482b5e6400db15be1940a42af1db5f345749e17f5146c23b7ffb5e6e7b","observation_id":"24525677-03b9-475a-a718-cc04d98432cd","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:57:56.333595Z","title":"Ar- gus: A compact and versatile foundation model for vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:31a9e2b152c44ece39c752a6ba311e3da1acb096483f7383f1dd339635de8d3b","observation_id":"ce075547-819f-487b-a606-2e0bc49fa037","resolution":{"observed_at":"2026-06-28T16:57:56.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2606.01503."}