{"as_of":"2026-08-10T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40892af5b9711cbad4ffffa1956405ea1dc54217b6a85f3b49bc8b566b1e3753","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:23:40.585910Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02406/citation-record","integrity":"/paper/2502.02406/integrity","json":"/paper/2502.02406/citation-record.json","paper":"/paper/2502.02406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.403541Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.403541Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:883653add35cfd5b053e77b312186339cd4be71548da6386f63f3fd5fc173ea0","observation_id":"23cbddc7-6441-4224-8f25-fc14a084dbc9","resolution":{"observed_at":"2026-08-09T12:23:40.403541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.290601Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"d493d72c-4d42-4c81-ac2a-2472cb74f049","year":2022},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.409366Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:ec31943983c8fbed42e6112fc4705d07727bd48c724a18e8fa737ebf341e48ce","observation_id":"e68b4704-9172-4ff5-a8f0-b34c1ac43dd8","resolution":{"observed_at":"2026-08-09T12:23:41.294271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-09T12:23:40.414321Z","title":"W., Ilharco, G., Wortsman, M., and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.414321Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:de5aefec1a167688b69777e315407cc5cbaec4876c03c420153b4a542c612bd4","observation_id":"b4c60257-454e-4756-866d-3a71467c3e66","resolution":{"observed_at":"2026-08-09T12:23:40.414321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-09T12:23:40.420888Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.420888Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:d05e97477d79128206285e1952819b91b1d43f30dac44b9e55049a3c2bffe5b7","observation_id":"aebbd7d9-714b-4fd8-9d13-9663f9ba0898","resolution":{"observed_at":"2026-08-09T12:23:40.420888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.279732Z","title":null,"venue":null,"work_id":"b4e3db25-4367-4261-8248-e21d0b483a64","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.425814Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:5d0b117d45cbd0fb3899ef5068bde993af8726ea14f3bc7b5312f8dbaed9ccfd","observation_id":"5318c903-e261-442d-ae39-3add2963c798","resolution":{"observed_at":"2026-08-09T12:23:41.283500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-09T12:23:40.430129Z","title":"Striped attention: Faster ring attention for causal transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.430129Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:7aef090ff2c70eb2a8c8424ac4e4e7e72dfc61dba5c9f49c53cee656696a4bfd","observation_id":"441df307-bd25-4c85-acb1-14b589bc797c","resolution":{"observed_at":"2026-08-09T12:23:40.430129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.434769Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.434769Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:96cda66c737e3a318ec5f0c89ec1d5640a4e9c7c283d6c4c518f69e77954c365","observation_id":"2e4acc3f-d938-4512-af51-bd0dea97e9e4","resolution":{"observed_at":"2026-08-09T12:23:40.434769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.261827Z","title":"Adapting language models to compress contexts","venue":null,"work_id":"cee1ab2e-8e15-47cd-8348-b299e45514ab","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.439586Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:1b14b3c3d7aa398729a253dfc10eaa51954d15f06d29b3e473d85291c8950848","observation_id":"9df26055-1cd8-4052-94ac-2ce8b2a4c3f7","resolution":{"observed_at":"2026-08-09T12:23:41.266075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.443931Z","title":"M., Likhosherstov, V., Dohan, D., Song, X., Gane, A., Sarlos, T., Hawkins, P., Davis, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.443931Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:506ccf0000cf7eb329b779bcf52b819b1b3716c5a5852be2814890702b0e7c46","observation_id":"7c55aa77-e64d-4ed6-afcb-cd2196b2a9dd","resolution":{"observed_at":"2026-08-09T12:23:40.443931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.244331Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":"f5aabe07-d663-4b4b-bccf-d1879c4fb603","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.448162Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:d7d6acec2171c24871ec6e6a7a0005e4db645c9de3977e62f3c35d58d25e29a7","observation_id":"be44c55a-50ac-41c7-b535-6ee346f5d340","resolution":{"observed_at":"2026-08-09T12:23:41.248285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.452814Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.452814Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:2d2f8b18da7aa5c6fcf9404e93225434964ad40b638ed7c31a6eb8782ae19cbb","observation_id":"55554418-4064-4083-ad50-9ffaf6b3814e","resolution":{"observed_at":"2026-08-09T12:23:40.452814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.456933Z","title":"Y., Ermon, S., Rudra, A., and R \\'e , C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.456933Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:e1f5abda59e180c9fccc87ee736bd4b9a0eff38f7e944af583787b669644f73f","observation_id":"cb45b3b9-ddf3-4fa4-8e70-4bd743cb4629","resolution":{"observed_at":"2026-08-09T12:23:40.456933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.220839Z","title":"S., Monga, R., Chen, K., Devin, M., Le, Q","venue":null,"work_id":"129243df-d21b-4200-9593-ee9de0b60a4a","year":2012},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.460640Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:2fe451b05e993ee89cb5909e0246d57ab424bc2187534be19050dfeac512a794","observation_id":"94261df9-98b0-48d8-bc7a-1e5e3ce7da21","resolution":{"observed_at":"2026-08-09T12:23:41.224522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-09T12:23:40.464868Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.464868Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:be500256276fd1a37c4f1a7823db9e55684b58d508d3d25395bbdf803caa7920","observation_id":"aedfadff-b42b-4e90-9a3d-fa558079e64d","resolution":{"observed_at":"2026-08-09T12:23:40.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.210149Z","title":"The design and operation of CloudLab","venue":null,"work_id":"db558bf5-8431-4120-b1c9-de3641f2c3a9","year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.469166Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:24a5cadc952db0849ac15211ecf036384ca6bb4a005cc792f1fbda24987019fe","observation_id":"d60cc123-5f52-4e57-800f-b4b14048891c","resolution":{"observed_at":"2026-08-09T12:23:41.213838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-09T12:23:40.472983Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.472983Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:538a5488d7675a6e125f6f13a17be36df19d1b13323a8470f5ece6f6514735a8","observation_id":"3224933a-38ff-426d-b9eb-2025c44d3273","resolution":{"observed_at":"2026-08-09T12:23:40.472983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T12:23:40.477312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.477312Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:e02eaaf06f278ac284c206ff2a37621a0e91194738577494fcc6206425ed70f1","observation_id":"c7b5788d-0ecb-4cae-808c-301145995424","resolution":{"observed_at":"2026-08-09T12:23:40.477312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73010-8_23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Llava-uhd: An lmm perceiving any aspect ratio and high-resolution images","venue":"Lecture notes in computer science","work_id":"e707fd01-bc1e-42f3-a986-4ccd98532e22","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.481945Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:caa4c317feddea7c37ee7b796035d526a0d7ecc30a2fd6729c5134e8d95b20a5","observation_id":"eeeeecb0-6ee5-478b-bb91-1eac35ee2559","resolution":{"observed_at":"2026-08-09T12:23:40.634688Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.199567Z","title":"K., Jia, M., Cao, X., Shah, A., Shrivastava, A., and Lim, S.-N","venue":null,"work_id":"e60d841e-0805-4e61-9aad-c4b2ed897312","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.485838Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:8a7ccdf0deddeb8ad76f0e7eca8a05e8942feeae9efde6945be9db024304151b","observation_id":"1d2b86f3-3ce3-49ee-bac1-a38a8925cbb3","resolution":{"observed_at":"2026-08-09T12:23:41.203438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13250","last_updated":"2024-05-16T12:23:05Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:58:54Z","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13250","snapshot_observed_at":"2026-08-09T12:23:40.491200Z","title":"M., Ho, N., Yang, X., Nagarajan, T., Torresani, L., and Bertasius, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.491200Z"},"links":{"cited_paper":"/paper/2402.13250","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:568b660db06ad546e09319a48cdaca6709a8d8f06ec2316809b332dd0aad371e","observation_id":"e1ddd6bc-bfa5-4fc8-9098-56725910e111","resolution":{"observed_at":"2026-08-09T12:23:40.491200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.495082Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Aminadabi, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.495082Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:faf512c7d082106e610a01ae5b01a1baf5c66103e6720308b7b795455cbc6086","observation_id":"63d306a6-146e-47f2-b971-f1a38d53bb57","resolution":{"observed_at":"2026-08-09T12:23:40.495082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.498688Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.498688Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:66941259479741c566a429650657314820dc970ea9f8ba844287e80ceb58edc2","observation_id":"9ee31d37-2d85-4086-9cd2-7a58eb10fbae","resolution":{"observed_at":"2026-08-09T12:23:40.498688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.182269Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":"d85247da-9835-434b-a00f-f4bac6944dbf","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.502235Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:690e07b2a9a723571070e07f2381f586a6d901409d368052d2b148afa2789c9b","observation_id":"dd60d2e3-059a-452a-a70d-ae25d0daed60","resolution":{"observed_at":"2026-08-09T12:23:41.186213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.171445Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":"7e28e92b-9df9-42f9-96a2-dff5a0c2b944","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.505912Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:08bc72491264c6a3190ca8cbde10be2dd7867249c799a109e4107cb400568e4c","observation_id":"7f6189eb-792e-44ad-a149-da35816a6ff4","resolution":{"observed_at":"2026-08-09T12:23:41.175383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.160690Z","title":"M., Kiela, D., Cord, M., and Sanh, V","venue":null,"work_id":"769c6134-6d7f-4acf-911a-8cf1ad0bf51e","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.509643Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:f3d62f6a60a20318a75c3c544f886b82f97794b23951396e14f77addb2f6e81d","observation_id":"83f57cc7-d32f-477a-9dda-d00ed98de030","resolution":{"observed_at":"2026-08-09T12:23:41.164568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-09T12:23:40.513418Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.513418Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:db7db6233e6f4a2936a711a2030a80784be7481b2cb384d5c71b2703266ebf17","observation_id":"2460e5a7-2fbb-46b3-a919-30a1280278e6","resolution":{"observed_at":"2026-08-09T12:23:40.513418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.149992Z","title":"P., Ma, X., Stoica, I., Gonzalez, J","venue":null,"work_id":"005cad87-7dd9-4839-a6a7-d7713e880706","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.517456Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:74578a6d4f0506343df0f9cc5ca3a67c5a4d436b7eae6996b21e463c9a78f475","observation_id":"d60026c8-84b5-428f-9b58-d1c9ec52e47d","resolution":{"observed_at":"2026-08-09T12:23:41.153717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.139241Z","title":"Blip-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0f91c659-4000-43a9-8e59-b5c1f228b6be","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.521288Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:391775219719e5bc85788a78182463948ce54525c16caf967dfa797709112521","observation_id":"be1f82a0-b4b0-4d61-bfd9-1e27e0cb9e6d","resolution":{"observed_at":"2026-08-09T12:23:41.142932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.128198Z","title":null,"venue":null,"work_id":"9197c195-804c-4278-88de-edf77403c965","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.525030Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:fad9d16e6c4e9e1bd3b59664f580abde9e201104b3733da5075f05e9a888f637","observation_id":"fd1e80ac-e63a-4310-a9a9-39bf3e74e556","resolution":{"observed_at":"2026-08-09T12:23:41.132089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.117315Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":"7cfd635a-8d05-46b5-b99a-182e95c7d711","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.528809Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:b0f03f58d71c155ec10e7d9ceb9fb774abad5876115f72baa6e409a15e210e60","observation_id":"d7881f19-2f4d-4c98-a88c-a836db4bedd2","resolution":{"observed_at":"2026-08-09T12:23:41.121090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T12:23:40.532423Z","title":"Nvila: Efficient frontier visual language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.532423Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:0dfd0581c721afbdfd60aff72790abf01f68d813e67f4ebbc0a25021c4f4e983","observation_id":"e6297378-2b6d-428a-b06c-488d05e77eee","resolution":{"observed_at":"2026-08-09T12:23:40.532423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-09T12:23:40.536435Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.536435Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:f90db7d9c3c9a69e47f5483e18f4aa07927fa94c90ca0c7d58b1f2372adca346","observation_id":"a8989cd5-06b8-40c3-b946-9947e56522ca","resolution":{"observed_at":"2026-08-09T12:23:40.536435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.540566Z","title":"R., Ganger, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.540566Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:4f77a5ee98b9cbacce924610535a8e05c0b968f5409b22c171d2e7e6b365a60e","observation_id":"b5554898-8713-4103-9a92-9742951063dc","resolution":{"observed_at":"2026-08-09T12:23:40.540566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.106066Z","title":"Momentor: advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"9f40871b-d87d-43c8-a302-6a02761f09d6","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.544509Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:0c3d2272044332f6a8d71ab1db5ad11a554fcda0a53a938517be2b0594271d85","observation_id":"74ddb37f-4cc6-4e0e-9864-635d472ea920","resolution":{"observed_at":"2026-08-09T12:23:41.110012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.548348Z","title":"ModServe : Scalable and resource-efficient large multimodal model serving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.548348Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:44c50a0023e9617d3863eb0a2b38e573828701c7acc105d3904ad07eef3c8e71","observation_id":"db78e0b2-276a-4709-99f1-bd534e6608c5","resolution":{"observed_at":"2026-08-09T12:23:40.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.094881Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":"5d11c534-60b5-475d-a102-45fed3dbcc90","year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.552540Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:a94803034e046ffa0c6eda77fc39d466ee8f983364dff4ae0c304760ff5eb582","observation_id":"06db48e3-66b4-4590-8a0d-9129585b9bbc","resolution":{"observed_at":"2026-08-09T12:23:41.098690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T12:23:40.556139Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.556139Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:2460187231ff9ad3cf2ba1b1b1b1f2cfd2b893c310217659f24e32d31f659beb","observation_id":"379d8cdf-8b39-4175-8596-df4581f53c59","resolution":{"observed_at":"2026-08-09T12:23:40.556139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.083490Z","title":"Repository-level prompt generation for large language models of code","venue":null,"work_id":"be74fffb-35e5-4d1d-bdbb-9f13aacb7735","year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.560141Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:4b4d468209a3b2b11c1b539c9006b2855cd5f463824c61b57a61b16f85f91cf3","observation_id":"ba04c592-e6b8-4068-9537-dc810042bf83","resolution":{"observed_at":"2026-08-09T12:23:41.087584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.070864Z","title":"PEARL : Prompting large language models to plan and execute actions over long documents","venue":null,"work_id":"66b5ed76-a2dc-45a3-bbaa-9672e7d54872","year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.563745Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:50165d5c3d43fca50643801aa44e89441b013dc85717359db48a2dfcdd2ecd41","observation_id":"6895e989-0ca5-4de7-a58c-b953c8279411","resolution":{"observed_at":"2026-08-09T12:23:41.075061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.567345Z","title":"T., and Cox, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.567345Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:add6acee7e07f09c9acbb06f7fb789f40a052364375d71daf2255b3eef70d03f","observation_id":"a06ddf6a-335b-4569-b1f9-33d6e3a8227d","resolution":{"observed_at":"2026-08-09T12:23:40.567345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.570913Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.570913Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:3958de6d6883ceee45b1e33695f45070ff51ad9a2ecf00874ca9aef502ba8ba0","observation_id":"835f1694-a240-4085-bdad-6310f2cb8dbf","resolution":{"observed_at":"2026-08-09T12:23:40.570913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-09T12:23:40.574541Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.574541Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:76e3d6c118f0555c923814b53e2145f69eb4aaa3679de4951943698e840c486c","observation_id":"c1dc54ac-ab78-4c1f-acee-58b39e7581c2","resolution":{"observed_at":"2026-08-09T12:23:40.574541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:41.054192Z","title":"Big bird: transformers for longer sequences","venue":null,"work_id":"e07a67e6-35f7-4b56-acab-17566e7a6526","year":2020},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.578333Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:c7a22fc902877dfe7fde4311f460a44246d6ce69f8a924c3e36ba473930131c1","observation_id":"5c79bfde-886f-459b-bfcf-e69046163793","resolution":{"observed_at":"2026-08-09T12:23:41.057941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.582047Z","title":"R epo C oder: Repository-level code completion through iterative retrieval and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.582047Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:7dc4e5ae86ec29dd243e43d202b4a7d44f6831adfbbca659258689648f126da0","observation_id":"5bd7e58e-7aff-40c9-ac3c-fb150b07ea85","resolution":{"observed_at":"2026-08-09T12:23:40.582047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:23:40.585910Z","title":"Mini GPT -4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.585910Z"},"links":{"citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:216340c3f745a07e75f9ddb7117dad207b18dea44848ccc41046bd130d1596cf","observation_id":"da7a0ffc-6d1b-4c9c-9f65-a080c283e80c","resolution":{"observed_at":"2026-08-09T12:23:40.585910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2502.02406."}