{"as_of":"2026-08-14T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:852192934e78d3ac518ee5f530de3b8481998330d1a57a8f5ac0a715fa5202a6","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:39:51.010552Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09907/citation-record","integrity":"/paper/2412.09907/integrity","json":"/paper/2412.09907/citation-record.json","paper":"/paper/2412.09907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.776521Z","title":"Language models are few-shot learners","venue":null,"work_id":"870d13ae-8403-4af3-90e9-700cf61f7413","year":1901},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.777896Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:404bcb4c9409e6f93cd49a607491f087bf5f3f49ed46c7a1190038aa1c99d9a0","observation_id":"e02ffcd6-58d6-4a15-b389-789cab693e83","resolution":{"observed_at":"2026-08-11T16:39:51.780473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T16:39:50.783088Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.783088Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:2b179c23d6f8cb1079a02ca92c837c9fc35806db79bf22e1c7be216593e626f1","observation_id":"b8a991d5-6b0b-4def-930f-1a8017c5852d","resolution":{"observed_at":"2026-08-11T16:39:50.783088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T16:39:50.787925Z","title":"LLaMA: Open and efﬁcient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.787925Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:666726e70857b293df13129ab54bda202dd72d6761918f78d9e9bccca307f245","observation_id":"60d4aa57-f0f0-4aae-bcdc-fdc7841a407e","resolution":{"observed_at":"2026-08-11T16:39:50.787925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:39:50.792033Z","title":"Llama 2: Open foundation and ﬁne-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.792033Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:2082c98122ce91aa50807ea2ded095ae4e8719c90fa22c2c535dc97d6f0fbde7","observation_id":"ba488df6-c1d5-49e5-93d3-e8c434ff5840","resolution":{"observed_at":"2026-08-11T16:39:50.792033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T16:39:50.796435Z","title":"Lillicrap, Jean-Baptiste Alayrac, Radu Soricut, Angeliki Lazaridou, Orhan Firat, Julian Schrit- twieser, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.796435Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:a1b4d62223bdb899201c293c3f7de096eb4218bac227a144dfd17e477a462dd7","observation_id":"d914eadc-9670-4b8a-b592-a95e649f1f77","resolution":{"observed_at":"2026-08-11T16:39:50.796435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-11T16:39:50.801165Z","title":"Large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.801165Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:99597b080088767b135608d8bf0cd93f16c0359bb930a22da981501bac983bb2","observation_id":"47baf3dd-106c-437c-ab2b-4f3267a0dd2a","resolution":{"observed_at":"2026-08-11T16:39:50.801165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T16:39:50.805536Z","title":"A survey of large language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.805536Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:8d1b500953cc94b4e46a5e8a5d5e0fadd897ecf0b2106e0fdcb70ec96a20ae3c","observation_id":"93db207e-1bd1-4efe-864d-574316170933","resolution":{"observed_at":"2026-08-11T16:39:50.805536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:50.809349Z","title":"Large language models: a comprehensive survey of its applications, challenges, limitations, and future prospects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.809349Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:6beebd859b51986ded14c712095c3e9649e336f348e8d289a0499f78723ab378","observation_id":"198297c3-56fb-40a5-af1a-930268614b8c","resolution":{"observed_at":"2026-08-11T16:39:50.809349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-11T16:39:50.812759Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.812759Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:a8ce7e4d33ffd5a9ab3ff96392adf97d6b47249800d14032c158cd1a7cfa32d6","observation_id":"c7051ad6-9582-4943-a991-5f1b3f762708","resolution":{"observed_at":"2026-08-11T16:39:50.812759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.758284Z","title":"Large language models in ﬁnance: A survey","venue":null,"work_id":"e2311c15-0bbf-47a5-8770-8bba909ae1ce","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.816569Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:76b7d969b1908e3b145002c50e1ddfea9efeb545f14eba0049d8c6859dfad4c2","observation_id":"ff95a4aa-43fb-4058-b81f-a1875abb4bd2","resolution":{"observed_at":"2026-08-11T16:39:51.761879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.747333Z","title":"ChatGPT for good? on opportunities and challenges of large language models for education","venue":null,"work_id":"e63d8f8b-ab59-49cf-8f36-68032c039b20","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.820085Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:bfed322f534e560215d7f419ac99a901adb23f1906bd161f21821f4eabf4989c","observation_id":"d3bd051e-56f3-4363-ae45-38c748120ad9","resolution":{"observed_at":"2026-08-11T16:39:51.751309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T16:39:50.823522Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.823522Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:73e225de364b05e8e535be520d27ab8f63487782397195a29c46f62cc2944369","observation_id":"cfa1b187-2365-48ca-bbaa-c171a10ae1a8","resolution":{"observed_at":"2026-08-11T16:39:50.823522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.735526Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"f0534e90-616f-45fc-a0be-6a9c5f0d6aaa","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.827195Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:895205a08efa73a2372ff46fd607b6661d787680aa6ab309a4294363a3e53acc","observation_id":"6405444b-f2c4-420c-adc6-54d42b3e6a9b","resolution":{"observed_at":"2026-08-11T16:39:51.739802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T16:39:50.830665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.830665Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:ad23b7f88a70c25860093e65c1c1035d6859b37c5afebcf6c02dc77853febf2b","observation_id":"62ecb2e1-2ac1-4ecc-80ae-ab648109dc97","resolution":{"observed_at":"2026-08-11T16:39:50.830665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.724213Z","title":"Transformers in vision: A survey","venue":null,"work_id":"9458528f-4914-4af9-9de1-0c6b0b011fd2","year":2022},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.835225Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:b90b0f8a33573d337d912780c14b7a6d5645e621dc7d07dafde26da2fbe19681","observation_id":"b1fd1fcf-879b-4f4c-9811-38fcf5d07b5c","resolution":{"observed_at":"2026-08-11T16:39:51.728417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.712905Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":"e7a978fe-99cf-4764-908a-d4d6d430db31","year":2021},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.838764Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:1ce45cdbc323b6c79ba59267115cccde24806a6f9e4ddd8a87c4d27a7a69d73f","observation_id":"e4b91528-cec1-48c3-ba14-24d1623d5f83","resolution":{"observed_at":"2026-08-11T16:39:51.716906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:50.842227Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.842227Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:ba2d441755bd1088092ca8d900202bcab533423d5ca5f0d09c4f8333823bb27a","observation_id":"4f3b3a45-e132-4b39-a8db-1ada099ed34d","resolution":{"observed_at":"2026-08-11T16:39:50.842227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18938","last_updated":"2024-12-03T03:56:52Z","snapshot_observed_at":"2026-08-12T22:35:51.520563Z","submitted_at":"2024-09-27T17:38:36Z","title":"From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18938","snapshot_observed_at":"2026-08-11T16:39:50.845769Z","title":"From seconds to hours: Reviewing multimodal large language models on comprehensive long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.845769Z"},"links":{"cited_paper":"/paper/2409.18938","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:7e4ca1fa6e62521e0a8c600b42ce74104d779aedfb42cd5808ae800552564d50","observation_id":"e6a75d1a-adf9-44d3-b2a1-a4922ef02ac5","resolution":{"observed_at":"2026-08-11T16:39:50.845769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T16:39:50.849625Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.849625Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:2a820854fa4e1c3eeb210b4ec521957bd7b18fa7e1d817d0af22c58cd28a7f84","observation_id":"6f0615bc-fe54-49ab-b707-6a890db5d7b0","resolution":{"observed_at":"2026-08-11T16:39:50.849625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:50.853080Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.853080Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:7be569d25c5fdf614a0a7e9fab8f031dbfc118038513302b961b827599df2328","observation_id":"3348bc08-d6d7-4a01-98a1-80a6b32f561f","resolution":{"observed_at":"2026-08-11T16:39:50.853080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.695026Z","title":"MovieChat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"51678164-45ee-4927-ada8-630b63c07c24","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.856551Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:9b5e97dd0aaf6aa221034c1df0932aa3306204403169db6055c17a9e2a561a74","observation_id":"478e8dfe-10fd-48c0-9f8b-c1fa39e5f388","resolution":{"observed_at":"2026-08-11T16:39:51.699025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.684879Z","title":"MA-LMM: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"2a549850-80d3-45fa-8c2a-569ee3e7a339","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.859735Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:45c292a2522741472a6cf7de0d05d86d3a0faf251ffdca3d4c62dd5fc44e8569","observation_id":"628d42a5-194f-4540-a0b6-571c0dd4267c","resolution":{"observed_at":"2026-08-11T16:39:51.688677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-13T01:15:12.087659Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-11T16:39:50.863339Z","title":"Flash-VStream: Memory- based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.863339Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f7790dd60eea0bac600c35f4b6d9503e89202f3055a8500b3d24f26c9b053dcd","observation_id":"7ca2d4c2-f622-4168-b330-c8e425bf9916","resolution":{"observed_at":"2026-08-11T16:39:50.863339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.674296Z","title":"Evolving conceptions of memory storage, selective attention, and their mutual constraints within t he human information-processing system","venue":null,"work_id":"96101f00-c73b-4759-aab8-1614cfbdc095","year":1988},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.867004Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:39666fb43998c40d52834add5138652bd1508cd5fb9bf50066ed7823b8a82025","observation_id":"cb5cceb3-9cb7-4f50-919a-1636faa6c94d","resolution":{"observed_at":"2026-08-11T16:39:51.678038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.663485Z","title":"Gorillas in o ur midst: Sustained inattentional blindness for dynamic even ts","venue":null,"work_id":"cdfe7baf-2ca6-4246-88d1-9cd1c08b95f7","year":1999},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.870229Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:94c6626dbcddedc6a5517eed67ad9ca0f36fc2ac3e0cd69a68b1a04116af27a6","observation_id":"7df3325e-06e8-4e3c-94f4-970f5c8fe60d","resolution":{"observed_at":"2026-08-11T16:39:51.667871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09419","last_updated":"2023-05-01T07:48:05Z","snapshot_observed_at":"2026-08-13T12:42:11.314753Z","submitted_at":"2023-02-18T20:51:09Z","title":"A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09419","snapshot_observed_at":"2026-08-11T16:39:50.873451Z","title":"A comprehensive survey on pretrained foundation mod- els: A history from BERT to ChatGPT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.873451Z"},"links":{"cited_paper":"/paper/2302.09419","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:732d8f6b681a92d7ac28baadb8b91578f66826dca06db73a42b93ccf08c3e83e","observation_id":"986f31a7-4b68-4462-a0fe-8ea12a53f39c","resolution":{"observed_at":"2026-08-11T16:39:50.873451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-11T16:39:50.878552Z","title":"Towards reason- ing in large language models: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.878552Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f2cebf4ffdc3f202fadcadd78928ed106cd91778b2a565ad847fe0d888830ec9","observation_id":"a6f7290c-b168-4ce8-90ef-4e4180549252","resolution":{"observed_at":"2026-08-11T16:39:50.878552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.653555Z","title":"BLIP: Bootstrapping language-image pre-training for uni- ﬁed vision-language understanding and generation","venue":null,"work_id":"ed5dd11f-f32c-451a-8eb4-f96f4beabd75","year":2022},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.881988Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:35fa8e40cc9e8012371fb72725dd32dd1a29cff75c9ccffc98ad88eef5843031","observation_id":"0b80c3c7-1390-4ca3-a541-0d9e7a71cb79","resolution":{"observed_at":"2026-08-11T16:39:51.657305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.643173Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"053958ff-d90a-43b2-95ed-d9160f71eb23","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.885452Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:50fb15ac025b7d4dda5da27bc618421d9aab7fcba7cd0a2789612035c253ac17","observation_id":"459e376f-6ea2-4216-ae39-b4cca2348859","resolution":{"observed_at":"2026-08-11T16:39:51.646969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.632866Z","title":"Visual instruction tuning","venue":null,"work_id":"a2b0201c-fe7b-4d8c-9404-7859f9a02d66","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.889051Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:397a0ffaab1a68c2da6addd9109a79e30b43291c6ec81121bfeea545dbc83946","observation_id":"cb17de36-5de2-44a5-a6a6-36a309a7d109","resolution":{"observed_at":"2026-08-11T16:39:51.636455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.622088Z","title":"Learn- ing transferable visual models from natural language super - vision","venue":null,"work_id":"6d6ba8ed-7657-413b-b25b-40adfe694297","year":2021},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.892415Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:b18d09f72230f94b7fefeb2e65bf90aa888e56ae6a4f10e96cb222a0bc0546c0","observation_id":"0a196353-6970-48be-a561-6475df71fb37","resolution":{"observed_at":"2026-08-11T16:39:51.626114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.611900Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"3f836101-e6a8-440c-a4c0-1b13c255524d","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.896011Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:a05b8b99592b0f13988a4d69c7a7c096b4db2d25527e6cdc8c30f14568459f23","observation_id":"a730e3ca-6ed9-4f89-ba7c-313898b53c0f","resolution":{"observed_at":"2026-08-11T16:39:51.615563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.600727Z","title":"LLaV A-NeXT: Improved reasoning, OCR, and world knowledge, January 2024","venue":null,"work_id":"1a0a0e39-d1ec-4ea2-a118-c1c12ddb5211","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.899721Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:1d016e6e3a7b0ab8b2486997ea61d677261bf970955049c00a6f47024c0200ca","observation_id":"4ef69fd8-c8cf-428a-886e-69c097dd6643","resolution":{"observed_at":"2026-08-11T16:39:51.605002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.589557Z","title":"Chat-UniVi: Uniﬁed visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"7d1ed12f-9a53-4370-8931-04a9e99bd6d2","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.903238Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f7c6ecda16622a53f8bd742786f40c2ee343973423cc7659ca9a48d8104517a0","observation_id":"26db7f9b-4f97-4657-96ae-b30f1f594096","resolution":{"observed_at":"2026-08-11T16:39:51.593509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T16:39:50.906942Z","title":"VideoLLaMA 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.906942Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:5958d82a86469619520208b1c5dcca83e5cf027f3b30dfe02d7117213446fe14","observation_id":"f88579e9-fa6d-4200-b263-d4b8af2eccfa","resolution":{"observed_at":"2026-08-11T16:39:50.906942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.578611Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models","venue":null,"work_id":"89d26b03-580d-4c9a-950a-3bee7d4a7df6","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.910622Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:7b4120be232218680ee1b4b0e5bbcd6cc402271961fe0474f69b0d3f02c01fb2","observation_id":"2987bfbe-8160-4cc4-82e7-04dd86388976","resolution":{"observed_at":"2026-08-11T16:39:51.582514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.567246Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"25fc4743-f7f3-4a49-ba91-a20b83eda311","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.914242Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:5d5da3182c943ea7122b39348489d098492217c9eadca10904662a0fdda2a0a9","observation_id":"036ff4c6-2a4c-4f33-843f-ad7a63e79d0d","resolution":{"observed_at":"2026-08-11T16:39:51.571257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T16:39:50.918069Z","title":"VideoChat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.918069Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:d5324d1e83756a9bf7b3b600cda05bf0b7b1abfc6488d9e0cce3f265e45dca41","observation_id":"bff15451-a104-4096-8d85-99a4a3608245","resolution":{"observed_at":"2026-08-11T16:39:50.918069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.556092Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video u n- derstanding","venue":null,"work_id":"77977f46-45f8-40bc-b903-78bd1e5b0fcf","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.921787Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:5d9b4d0fd26ff78995fae79422ff374418bc7cc76316bbd0f9dcec6e3cd4a477","observation_id":"9ed335c6-8428-477c-bc0e-df5493f02079","resolution":{"observed_at":"2026-08-11T16:39:51.560231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-11T16:39:50.926246Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.926246Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:5895e58818b0358fc389b198da8dce7fb6414080d6bf86431ac2bfc9016cff73","observation_id":"be4ece27-1405-4655-a5b2-eb40b3fd5212","resolution":{"observed_at":"2026-08-11T16:39:50.926246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19773","last_updated":"2023-10-30T17:44:09Z","snapshot_observed_at":"2026-08-13T05:37:19.968467Z","submitted_at":"2023-10-30T17:44:09Z","title":"MM-VID: Advancing Video Understanding with GPT-4V(ision)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19773","snapshot_observed_at":"2026-08-11T16:39:50.930220Z","title":"MM-Vid: Advanc- ing video understanding with GPT-4V(ision)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.930220Z"},"links":{"cited_paper":"/paper/2310.19773","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:02c5f050243a605468738c5ca36463b2d525d4bcda1767cde572c602eaa47a9a","observation_id":"e125a25d-9c3e-4c63-9e97-ce526d0e041f","resolution":{"observed_at":"2026-08-11T16:39:50.930220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.545031Z","title":"Artemis: Towards referential understanding in com- plex videos","venue":null,"work_id":"b7dd2484-de65-43c4-87f1-d9ce9d9c9f27","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.934205Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:85d2bb38c7e49e33dd4f00b1858d41c9cbca4f5033b958de8bacf50c4038083c","observation_id":"11af3d05-e190-49d4-a95f-e93605ad857d","resolution":{"observed_at":"2026-08-11T16:39:51.549077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10668","last_updated":"2024-03-18T23:15:47Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T14:50:38Z","title":"Language Modeling Is Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10668","snapshot_observed_at":"2026-08-11T16:39:50.938041Z","title":"Language modeling is compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.938041Z"},"links":{"cited_paper":"/paper/2309.10668","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:846a3c9ca9ddd5de7478abb032258e56346daf4a5a9d22add6973eb47357bfd0","observation_id":"bc2997e8-fe62-4226-ad6f-73f01a0bf2e9","resolution":{"observed_at":"2026-08-11T16:39:50.938041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.532938Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":"db048f3f-afb7-4a0c-9ed9-81d19069d533","year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.941664Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:bcfaeeecd7fbba9c08565de5d869cd124ade8826bcda5c6eda833ed873c2842d","observation_id":"d1e2a817-ff0d-4bcc-9ac4-056c70b034ba","resolution":{"observed_at":"2026-08-11T16:39:51.537249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14788","last_updated":"2023-11-04T04:09:43Z","snapshot_observed_at":"2026-08-13T11:34:50.734118Z","submitted_at":"2023-05-24T06:42:44Z","title":"Adapting Language Models to Compress Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14788","snapshot_observed_at":"2026-08-11T16:39:50.944973Z","title":"Adapting language models to compress con- texts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.944973Z"},"links":{"cited_paper":"/paper/2305.14788","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:0cb90cb0fa53176bd0d694531e50d7d0fe72fa4a4c372ff35302eb9f93b1b0b8","observation_id":"8b0d3a57-a938-4473-8bb8-46d60f090cc9","resolution":{"observed_at":"2026-08-11T16:39:50.944973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.520728Z","title":"In-context autoencoder for context compression in a large language model","venue":null,"work_id":"915baa63-ca0a-47e0-90ad-d50259a3756b","year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.948606Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:9d33fe05e5cc607b61ba1346fca76e3eac267dbc02b256ca5834d729ebff159c","observation_id":"c1b7ba47-f645-4d15-b8d6-c635ace6a03e","resolution":{"observed_at":"2026-08-11T16:39:51.524994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T16:39:50.952139Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.952139Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:729fc5a7d99f06e41d9453899468c4fc5e156dc7763eaf99e90530f38e0bd5d4","observation_id":"44a69e30-3231-4489-b71d-c1e357755cd6","resolution":{"observed_at":"2026-08-11T16:39:50.952139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.508918Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll´ ar, and C","venue":null,"work_id":"1bd33908-edc8-4d75-a957-0df4312369fe","year":2014},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.955683Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:03beaf27729c54ca453ae2001cc20bb98fdf8c975f1d4815ba414ab3cad9c691","observation_id":"36121cd2-b067-4a17-8c4e-862db36d924b","resolution":{"observed_at":"2026-08-11T16:39:51.512853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-11T16:39:50.959092Z","title":"GQA: a new dataset for compositional question answering over real - world images","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.959092Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:77a1c3362ef7baa4c42ce26439de68b2f0fc3b9dfc83a8d5cfd82b5f4296671a","observation_id":"c8122340-37a4-493e-8b54-e86355b4bda8","resolution":{"observed_at":"2026-08-11T16:39:50.959092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.497445Z","title":"Towards VQA models that can read","venue":null,"work_id":"642bba17-abc4-4e21-acda-8e980b41507d","year":2019},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.962779Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f6ef08be32ab8309952a1cf443e1ec7744dc55db263149cffb2b50a7e05a4dc6","observation_id":"ee9f54a9-fe60-4ab9-8322-2a6126eb3595","resolution":{"observed_at":"2026-08-11T16:39:51.501402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.486484Z","title":"OCR-VQA: Visual question answer- ing by reading text in images","venue":null,"work_id":"e5aad553-cbf4-48bd-ba87-b10d95b4ec31","year":2019},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.966933Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:3ab35feee038b6c61b3f0e1de83f0977766b6f60ba81a54fe2b4dbbfc4fd2f8f","observation_id":"b91841aa-e94c-484e-b18d-581ad71db4a4","resolution":{"observed_at":"2026-08-11T16:39:51.490420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.475529Z","title":"Shamma, Michael S","venue":null,"work_id":"83529efa-2d47-46c6-bbcd-2237d382065e","year":2017},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.971037Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:b64ae692b28601725715cffef3042c7f5c565a2b4c1ae08019635df778ddb695","observation_id":"a44ff3c8-5ee0-4ec5-9ba8-30e9cc4b7686","resolution":{"observed_at":"2026-08-11T16:39:51.479193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.464029Z","title":"ActivityNet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"967ed0e2-94a1-4ee1-9991-678c30ab41a2","year":2015},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.974555Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:30d404d8da12ab9f50de6996e0a1a4d286e83d26ec39a71ad3f05a72e909d11c","observation_id":"5df1571a-4fb6-460c-8846-abbf364b02a8","resolution":{"observed_at":"2026-08-11T16:39:51.467827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:50.977785Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.977785Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:3d65a2889986e1d7264c23e35e159dbe4533274556cd0fec278a02e5e3468012","observation_id":"22b0ec88-4294-43cb-830d-f43a972b8534","resolution":{"observed_at":"2026-08-11T16:39:50.977785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:50.981107Z","title":"In- ﬁniBench: A comprehensive benchmark for large multi- modal models in very long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.981107Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:beaecd25e2fa08cdd91dc6164d47f46f569bd3332c2fba273de56f46681678e7","observation_id":"d500fb90-886e-4633-8b52-c1f4a61a9da6","resolution":{"observed_at":"2026-08-11T16:39:50.981107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-11T16:39:50.984462Z","title":"MLVU: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.984462Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:ef3d0e8e4a19be2248f2604f1db84bc3b7685cccc6d199a4eaa0055b6aed38b1","observation_id":"830fac7b-03d5-4a5c-93ae-870ead615c7a","resolution":{"observed_at":"2026-08-11T16:39:50.984462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-11T16:39:50.988258Z","title":"LVBench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.988258Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:141c6bfbe96ba8d8c7d492e4bcd70a5214f4867e582b3a12b5f8db2050ce1100","observation_id":"1c017d31-1616-4b52-9b68-3eff82284fd9","resolution":{"observed_at":"2026-08-11T16:39:50.988258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.444841Z","title":"NExT-QA: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"022d266d-f2e1-492c-8ac0-bf2bb181443f","year":2021},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.991774Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:a24839fe8080fcf520fec3dc4eeaf7d575acf53a29618b44700b35af84ca6152","observation_id":"34ca34d3-ca2a-4c55-a4e3-523c1cb8ff76","resolution":{"observed_at":"2026-08-11T16:39:51.449957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.432915Z","title":"Video question answer- ing via gradually reﬁned attention over appearance and mo- tion","venue":null,"work_id":"52241cf4-ad41-43ef-909f-9f3fe69b6c2f","year":2017},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.995521Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:e4be810c50b1d7448e76f053793263751be4f591a52f8baa34aeecab8da413bb","observation_id":"daf2b5a1-113b-455b-aa4c-32eaa5c58fdf","resolution":{"observed_at":"2026-08-11T16:39:51.437540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T16:39:50.998994Z","title":"Video-MME: The ﬁrst-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:50.998994Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:7fef0a7544f52f4bc32ccfabeb41bd03028b891e31d581a12217a3f7c97d52e4","observation_id":"6ccf13c5-6b7b-4808-8755-2956f5e49417","resolution":{"observed_at":"2026-08-11T16:39:50.998994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T16:39:51.002585Z","title":"LongVILA: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:51.002585Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f1e7768ca91ebdc60ed6f10c5568c8662e1ea8b2b4c4605a427cdfda2b6352d1","observation_id":"18562d97-8e0a-4fd6-ba9e-ff9b5af20b43","resolution":{"observed_at":"2026-08-11T16:39:51.002585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.422083Z","title":"Sheldon,","venue":null,"work_id":"6c5c1239-b92d-4d7e-bcff-b41692646b35","year":1980},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:51.006668Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:b6f29154cc6929f6a17d8c364582fe318b148d91bdfe2853b2c8fc188f3ad0f2","observation_id":"fb3bfd6e-af12-462e-8e2e-3dc2546552d4","resolution":{"observed_at":"2026-08-11T16:39:51.425862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:39:51.409226Z","title":"Invisible Gorilla","venue":null,"work_id":"35079ab6-e312-4f07-bbc2-71cbc09a0ad2","year":null},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:51.010552Z"},"links":{"citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:febb501de6231c138b0f8ecd5105428036cd87ead017736e7275faf3deeed073","observation_id":"45e7e380-d35e-46e5-b4aa-40a29260f057","resolution":{"observed_at":"2026-08-11T16:39:51.414569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2412.09907."}