{"as_of":"2026-08-07T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:306467a1ebf909f66ba8d146330274248d51218bbf893b10e46fecb73f98b951","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:53.416913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:35:01.039481Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:0e9a8091f9525f7cc2e1d49103f3c4a67d682b140ddacde68197fd79270b414e","observation_id":"973d328e-1357-49cc-b90e-1af090db8bb9","resolution":{"observed_at":"2026-05-18T04:55:20.473273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:f54748f0e8895539fa29afd2dc0a116a797d210809ac8a1e61797e5be2f7cc67","observation_id":"73a3776b-4a93-41a3-a408-726ba5d7b8c5","resolution":{"observed_at":"2026-05-17T02:46:16.731922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:dc257a02819017ee2f9911d51328f45981758be29eb493b38e4a95299c32d6e6","observation_id":"081ced19-1148-469e-8efd-826183496418","resolution":{"observed_at":"2026-05-17T07:44:47.497607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:f34fce174b2edfcc3d3590e621c479e8f589c0984f94943b88545efb98b9e673","observation_id":"61fb005d-633c-49e3-a414-192694e8cc4c","resolution":{"observed_at":"2026-05-15T20:21:57.974849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:1ddde3d543be8060a37e18fed948ffbf268f2cdafb6d055087288ccb48a97b71","observation_id":"d26af7f3-d15e-46d6-8cfc-cf9220c4f338","resolution":{"observed_at":"2026-05-14T19:55:26.389857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:4bbf8f67a418112f93b0be5394579c5a8537cb659a751e10d7f2b37bf7c8ab26","observation_id":"31eeb163-b9d7-451e-ad84-70b55c64fd6f","resolution":{"observed_at":"2026-05-19T11:55:30.195081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:c288cbb972c90b820b91488498a7d75b974761e11857795c862981dba902e9a6","observation_id":"7b089da6-9c35-461c-bc2c-368e96b13c4d","resolution":{"observed_at":"2026-05-17T10:46:28.654562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:1783fd01fbc65abbf474dff70a000cc8cd0306c4f6514c47bb0cec387926f732","observation_id":"075a7d8a-4684-4e04-b3e0-ef9b26d2067e","resolution":{"observed_at":"2026-05-11T06:01:54.037741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.08101","last_updated":"2026-04-14T18:39:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-11T00:10:45Z","title":"What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T22:51:08.753650Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.08101"},"observation_digest":"sha256:4157e5125f65c62f717ac78091e78ca4e53e21909cd080fd844497f4a4761589","observation_id":"fc8b33c8-ddc1-4220-9ece-ac46ead134ee","resolution":{"observed_at":"2026-05-23T22:53:33.157114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:ffaaa9ad1f02fa5a0749ededbf4bfc43f78f28fb185936bcbea3cc11e457372d","observation_id":"170e0518-604d-4cd6-a103-28c2ad1cb0fb","resolution":{"observed_at":"2026-05-17T03:51:25.511626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:732af3dc7090779bd56e0ec0d3a9e68abdfd5b42c055f3c7d99f06742bf227a6","observation_id":"81baf91d-9190-46e9-a25f-7aca2b3d8d6b","resolution":{"observed_at":"2026-05-10T23:20:32.978337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T19:51:36.137985Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.06224"},"observation_digest":"sha256:e1cb52d8a1a8cbd4c2804de317a2e57eaf18ec31e6a2253d62e724c767058460","observation_id":"e6fb5e39-367d-4e45-a0c8-deebae6711f9","resolution":{"observed_at":"2026-05-16T19:51:36.333783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T05:49:53.416913Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T05:41:32.702189Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.416913Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b3915b61ec9a45dfb2fcb82740be51400f38d5c437dddd752b21314286dcc45f","observation_id":"dc8fecce-635a-4350-823e-a604ad8268a5","resolution":{"observed_at":"2026-08-07T05:49:53.416913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T00:33:19.326679Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-07T00:26:15.640270Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.326679Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:87f2d7357dba9832fcf9ca224bfab58e09073ab543a3602fa2272415451ad2ca","observation_id":"fa43ef72-8084-4d98-b812-6fccee3b5343","resolution":{"observed_at":"2026-08-07T00:33:19.326679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T23:13:07.193817Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-06T23:04:53.910156Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.193817Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:8ac869cb587ff6b8789ab8d7febd75fe96a13600f003e5bdc73eb0ed10e72145","observation_id":"f9bd112b-a33b-408d-b03c-4849703a8fb1","resolution":{"observed_at":"2026-08-06T23:13:07.193817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T22:36:37.514961Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.514961Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:aa982e7a158c0bc3d3a6858d8c1ac16677767596870ad44a806fa2a7bc7c3ab6","observation_id":"3de1bfdc-6e02-41d3-98f1-9a17c5964c27","resolution":{"observed_at":"2026-08-06T22:36:37.514961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T20:29:52.144931Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.144931Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ef77ee709559b85f2e3ac02a663bc01c258121030b5e2c64b9058ef608ceb341","observation_id":"2efa0987-9240-45d2-aa06-4a09a803cc06","resolution":{"observed_at":"2026-08-06T20:29:52.144931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T14:47:28.740370Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-06T14:37:43.765391Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.740370Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:356258d0f6e8e5cbd3e0ad08bfc9b7888772e6b2b85de14a6b2f76b9c7a50312","observation_id":"00d64863-bf51-4eca-aa1e-a18a39129839","resolution":{"observed_at":"2026-08-06T14:47:28.740370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-06T19:44:38.919643Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:28141397d73b5a6ca5e2e329c778e9466f12919582427541f0a4369bf39c6760","observation_id":"be12beba-f4bf-4e8c-96dd-2118725ef2ad","resolution":{"observed_at":"2026-05-19T03:22:01.230172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-05T13:46:01.099735Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-05T13:45:55.704887Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.099735Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:3c356a8d1a82a066caf585c9b3b1f02174863e698c57dd8166cac1029d703510","observation_id":"f98a0e98-a01c-4b5a-a1a9-de828b50673f","resolution":{"observed_at":"2026-08-05T13:46:01.099735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-04T09:12:08.173803Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:08.173803Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:26cb839410039cc4b216aa7b1f56aa18dadb6d372c764f7f9ffbe646b2f30791","observation_id":"68cc46ca-92bd-4dd7-9f09-73c833ef94d6","resolution":{"observed_at":"2026-08-04T09:12:08.173803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:aaae6e55357dea377330de88260b0fa347a2251dba45b47f108f9bb5b1757069","observation_id":"be4b702d-4fc2-4de9-bbd3-c0e28db84eaa","resolution":{"observed_at":"2026-05-14T22:08:04.347146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T21:36:43.971666Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:69fcf2d859eae2af44653bf4f151fc8e7cddb9e3b537c48047b39966316326c0","observation_id":"dd36a994-d8b2-4431-b287-a07b92f577df","resolution":{"observed_at":"2026-05-19T21:37:47.904757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T19:33:24.558488Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:ffc291fbed6a85e664f4a08eb33a36daf17a671bf016cd00c88b68f429f49431","observation_id":"bf2a9c55-f062-401e-9692-ed22c84b8528","resolution":{"observed_at":"2026-06-30T19:35:01.040957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.19950","last_updated":"2026-05-19T15:05:00Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:05:00Z","title":"AffectVerse: Emotional World Models for Multimodal Affective Computing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T06:46:33.612905Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.19950"},"observation_digest":"sha256:069c9d4a182823ac9a46dc17efd00e12a1a87897b18fbd3816b421978b74272c","observation_id":"bc6cffe9-4ff9-4f63-b216-8efe10b6a225","resolution":{"observed_at":"2026-05-20T06:48:05.768202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-12T09:09:15.248815Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02607","last_updated":"2026-07-01T13:51:02Z","snapshot_observed_at":"2026-07-12T09:09:14.587474Z","submitted_at":"2026-07-01T13:51:02Z","title":"Latent Visual Cache for Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T09:09:15.248815Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.02607"},"observation_digest":"sha256:6153d9b57b7bfb78b2b798f468c9fdfb0ad5d83215d1d3230fb9a216977cead3","observation_id":"35d8a661-3f92-4a48-94f2-fc65384c5157","resolution":{"observed_at":"2026-07-12T09:09:15.248815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2311.17043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:7eaabe1f6bb1ebcf89dd30f53ef13c2996d6f573d89d4262fedce06a0fa11cd6","observation_id":"fa248f94-9bc2-4a6a-8b45-563b728ff2ec","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2311.17043 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-08-07T05:11:17.204037Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b44ee30bfe374e4651ede6bad63e2a2df56f0e9601d2684051fa886a60cb1b9e","observation_id":"6da9c10c-6546-4c8f-b1d6-032321ab34ad","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-31T06:20:13.729612Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-07T06:47:24.083796Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.729612Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:ce5fc55082acac4f097c961ae18b6e181c39f36f4359ba7cf6cb53a9dda0f893","observation_id":"4228e8d1-8124-4ab5-b3d3-f7c6d59913a9","resolution":{"observed_at":"2026-07-31T06:20:13.729612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.17043/citation-record","integrity":"/paper/2311.17043/integrity","json":"/paper/2311.17043/citation-record.json","paper":"/paper/2311.17043"},"outbound":[],"paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2311.17043."}