{"as_of":"2026-08-21T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6bf2ffe5c7c643aaa6235662f51b55d120f9ae8894231b5d410825e3153828fa","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:32:28.293861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-12T00:57:32.564573Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:57:32.564573Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2412.01818"},"observation_digest":"sha256:be298d10d76609aaf23daadaa52963faf3c4c5551550322a6ef74468b799a02b","observation_id":"9da856d3-e288-4a0d-90b0-9d9b6ae8b686","resolution":{"observed_at":"2026-08-12T00:57:32.564573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T14:18:18.012399Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-14T19:51:36.696522Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.012399Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:456a145a3408124977099db63bf5a20a85807384dadc132ce907f781bc6bf402","observation_id":"86aeb704-3adc-4170-afc5-5eac48021193","resolution":{"observed_at":"2026-08-10T14:18:18.012399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-08T20:06:35.222155Z","title":"Zhang, Y ., Wu, J., Li, W., Li, B., Ma, Z., Liu, Z., and Li, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-18T11:58:35.073639Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.222155Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:9f9bf8ea3c50fefef00fe4c9f3673dcbf97df2f18ea1f67fbe438fa0202f312e","observation_id":"c5d1cee3-db0c-4fd8-b453-1aa778b5ed74","resolution":{"observed_at":"2026-08-08T20:06:35.222155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-16T11:32:28.293861Z","title":"Zhang, Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15415","last_updated":"2025-04-21T19:53:44Z","snapshot_observed_at":"2026-08-19T15:31:49.761914Z","submitted_at":"2025-04-21T19:53:44Z","title":"IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:28.293861Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2504.15415"},"observation_digest":"sha256:8dbc5579e45c9cab161d6129ebed9e74eefd64fdf65444c189c87e337c02226b","observation_id":"80dec6b0-91d2-4194-a46b-e89c217429fe","resolution":{"observed_at":"2026-08-16T11:32:28.293861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-16T10:55:03.234346Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17040","last_updated":"2025-05-10T22:42:28Z","snapshot_observed_at":"2026-08-18T15:49:00.345741Z","submitted_at":"2025-04-23T18:38:18Z","title":"DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:55:03.234346Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2504.17040"},"observation_digest":"sha256:2b8ea90105da18d28ebb570970b2c03bdcb2ca87a836020f9656d072276d4ef0","observation_id":"5fa331de-f931-4698-b381-4bd57deec528","resolution":{"observed_at":"2026-08-16T10:55:03.234346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-16T05:53:23.226484Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.226484Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:aab2df999198039534a7237a269c5adbec2713a3d905b64ada8fb982019654c1","observation_id":"36dc7495-b72b-4676-9c79-17a83e1ba0e0","resolution":{"observed_at":"2026-08-16T05:53:23.226484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T13:43:04.258730Z","title":"Zhang, Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-16T18:25:37.104768Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.258730Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:29ce31e42d74909809ca3c4cb8df51efa2d1adc7a6714a1dd05d0e2c7687f574","observation_id":"4e812d10-ea7d-45f4-80f4-3e28783cfb9e","resolution":{"observed_at":"2026-08-07T13:43:04.258730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T11:59:10.869569Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-20T00:05:41.080548Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.869569Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:4709cc991b1ae9e9fc0571e804019047b9ba45cd5529d97d3b61c34460e9a3d6","observation_id":"cb4cd5d7-3937-4748-ae83-c7fe93378ead","resolution":{"observed_at":"2026-08-07T11:59:10.869569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T10:56:05.411061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-14T19:51:34.087413Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.411061Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:e3274508c849d6936c37e23d9013e2221079bf57e922a6dbdfc9c40417fe576b","observation_id":"d1f0c0cb-268c-402c-aad2-c20d039f92d4","resolution":{"observed_at":"2026-08-07T10:56:05.411061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T04:20:03.894658Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.894658Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:2755567429f07730af2ba6d492f6371e4ce29e86135fcf484f03de3060a130b2","observation_id":"220f8bba-cf8e-446a-b0d3-556a1f5f6b26","resolution":{"observed_at":"2026-08-07T04:20:03.894658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-06T22:37:40.244937Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-13T07:30:29.607676Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:40.244937Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:79d267ecf1145045799e73286fe9b9ff1c6f380fe1959c79078e9994aae79e1e","observation_id":"a45288c7-d67a-44b0-81fd-85d7a70a5977","resolution":{"observed_at":"2026-08-06T22:37:40.244937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-06T18:39:07.591851Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-16T10:13:30.458348Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:07.591851Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2507.08064"},"observation_digest":"sha256:5c9f1b949f531d09c67e7e803344e82e07f809b0394608a2039d1b7ea6bcdbc7","observation_id":"a9433110-79f7-4096-895e-e2f652542aaa","resolution":{"observed_at":"2026-08-06T18:39:07.591851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-06T05:51:16.098415Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-20T21:10:07.788580Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:16.098415Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:d9c151425f1476f09f81f5bc35173ba1ce6328b6bda8019ce65ed583f6c75719","observation_id":"806989ac-a5bb-43c2-aff6-6e3192fa1a0a","resolution":{"observed_at":"2026-08-06T05:51:16.098415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T22:40:39.892802Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2508.06038"},"observation_digest":"sha256:4bd73bd7ca079a9d31eeb53e129b9ec02f56ad1fd187f1756920869367f58b34","observation_id":"b7271e21-b9d0-4e84-8ef0-a93975e2687e","resolution":{"observed_at":"2026-05-21T22:40:43.060000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T13:05:56.397948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-08T13:47:16.049215Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:56.397948Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:88e54e2a3c841b75e5359a692bfe3a32ed8d43e23f416e06f4c9700224e8d803","observation_id":"be70dd87-0aee-4f07-a90a-33ab85d0a529","resolution":{"observed_at":"2026-08-05T13:05:56.397948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2509.09794","last_updated":"2026-07-10T19:11:36Z","snapshot_observed_at":"2026-08-15T15:56:35.908270Z","submitted_at":"2025-09-11T18:53:21Z","title":"Synthetic Homes: A Multimodal Generative AI Pipeline for Residential Building Data Generation under Data Scarcity","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T17:10:57.875842Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2509.09794"},"observation_digest":"sha256:40f99baf4560d42e8c4c61d6a13f6e658f2142bec37a95dcc3ba28b7cc398e43","observation_id":"20621b8b-84bf-4333-bd44-84af059d8666","resolution":{"observed_at":"2026-05-18T17:11:39.115233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-15T16:08:37.856081Z","title":"Zhang, Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09794","last_updated":"2026-07-10T19:11:36Z","snapshot_observed_at":"2026-08-15T15:56:35.908270Z","submitted_at":"2025-09-11T18:53:21Z","title":"Synthetic Homes: A Multimodal Generative AI Pipeline for Residential Building Data Generation under Data Scarcity","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:08:37.856081Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2509.09794"},"observation_digest":"sha256:77028f13939b45979af99b266c779b64a84c291e3e5b83375c831b5c390860a1","observation_id":"4730ebf1-852b-481d-81f1-9ddd9edb92b7","resolution":{"observed_at":"2026-08-15T16:08:37.856081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-03T17:16:43.035260Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-17T16:07:27.921903Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:43.035260Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:0841e4c953d439cfa821a8c60f475e0f8e6ffe1ec58a89387e16da4b8835443b","observation_id":"28e56081-00fd-499b-8177-d31081ce1074","resolution":{"observed_at":"2026-08-03T17:16:43.035260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-03T12:02:02.320472Z","title":"Llava- mini: Eﬀicient image and video large multimodal models with one vision token","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-15T17:09:58.548655Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:02.320472Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:51e4b0f94ca862949d81d505c1ba91b4670c153d951d1359375ebcc276f6ad1b","observation_id":"4557b983-9211-4401-936e-7bf88f5b7569","resolution":{"observed_at":"2026-08-03T12:02:02.320472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-03T04:20:59.229137Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.229137Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1ca02fa98d2b345f4dc3403d92782b17166d16fc64e8c5ea3df27953957135f8","observation_id":"ba33d555-e37f-4f04-b8c6-f4f9b1180065","resolution":{"observed_at":"2026-08-03T04:20:59.229137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2604.11530","last_updated":"2026-07-08T19:47:09Z","snapshot_observed_at":"2026-08-12T12:06:34.719950Z","submitted_at":"2026-04-13T14:30:13Z","title":"Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:58.757680Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2604.11530"},"observation_digest":"sha256:9937de7f2b2f676f0abb5cb051cf897b92c79906fdfbedfa20390178c216f62c","observation_id":"1d3bd22d-f1d0-434f-a862-2d9b7bdc212a","resolution":{"observed_at":"2026-05-11T08:50:58.504522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2604.11530","last_updated":"2026-07-08T19:47:09Z","snapshot_observed_at":"2026-08-12T12:06:34.719950Z","submitted_at":"2026-04-13T14:30:13Z","title":"Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:20.202572Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2604.11530"},"observation_digest":"sha256:d4ca37ca2df07171905bdc862e3228542528333d77cbfd8ae2ea8e60e88b67b0","observation_id":"ee25deb0-089f-455c-adea-041508b539fc","resolution":{"observed_at":"2026-05-21T08:39:53.365574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:c3ca1b890d937dcdc7b4cea3a98696ccd544f2e623f165e326c36ab60fa86f27","observation_id":"5f1b2b21-8ab8-422c-9e15-cc1db7e8f5bc","resolution":{"observed_at":"2026-05-11T10:41:03.736027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2604.18260","last_updated":"2026-04-20T13:33:50Z","snapshot_observed_at":"2026-08-16T05:12:33.891180Z","submitted_at":"2026-04-20T13:33:50Z","title":"Geometry-Guided 3D Visual Token Pruning for Video-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T05:49:38.346274Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2604.18260"},"observation_digest":"sha256:a1923050a9d3be5db46e1b7b4a1658ff5af5fca48988fb9d4f8b31e495105332","observation_id":"52b28f62-8889-4351-94fb-d11f64bf0b04","resolution":{"observed_at":"2026-05-10T05:51:09.946533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.05899","last_updated":"2026-05-07T09:11:41Z","snapshot_observed_at":"2026-08-11T13:00:36.704352Z","submitted_at":"2026-05-07T09:11:41Z","title":"VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:22.588945Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.05899"},"observation_digest":"sha256:06ab8aa23e7e562ad00f2aee8958319f1b714882a1f2ba96205486d2270e9c0d","observation_id":"037ff41f-8d0c-4e46-98a5-f3a2270c6af9","resolution":{"observed_at":"2026-05-11T16:36:06.496376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.06809","last_updated":"2026-05-07T18:08:31Z","snapshot_observed_at":"2026-08-13T10:56:22.856949Z","submitted_at":"2026-05-07T18:08:31Z","title":"LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:50.406353Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.06809"},"observation_digest":"sha256:8e52a64399d66b0f8fec8dd91db7531ca92afc830c06702abbf215d30277605e","observation_id":"bec6f267-091b-4cb4-a809-46d6344c8821","resolution":{"observed_at":"2026-05-11T01:40:52.141344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-14T15:06:22.101894Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:200f2096f780c9df6030dd175ae9b10f83d8bad5604b48eb1d5c33b726a97a3b","observation_id":"feb54c7e-bd0f-41d2-8b8f-9b63ec5c1470","resolution":{"observed_at":"2026-05-20T14:48:23.428962Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.20950","last_updated":"2026-05-20T09:37:53Z","snapshot_observed_at":"2026-08-13T00:29:51.560453Z","submitted_at":"2026-05-20T09:37:53Z","title":"Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-21T05:20:55.448430Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.20950"},"observation_digest":"sha256:2401f8df4aa35085ac2d33e91e357b5340c70a431b819eeec2aa1bb319945adb","observation_id":"171008aa-deaf-41a7-a9c0-d7ae860611bf","resolution":{"observed_at":"2026-05-21T05:23:58.577019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.25952","last_updated":"2026-05-25T15:28:48Z","snapshot_observed_at":"2026-08-14T19:49:49.360616Z","submitted_at":"2026-05-25T15:28:48Z","title":"VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:20.787671Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.25952"},"observation_digest":"sha256:14cfbde8100d3d2fea2e934a8ba17de99f8ee69ffc315c43984a90f6d9856433","observation_id":"690383a7-c803-4306-8b92-9682bf0bf7e8","resolution":{"observed_at":"2026-06-29T22:34:02.610791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2605.28115","last_updated":"2026-05-27T08:09:44Z","snapshot_observed_at":"2026-08-13T04:27:13.390810Z","submitted_at":"2026-05-27T08:09:44Z","title":"CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T12:12:51.867760Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2605.28115"},"observation_digest":"sha256:c52914f06a9fe7c3bd21e342c577050dc5dc458904ce417738d69d9aac66fc7f","observation_id":"c62617d9-5947-41e0-b401-21df000f508f","resolution":{"observed_at":"2026-06-29T12:13:26.440208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-08-13T16:20:55Z","snapshot_observed_at":"2026-08-16T23:12:09.626355Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:aa47c28e4e76f54642a7e849b2fd98004b1308f20a4da4f2adcc6013e2b3940b","observation_id":"a0720b38-b6e7-43a7-abf4-ca9f78a33327","resolution":{"observed_at":"2026-07-04T03:19:31.826417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:3ceb278cfc5a72a583dbdfcd7cad3f427a7f3c12fccf609272bf00a45638adc1","observation_id":"c01c7c92-3aae-491b-a2ad-9db3abb7ac87","resolution":{"observed_at":"2026-07-04T05:49:36.567425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-08-15T01:37:01.186634Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:84cb12386cf4f528d91364f8db3ffc67334abb25c118a598dc38318671fd17ed","observation_id":"85f39ace-49c0-4eb0-b2ad-36bfa1e9112e","resolution":{"observed_at":"2026-07-01T10:15:44.604793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":"2501.03895","doi":"10.48550/arxiv.2501.03895","metadata_source":"pith","pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-mini: Efficient image and video large mul- timodal models with one vision token","venue":"cs.CV","work_id":"56522f82-e06a-4592-a7e0-25915a41d2ac","year":2025},"citing_paper":{"arxiv_id":"2607.06468","last_updated":"2026-07-07T16:28:10Z","snapshot_observed_at":"2026-08-19T10:58:01.344150Z","submitted_at":"2026-07-07T16:28:10Z","title":"EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-08T05:25:07.553526Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2607.06468"},"observation_digest":"sha256:5648495f4669282fa35c1488ddeb55d7bda6b623e2293a889fd13fa9083a1eb0","observation_id":"500c4645-e0ec-476e-979a-18597bb1ea26","resolution":{"observed_at":"2026-07-08T05:34:32.421404Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-08T01:03:38.855362Z","title":"arXiv preprint arXiv:2501.03895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03055","last_updated":"2026-08-04T03:12:34Z","snapshot_observed_at":"2026-08-14T17:45:13.435762Z","submitted_at":"2026-08-04T03:12:34Z","title":"PDD-RRG: Posterior Diagnostic Decision for Study-level Radiology Report Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T01:03:38.855362Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.03055"},"observation_digest":"sha256:66c989d3a08f9aef121284deefa89ae7c585ea092dc68f1ebef2063164bfee9a","observation_id":"af44867e-005c-483f-afe5-ce72a7bc4d89","resolution":{"observed_at":"2026-08-08T01:03:38.855362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T04:30:14.274367Z","title":"arXiv preprint arXiv:2501.03895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-17T01:20:08.163345Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.274367Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3f0da07eedb3cbc6029e9126ee1a8a969c637871e78752543e56c6d4d1c5eb25","observation_id":"100f7f4a-5ab0-4897-aeac-f15ce15c3ddc","resolution":{"observed_at":"2026-08-10T04:30:14.274367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-11T12:53:14.468007Z","title":"LLaVA-Mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-15T15:07:39.655380Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.468007Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:defe5986f63bef9647151810ef7833ff2ec1837e65c42454eb453f5984de51ac","observation_id":"1cde152f-f8de-45dd-8e0e-f00f4a94f582","resolution":{"observed_at":"2026-08-11T12:53:14.468007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03895/citation-record","integrity":"/paper/2501.03895/integrity","json":"/paper/2501.03895/citation-record.json","paper":"/paper/2501.03895"},"outbound":[],"paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2501.03895."}