{"as_of":"2026-08-10T05:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7ce92352324a40135ef54960c13e50e5fb482b702472f2b0bcd207ac27ee39b","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.667788Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01644/citation-record","integrity":"/paper/2608.01644/integrity","json":"/paper/2608.01644/citation-record.json","paper":"/paper/2608.01644"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-04T23:46:51.531752Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.531752Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:8a019bb01c1c35185c47b13123ebc756239a2674ced04f2f90afa942376988f2","observation_id":"f0cac426-2ff1-4169-b70c-0e2061e4f20d","resolution":{"observed_at":"2026-08-04T23:46:51.531752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02034","last_updated":"2021-10-26T13:37:53Z","snapshot_observed_at":"2026-08-10T04:59:43.862035Z","submitted_at":"2021-06-03T17:57:41Z","title":"DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02034","snapshot_observed_at":"2026-08-04T23:46:51.535123Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.535123Z"},"links":{"cited_paper":"/paper/2106.02034","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:bd204e44824445ae7c2a5edfc3eebe344b5f396def2272dd35d5a61a40c107c5","observation_id":"e95ad9f4-fe05-433b-9d6a-1e36fc9ffd25","resolution":{"observed_at":"2026-08-04T23:46:51.535123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-04T23:46:51.538242Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.538242Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:fbac69c2f54309f64518588f360be1b1d9dbb672023e27e4657c110281ad5113","observation_id":"a5070a4e-c3c1-4be8-9a28-ba259dfc7587","resolution":{"observed_at":"2026-08-04T23:46:51.538242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:52.641542Z","title":"Johnson and Joram Lindenstrauss , journal =","venue":null,"work_id":"e2ebcd14-094b-424b-9c69-0909659c3750","year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.541420Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:8fdd506fa36d1691d686830cd66571708913a5306e0bc64f28d0499e286849f3","observation_id":"7938faef-9d75-4293-aa42-e02aab49098f","resolution":{"observed_at":"2026-08-04T23:46:52.644192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:52.633430Z","title":"Database-friendly Random Projections:","venue":null,"work_id":"328d209b-132e-4f79-8df9-b89f93d9300c","year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.544042Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:1569874ce74c987dbaea36cefedb22781de138b6c3cfc30b12da3bc13a7f21b6","observation_id":"6faa0741-c26d-4918-945f-2a3936bdff27","resolution":{"observed_at":"2026-08-04T23:46:52.636330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-08T22:33:21.852107Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-04T23:46:51.546718Z","title":"European Conference on Computer Vision (ECCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.546718Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:d1fbbf1733b4010392088dfdd1a250f55b5703615f5f9f182ad378f1130bb476","observation_id":"818cb237-c809-4edf-a4ac-13d5b653a7be","resolution":{"observed_at":"2026-08-04T23:46:51.546718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-05T13:11:54.824513Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-04T23:46:51.549583Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.549583Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:2d5a3c6fcd2d38499820c18e97d4e23a885232cf1ff69d602665059b7ce63b44","observation_id":"2dad76de-74ca-4d25-993a-6a3554dad9ed","resolution":{"observed_at":"2026-08-04T23:46:51.549583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.552299Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.552299Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:fea112362e80ebf316ab1f5d7d3351ac2ac4d43565701ed230ce697ea17208c6","observation_id":"a915563f-32d0-46ba-badb-4d8b2818cde9","resolution":{"observed_at":"2026-08-04T23:46:51.552299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.554772Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.554772Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:ea6120ca3cb37d0106b2979455ea0e4b831974a9d40bc29690e31096a51453e3","observation_id":"608e3e4a-790e-4780-a5b2-6aeec30f49b0","resolution":{"observed_at":"2026-08-04T23:46:51.554772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-08-10T02:13:56.094339Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-08-04T23:46:51.557165Z","title":"Findings of the Association for Computational Linguistics (ACL Findings) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.557165Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:908a565345c8a789166bb95d0da3e40665940e9cd7ac3531d601be8853c92124","observation_id":"6037976b-5fc2-4d7c-a168-9c15f12ab2bd","resolution":{"observed_at":"2026-08-04T23:46:51.557165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-04T23:46:51.559912Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.559912Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:79695faf9ff441baf044c8525560b09ca0cc9777af662fc6e7d493c37e2153f0","observation_id":"b88481f7-f192-46f0-b1f2-d96b29e93664","resolution":{"observed_at":"2026-08-04T23:46:51.559912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-04T23:46:51.562582Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.562582Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:e2edffb5590ccb52bd0629f58a7b49a6f918946f632ba3d80e89cb752a23d595","observation_id":"4829ecd5-8452-4bbb-8fbc-339d242d13cd","resolution":{"observed_at":"2026-08-04T23:46:51.562582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T23:46:51.565175Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.565175Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:b8222d0f838dd68353d8bad357475ac4fbf33a83b5d1a9ec3331247f585de6f8","observation_id":"c4c00660-b607-42b9-a766-4b247d742a41","resolution":{"observed_at":"2026-08-04T23:46:51.565175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-04T23:46:51.568021Z","title":"International Journal of Computer Vision (IJCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.568021Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:4ecfac35d189c956dde3bcf4d8bcbab3db0122844662a63b36dc8d30fd9cbfc0","observation_id":"029a34b8-1856-4299-8a32-a5378955ea5a","resolution":{"observed_at":"2026-08-04T23:46:51.568021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-01T15:11:43.922290Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.09613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09613","snapshot_observed_at":"2026-08-04T23:46:52.445239Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","venue":"cs.CV","work_id":"97dcd6f0-6e57-4911-bcd2-d68cf09f5ee6","year":2024},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.570775Z"},"links":{"cited_paper":"/paper/2412.09613","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:8845573bf38ef4f20ed381667defa73b226fc10d38bd9fbac9f5326056a67f80","observation_id":"e0bfad12-8a05-46ca-a1dc-50349f089c34","resolution":{"observed_at":"2026-08-04T23:46:52.450235Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-07T19:23:28.702632Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02279","snapshot_observed_at":"2026-08-04T23:46:51.573559Z","title":"arXiv preprint arXiv:2507.02279 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.573559Z"},"links":{"cited_paper":"/paper/2507.02279","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5300c094490614183b0c0c0335bb6a793b65c5369d6306f6c12d87fe014d01ca","observation_id":"a3c4e44a-af0c-4238-9ed0-9d3ae8b95f91","resolution":{"observed_at":"2026-08-04T23:46:51.573559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-04T23:46:51.576340Z","title":"arXiv preprint arXiv:2503.21307 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.576340Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:2202e5c7b5a8d7ad0dda427c6834a3ac1c4eea1e58fcdb7f89a821e4321ce3cc","observation_id":"9ba06075-77b6-45c8-97a1-15ca8e42cf37","resolution":{"observed_at":"2026-08-04T23:46:51.576340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.580850Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.580850Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:7f8fba2cd11b1beb84ff2be3ecc9f9c4cd495478b39fb0368f8412c73bf36d85","observation_id":"123d02dd-81ae-4c86-8b8b-172b6f77087c","resolution":{"observed_at":"2026-08-04T23:46:51.580850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.583327Z","title":"Transactions on Machine Learning Research (TMLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.583327Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:f360280b709b7e1409715701a40f368de01798dbc60a7092329bab4bad74d3e3","observation_id":"cb192944-990e-4e1c-b078-8a1b37e8223e","resolution":{"observed_at":"2026-08-04T23:46:51.583327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.585864Z","title":"arXiv preprint arXiv:2505.18227 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.585864Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:d4378ed937d0e5b4a4c3f0bb43a22297a0e29e0eb534513896e3405e9a9824c0","observation_id":"666bc42d-4ead-47fb-92f7-0e53f0c16fcc","resolution":{"observed_at":"2026-08-04T23:46:51.585864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-04T23:46:51.588231Z","title":"Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.588231Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:d20baf73067be651ccfbcf6ef9671a20f4bbd6301cd06fea25c2470b2d51d8da","observation_id":"6e0885d0-099b-498c-9184-bfdcca6e8f75","resolution":{"observed_at":"2026-08-04T23:46:51.588231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-04T23:46:51.590927Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.590927Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:e2c18641ade9b244fa1618d09ea8fa2e64080227190f70240238f3ab6cac6c35","observation_id":"ff6fa96a-a337-43e2-b5ac-823cdd111a8b","resolution":{"observed_at":"2026-08-04T23:46:51.590927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-04T23:46:51.593878Z","title":"Findings of the Association for Computational Linguistics (ACL Findings) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.593878Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5cad55c093ee72f4dcf3188b54f4716f1df14a6ab059471826e02b222f8db7d1","observation_id":"5826cc77-e5f4-404d-a2a2-9e5cf40a94de","resolution":{"observed_at":"2026-08-04T23:46:51.593878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-04T23:46:51.596591Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.596591Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:f33ed58b60d20300f909493d0a7c4275a2c3a84a2537b23817962509834f2481","observation_id":"95377740-8756-4f75-bff3-e15c3b62e03a","resolution":{"observed_at":"2026-08-04T23:46:51.596591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-04T23:46:51.599549Z","title":"Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.599549Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:da5d7570929d41dddb32504e37e28217cee5e0ef0d8dc49d9066d48a768d7691","observation_id":"1c803385-804f-4d59-9e6e-d27819625dd2","resolution":{"observed_at":"2026-08-04T23:46:51.599549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T23:46:51.602320Z","title":"arXiv preprint arXiv:2409.12191 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.602320Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:e4f4ae19dddfbb57d2db4593fedc0bf1240005fc5689b65bae8fa3b6b292559f","observation_id":"555bb139-5a0c-4ef6-8d12-e2ea525bb244","resolution":{"observed_at":"2026-08-04T23:46:51.602320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T23:46:51.605205Z","title":"arXiv preprint arXiv:2502.13923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.605205Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:1e3821aa26d699ee4d50daf5b396cffecf89e4462d0c7d19b6219b9da85ed4f0","observation_id":"128b6588-ea48-4bbf-b3f9-f3f9cc72aba4","resolution":{"observed_at":"2026-08-04T23:46:51.605205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T23:46:51.608318Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.608318Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:8a39251d6089d75d7cae0d7e5ce3599a254e3c63e0860e6ad8ddb02c36879964","observation_id":"7dc63e75-60e7-488f-827d-82080ef78b28","resolution":{"observed_at":"2026-08-04T23:46:51.608318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-04T23:46:51.611444Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.611444Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:cdc903692381acb4cff214fdeecf0dc01ca303896867c0913bc13ed68d045cef","observation_id":"cec09a60-c794-45e3-8958-0ab05708261a","resolution":{"observed_at":"2026-08-04T23:46:51.611444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-04T23:46:51.614564Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.614564Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:14d5c31423c72575904f663633abebcebe2ae6d6d99cf6a668efe2d46fe9b03e","observation_id":"5c8d3dba-cc1a-4f75-89fc-61f7f0faaa68","resolution":{"observed_at":"2026-08-04T23:46:51.614564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.617550Z","title":"arXiv preprint arXiv:2510.16598 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.617550Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:34fd1aa0fc9bb26134d0383f0bd4e09fe0fde60bb8f157a12b418c54f282bac2","observation_id":"bebe9447-190d-4975-8d70-6088898bdcbf","resolution":{"observed_at":"2026-08-04T23:46:51.617550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17343","last_updated":"2025-04-24T07:59:46Z","snapshot_observed_at":"2026-08-07T15:59:37.866387Z","submitted_at":"2025-04-24T07:59:46Z","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17343","snapshot_observed_at":"2026-08-04T23:46:51.620346Z","title":"Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.620346Z"},"links":{"cited_paper":"/paper/2504.17343","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:7551495bd9a8c858e494af332d75eba00e53256640d47cf99393d0a195a2ceeb","observation_id":"5571a5f0-8880-4e9d-8541-74175d42959c","resolution":{"observed_at":"2026-08-04T23:46:51.620346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T23:46:51.623682Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.623682Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:ee0509916066c00bd3df4b1d9ea6c1d5668fae5307d0059030e241c904bd26e8","observation_id":"28dfb864-4a37-4541-a6c0-9505ef6324ae","resolution":{"observed_at":"2026-08-04T23:46:51.623682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-04T23:46:51.626661Z","title":"IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.626661Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:cb6dcc62378259ded9cfa549a4fd0c80490800098703b59a58bb83105737a1c0","observation_id":"444f74dd-a255-4114-908e-61f7da1616fc","resolution":{"observed_at":"2026-08-04T23:46:51.626661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-04T23:46:51.629660Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.629660Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:73e6f51ebc93ffd0fdeae418d502d65a1ca5214dd6654597e57a6cd0417e3dc6","observation_id":"ec101824-b7d8-4757-8953-90f3e2cc7deb","resolution":{"observed_at":"2026-08-04T23:46:51.629660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-04T23:46:51.632640Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.632640Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:6515d5cb74aa642814ac26e595e0d887ece0556455c1b2d73ba778745a7206b5","observation_id":"beb3c69b-1797-4c66-853a-d40f3b182606","resolution":{"observed_at":"2026-08-04T23:46:51.632640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T23:46:51.635563Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.635563Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:a995d964f4f86b6a97c43bbe8fbe90f9afd85c312dba5c3cbee0813a0cedb5b1","observation_id":"a7fe473c-2c51-41f6-9fe4-6c91d74d1e75","resolution":{"observed_at":"2026-08-04T23:46:51.635563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-04T23:46:51.638965Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.638965Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:10a5762b03a2a2e4a10d3ab6b968c99a765d5579815e8a32e997d513ecd9e16f","observation_id":"b87acf7c-1da2-4d2b-9cd4-3f9b021cd49e","resolution":{"observed_at":"2026-08-04T23:46:51.638965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-08-04T23:46:51.641946Z","title":"arXiv preprint arXiv:2506.03990 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.641946Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:bf2f113dec47d5ffb3a80e3d2991b58a4b133b370abb0f3ab9834ea147214e45","observation_id":"84d2da63-359b-4e4c-9943-42b6095c3fb3","resolution":{"observed_at":"2026-08-04T23:46:51.641946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.645057Z","title":"Conference on Empirical Methods in Natural Language Processing (EMNLP) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.645057Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:c4646bc20b45e8c8368f719b81b7e90d42b585c84d036d9c66744e1a810f5e48","observation_id":"9db99812-1f46-48fa-884e-5eb4287f9270","resolution":{"observed_at":"2026-08-04T23:46:51.645057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02175","last_updated":"2025-04-01T19:02:04Z","snapshot_observed_at":"2026-08-08T00:42:49.320305Z","submitted_at":"2025-03-04T01:33:14Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02175","snapshot_observed_at":"2026-08-04T23:46:51.648153Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.648153Z"},"links":{"cited_paper":"/paper/2503.02175","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:604b1cfc5cf30eadf781959bc785b4e110f4e2b262c18d18d57a67385ec6d094","observation_id":"60ce3a48-5358-4e4a-b3e9-7352a90a19b5","resolution":{"observed_at":"2026-08-04T23:46:51.648153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.651354Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.651354Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:0304a3f4a20473c1654ff3981e7c9c88ece6a85b330bd662afa4e9feb1ae2c1b","observation_id":"a20520da-add8-468a-a26e-38c53cced558","resolution":{"observed_at":"2026-08-04T23:46:51.651354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-08-04T23:46:51.654336Z","title":"IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.654336Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:38c64678496a80dfa01a692d8737639944dac5614373ad4a862a39a1b9457bd1","observation_id":"d890eb34-3b8c-4d7c-8973-4ab572bb59d4","resolution":{"observed_at":"2026-08-04T23:46:51.654336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-04T23:46:51.657161Z","title":"arXiv preprint arXiv:2506.21862 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.657161Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:16920aaa52fedc5eb8cf559c0e54c3796189204b79cdbd5ba30c43a90ceb94b1","observation_id":"1029c04a-e870-4c34-b21f-3c5564ab4b5e","resolution":{"observed_at":"2026-08-04T23:46:51.657161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09530","snapshot_observed_at":"2026-08-04T23:46:51.659904Z","title":"IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.659904Z"},"links":{"cited_paper":"/paper/2412.09530","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:b7c472fec47cdd6dff2a4e62cef6e0c39a32b1d71b27bd2b12513c0607f70054","observation_id":"b4359393-9c7c-47fa-85a1-44bdbd4b6697","resolution":{"observed_at":"2026-08-04T23:46:51.659904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.662622Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.662622Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:b30207d48a27bd0534a272bcdf852c0d427a9e22d6d8de415f77ab6ef5610cb2","observation_id":"11af31fa-86ea-4456-9369-545eae1505ae","resolution":{"observed_at":"2026-08-04T23:46:51.662622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.665137Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.665137Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5d1585d491351510f032038b0367ae902db6a113539edd7816a063650efcf9e4","observation_id":"8cbc6767-9f7f-43ff-b579-578a66df21aa","resolution":{"observed_at":"2026-08-04T23:46:51.665137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:46:51.667788Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.667788Z"},"links":{"citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:7c9167ba202fd6eee1d77d8044ad5195936b08224cdf4b388aed8fbe2ba6d044","observation_id":"8b6aee8f-232a-474b-8d9f-7d5811d96d24","resolution":{"observed_at":"2026-08-04T23:46:51.667788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2608.01644."}