{"as_of":"2026-08-17T18:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebbd5dacf4fd0ad1493fc09c12ce11a916352ed8183520d2aa45b561f0658b92","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:17:19.535023Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:19:26.153682Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"cited_work":{"arxiv_id":"2411.14401","doi":"10.48550/arxiv.2411.14401","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14401","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Beyond training: Dynamic token merging for zero-shot video understanding","venue":null,"work_id":"a3a4fa36-935c-4dea-aab1-02302ea41103","year":2024},"citing_paper":{"arxiv_id":"2604.10060","last_updated":"2026-04-11T06:54:56Z","snapshot_observed_at":"2026-08-17T18:02:57.657209Z","submitted_at":"2026-04-11T06:54:56Z","title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:36.133404Z"},"links":{"cited_paper":"/paper/2411.14401","citing_paper":"/paper/2604.10060"},"observation_digest":"sha256:6a8f12718a9525fd287433f74e1f883b9ed18d1fb7af55a4f57326262b4055ba","observation_id":"3eea6c55-aa84-4112-8e27-05f5de688bc8","resolution":{"observed_at":"2026-05-10T16:10:34.350836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"cited_work":{"arxiv_id":"2411.14401","doi":"10.48550/arxiv.2411.14401","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14401","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Beyond training: Dynamic token merging for zero-shot video understanding","venue":null,"work_id":"a3a4fa36-935c-4dea-aab1-02302ea41103","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-11T15:02:05.500337Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2411.14401","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:d3b32d525b57019e4cacfe03410620ba483aed271b8df926082451222d25e796","observation_id":"01acc121-5f1e-419a-bd97-6bb4d4ed9dca","resolution":{"observed_at":"2026-05-14T19:17:50.839649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"cited_work":{"arxiv_id":"2411.14401","doi":"10.48550/arxiv.2411.14401","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14401","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Beyond training: Dynamic token merging for zero-shot video understanding","venue":null,"work_id":"a3a4fa36-935c-4dea-aab1-02302ea41103","year":2024},"citing_paper":{"arxiv_id":"2606.24477","last_updated":"2026-06-23T12:13:19Z","snapshot_observed_at":"2026-08-14T12:23:59.674478Z","submitted_at":"2026-06-23T12:13:19Z","title":"video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:26.153682Z"},"links":{"cited_paper":"/paper/2411.14401","citing_paper":"/paper/2606.24477"},"observation_digest":"sha256:b489fb215b3cccff8dc0109e57711d4097d9e430c5274cce05185a8257615c17","observation_id":"adcf274d-f2a2-4a79-bf6c-9297ffb9eab4","resolution":{"observed_at":"2026-07-04T16:39:58.352126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14401/citation-record","integrity":"/paper/2411.14401/integrity","json":"/paper/2411.14401/citation-record.json","paper":"/paper/2411.14401"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.477461Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":"72b06c6d-a3ee-4bae-87ee-da11b07d28a9","year":2021},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.311077Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:c051ab33c25e344df6e76f880b1ee2b5b6f8e2b6ec62c2f63528794040046d1e","observation_id":"4775f871-409b-495c-ad49-c996aa385278","resolution":{"observed_at":"2026-08-12T15:17:20.482163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.316997Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.316997Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:21607d47889585593910c13ee5cddae42cdf69999b7690294416e3fe8980e3c6","observation_id":"9894c35c-047e-4413-9367-df150fa01062","resolution":{"observed_at":"2026-08-12T15:17:19.316997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.449806Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"e73d30f6-5d32-4af9-bf01-c9dfff685cc7","year":2011},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.321812Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:e20649c2073f6dcad1a0a52750d8c173fa1b9c887b82abd8235aa3f89880188c","observation_id":"65cb87c9-ba34-4c34-ad75-5da0bc51ba73","resolution":{"observed_at":"2026-08-12T15:17:20.454974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08024","last_updated":"2024-06-12T09:22:45Z","snapshot_observed_at":"2026-08-16T13:43:50.826912Z","submitted_at":"2024-06-12T09:22:45Z","title":"Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08024","snapshot_observed_at":"2026-08-12T15:17:19.326998Z","title":"Fewer tokens and fewer videos: Extending video understanding abilities in large vision-language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.326998Z"},"links":{"cited_paper":"/paper/2406.08024","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:70ad57d497f820b38776107af68c75859850291671f31022caf42d36bd0efbaa","observation_id":"df3283eb-4378-402f-ac2e-3d494be2ce4c","resolution":{"observed_at":"2026-08-12T15:17:19.326998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-16T14:13:48.547250Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-12T15:17:19.332297Z","title":"Halc: Object hallucination re- duction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.332297Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:08049c837458ca91bf19af71336a4b40be7a3a2f2874972b0006dd8be6d41786","observation_id":"0df4e6c6-1ce9-4d70-8453-9f03fbf54617","resolution":{"observed_at":"2026-08-12T15:17:19.332297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.433906Z","title":"VideoLLaMA 2: Advanc- ing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs, 2024","venue":null,"work_id":"e03636aa-9bb7-4640-932c-3517c855f879","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.337077Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:ebb7ea44c245989510e646c918ad3993f44e8a01476d08569574d20d93a79a61","observation_id":"522e2b5f-218d-4e71-a728-a82a41ccd501","resolution":{"observed_at":"2026-08-12T15:17:20.439033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.417176Z","title":"Video-MME: The First- Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis, 2024","venue":null,"work_id":"8edc7cb7-8ff0-49bc-ad41-99160ee94a91","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.341685Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:f00afb395eb4b50705092712647f573b8e9d2ff78ff905d9f1d65cb4fb1dbd65","observation_id":"6584ecec-8fcd-411b-a0b5-d29c20b22968","resolution":{"observed_at":"2026-08-12T15:17:20.422508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-08-17T02:26:12.770175Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-12T15:17:19.346184Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.346184Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:8a04f1c858db47e7e9fec635ccbf6a54bf705dbb5e2bc5b7bdc603fdb76153cc","observation_id":"e97becb7-a974-43ac-8878-56c3eda69ca5","resolution":{"observed_at":"2026-08-12T15:17:19.346184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.397622Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding, 2024","venue":null,"work_id":"f3f1682c-7377-403c-a962-77acce706371","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.351596Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:caba20cd8ba96aa5706fe85fbce2b879ca4136e76cb2482291d47527348f5836","observation_id":"d13b6b4d-4bfe-4311-b0fd-4d9bbd12c0f1","resolution":{"observed_at":"2026-08-12T15:17:20.404545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06984","last_updated":"2023-07-06T18:52:08Z","snapshot_observed_at":"2026-08-16T16:32:16.935961Z","submitted_at":"2023-05-11T17:14:33Z","title":"Evaluating Open-Domain Question Answering in the Era of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06984","snapshot_observed_at":"2026-08-12T15:17:19.356837Z","title":"Evaluating open-domain question answer- ing in the era of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.356837Z"},"links":{"cited_paper":"/paper/2305.06984","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:c65ad4bcffb42bd0f8e48872ee7252d37ece2a0038816da89616559d59ceb5de","observation_id":"34f17add-0dea-426e-8c3b-acf3a602a184","resolution":{"observed_at":"2026-08-12T15:17:19.356837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.372716Z","title":"An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM, 2024","venue":null,"work_id":"3f4a5e3f-c747-4824-808f-462d537dc547","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.362862Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:7fca379e5b23f964a425dea0bb5eeccca7df15a5c10e01bd76fb24764cfce4ac","observation_id":"94a946b4-2d98-48ea-8c81-090b8683b43c","resolution":{"observed_at":"2026-08-12T15:17:20.382311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:17:19.367588Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.367588Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:b05f046e42ae29c933c72eaddaadfcb6d6deb90e05ce8a01602c98fc14002c97","observation_id":"b368254a-fb71-477d-99c1-1bb6d90eb9d5","resolution":{"observed_at":"2026-08-12T15:17:19.367588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.346518Z","title":"Inten- tqa: Context-aware video intent reasoning","venue":null,"work_id":"4410428e-9a8c-43ef-b557-190bf711d8ae","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.373377Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:82989c1944e954d58ee36e5071b4d5a732fad9bf58284a95230d292e8a0dd8ec","observation_id":"126393c9-28ef-420b-9a0b-77f28d11f8cc","resolution":{"observed_at":"2026-08-12T15:17:20.360658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.331199Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning, 2022","venue":null,"work_id":"75cac506-a561-4f6d-a359-9e5ada51a206","year":2022},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.379498Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:6d8e1e76508123600d0b1cc59edc33f09608194d3ab00fa0e6e35e37dd7e288a","observation_id":"1fb44f72-8ff2-45f3-89fb-3b0efa5067e9","resolution":{"observed_at":"2026-08-12T15:17:20.335870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.317054Z","title":"VideoChat: Chat-Centric Video Understanding, 2024","venue":null,"work_id":"21a5290c-857f-4733-83db-8da44c266c9f","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.384344Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:34f44592061e05eab17ed46f8e557373df2e43f04fd9397c7295d554696e370c","observation_id":"45b39613-a40d-4e1c-becf-74ee4e5336e2","resolution":{"observed_at":"2026-08-12T15:17:20.321606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.297236Z","title":"MVBench: A Comprehensive Multi- modal Video Understanding Benchmark, 2024","venue":null,"work_id":"e7b7a517-9c14-4b26-a15e-93e839b59038","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.388360Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:20f052aabd68dcf9ad4bd1e221ef59c842b09ff99cef1f72264075a1ac344ba0","observation_id":"c968a893-9c6c-45af-9fa5-73e2e717b92b","resolution":{"observed_at":"2026-08-12T15:17:20.302761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.280410Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":"441124be-1a75-433a-9670-e46f0a9f8fff","year":2016},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.392754Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:5dbf17a55ba243b23d2a5b9d49e017c3e5795c01aa074a501f19d31fa245acdd","observation_id":"f95d33bb-a7a4-421d-9b07-971045cc1870","resolution":{"observed_at":"2026-08-12T15:17:20.285900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.265032Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models, 2023","venue":null,"work_id":"925270f8-6d80-4688-895f-ff9d1cb0d902","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.396866Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:ea4f0b22ae9abe12401eee3c38f7fed92478c6eb578fd84a33a87ec14e9965d5","observation_id":"40103667-a67b-4cca-955c-0a043a37b599","resolution":{"observed_at":"2026-08-12T15:17:20.269655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.249393Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"b6e61f44-0d61-4322-a1bf-87bf1c645656","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.400928Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:224b92e69ac4c3372c7e8da44187188f5d441a488a3b8bd978bf8cb87af8bc25","observation_id":"2f2d01cb-2286-4b52-9849-91ba195fdb1c","resolution":{"observed_at":"2026-08-12T15:17:20.254266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.231945Z","title":"Video-LLaV A: Learning United Visual Representation by Alignment Before Projection, 2023","venue":null,"work_id":"fda04b67-6324-4e3f-ab92-d16ab9b88521","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.405590Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:cb44b8ceb393bde834bc344e1f3281cb342416c8b910acde616417460c786f70","observation_id":"2af3598e-f90c-4b78-9ef6-6f98a5f579b8","resolution":{"observed_at":"2026-08-12T15:17:20.237582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.210515Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"f543671a-9a3f-4e90-848c-8f32f8ed4613","year":2019},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.409359Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:6e1ae9fefed70f8c2b4e76e65745aba8fe8a40503ec5eabd4d390fc3ca15e1a5","observation_id":"27d28afd-2203-4e27-afe6-7f9115ebeb05","resolution":{"observed_at":"2026-08-12T15:17:20.217520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.413389Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.413389Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:e5e354c06ef0b96c8afa5eaabcc4f53c956dfa44fe394675ae23b3adb926e1f1","observation_id":"be1c8c6a-6027-42fc-b188-e631b843d082","resolution":{"observed_at":"2026-08-12T15:17:19.413389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.183422Z","title":"Vista-LLaMA: Reliable Video Narrator via Equal Distance to Visual Tokens, 2023","venue":null,"work_id":"9ee9737d-2ef1-4c64-a456-18675cfccfde","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.417067Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:8040c5714d63940c061ba4de58ae5006079f4b4768c2084ff2c709c3dd71af90","observation_id":"c5bb445c-ae61-4b73-bc79-99f772d81188","resolution":{"observed_at":"2026-08-12T15:17:20.188660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T15:17:19.420733Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.420733Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:bf57ff18fc036a1a5f0d3a21c41c3bf95e971cf1f3cfc970cd584d44e46f52bf","observation_id":"292b679e-7e22-440e-9a36-3bc0a2e54d21","resolution":{"observed_at":"2026-08-12T15:17:19.420733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.165795Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Mod- els, 2023","venue":null,"work_id":"1af90967-7e3b-45f3-938a-9db4c471f874","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.424893Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:40937123e57ac07c822ceedd80ef4154e71a0b40e23ab6164d87e2fc843a415a","observation_id":"9c2212ef-61a1-4c2c-9eeb-a7056a73a074","resolution":{"observed_at":"2026-08-12T15:17:20.170409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.150617Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"508cdd69-dff4-4065-b5c1-33cffa75384b","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.428685Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:9262dd6ce0f88cbe7dc643f1d3c5b5d164fe47d62c913961efac090ec6c1e49e","observation_id":"a76213b4-79b5-476e-805c-d43f79e92590","resolution":{"observed_at":"2026-08-12T15:17:20.156272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-16T13:54:55.899708Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-12T15:17:19.433014Z","title":"Foundation mod- els for video understanding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.433014Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:f55d3a04bc17255437d28c65d34e33cda65f69f331e7bf1d12f0192c24913996","observation_id":"09290a55-b8f4-42ff-82c4-3002a6a7c6e5","resolution":{"observed_at":"2026-08-12T15:17:19.433014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.132654Z","title":"Egoschema: A diagnostic benchmark for very long- 9 form video language understanding","venue":null,"work_id":"dea242f4-2054-46d6-9e28-7b643f7c8c34","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.437718Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:431fd378aaf5bcd7d7ed69ff5ffab3cf1adc5056feee2d397b8a1dc6f862f753","observation_id":"00d517ab-25a8-4355-8797-38d79fdd9fc8","resolution":{"observed_at":"2026-08-12T15:17:20.139469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T15:17:19.441536Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.441536Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:ccd71928579dec048eef8eec232d0ebba8b3653ff29659471e1229b3c9751e85","observation_id":"3ec775d1-81f7-4664-bf67-6c7f25c5f6df","resolution":{"observed_at":"2026-08-12T15:17:19.441536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.119597Z","title":"Less is more: Pay less attention in vision transform- ers","venue":null,"work_id":"d6fb62de-2377-425c-8ab3-04747a50ed74","year":2022},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.445865Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:dcecc0c19f1b4debe806fa734c6eaf0ded82a60169c48e079f793abdd7a85cbd","observation_id":"698362b6-d6f1-4625-83ea-a10dffb579ac","resolution":{"observed_at":"2026-08-12T15:17:20.123968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.103050Z","title":"Effi- cient parameter-free clustering using first neighbor relations","venue":null,"work_id":"3aa11334-cfd6-44ea-b759-932bdfd44dc8","year":2019},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.449954Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:de2326ff52c76600da3ef0eb296e8411b4d2f05eaf562bbf51c36d09d398efc7","observation_id":"8ba4bb6d-d006-4869-a91d-94c5e1a9bccb","resolution":{"observed_at":"2026-08-12T15:17:20.107949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.088970Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding, 2024","venue":null,"work_id":"557a7302-e411-47bd-b0e3-182b3bb0d1f8","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.454068Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:5d406eaa3a870cf0d8418e2094ed22d7c1b04e7574104ae79b420399977de56d","observation_id":"bd5e2a6f-3fa4-4272-8a7c-5b678a64b268","resolution":{"observed_at":"2026-08-12T15:17:20.094030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.457831Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.457831Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:3827145eb72b81cd2269ba3ed3438d2aa3561d624b925caa2753664ef60eba77","observation_id":"dd73bd8a-9856-4504-a44a-673f2a94970c","resolution":{"observed_at":"2026-08-12T15:17:19.457831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.074208Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"541807f1-a40a-4082-9187-4bf48360a7eb","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.462316Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:c8a6b6d70ba218c0a3720dce4fa03e0a71f715a299dcd58f3aaa6313c062e144","observation_id":"d753d32a-3dbd-45bb-9e13-9d78255acdce","resolution":{"observed_at":"2026-08-12T15:17:20.079942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.058510Z","title":"Freeva: Offline mllm as training-free video assistant","venue":null,"work_id":"3d55f3bc-5138-442b-9df6-ebc8a7424588","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.466380Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:b63b5655fe6774c416efb5717f7e11809e798bdfa83ac69a211112083a5e6021","observation_id":"db43c629-b1c1-4ccf-a52b-a567266de72e","resolution":{"observed_at":"2026-08-12T15:17:20.064393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.041726Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"db8cbca4-68d1-47e1-87f6-c92cac25c00e","year":2021},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.470673Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:2c34c7327d2d2d64ba2d3b325aa4032f6340d208318805592e72dbe6cbb4fa66","observation_id":"2bed5b56-0624-48f6-aa5b-886f14588489","resolution":{"observed_at":"2026-08-12T15:17:20.047090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.020630Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"59fb5989-3600-4a2b-a5bf-6884e9635069","year":2016},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.476488Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:dab58101f4006ca680e6e3c0121a36f5201bd9f6fdaf8e52bd8766c379c455ad","observation_id":"0d929b18-6a74-46fd-a4ee-455e44dc4ca0","resolution":{"observed_at":"2026-08-12T15:17:20.027795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:20.003168Z","title":"PLLaV A : Parameter-free LLaV A Extension from Images to Videos for Video Dense Captioning, 2024","venue":null,"work_id":"0d59e7ed-4a90-44c4-a599-370365722643","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.481713Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:de88b8602476a4fa7ee3bc2f227dab5e9fef53695c2d6d95d96be026a30630d6","observation_id":"14923024-3d8d-418f-8728-03e3bee1f7c7","resolution":{"observed_at":"2026-08-12T15:17:20.010444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.976379Z","title":"SlowFast-LLaV A: A Strong Training-Free Baseline for Video Large Language Models, 2024","venue":null,"work_id":"7723891f-8fdf-4bc2-9c50-ee7244fe8aac","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.485762Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:e03fbb821274041ceeb50b038cf74cfc730ab47edc10093778533c86d837705d","observation_id":"7399f2ba-5ace-47e2-b8b8-63840eade38a","resolution":{"observed_at":"2026-08-12T15:17:19.982895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.958423Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"547c4416-cb2d-4358-bd9d-2de435c99d73","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.493075Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:f68d05913e97351ae90f6559e567272f2712d90ed331656fd5e2d6fc6e4cb71f","observation_id":"69bd3635-6fdf-4f89-b31f-2dbe3a87845e","resolution":{"observed_at":"2026-08-12T15:17:19.964391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.941763Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"c46f2ef7-fb66-4d6a-942b-42f5857ae201","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.498409Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:fea1727a262793ef910a68741ea6efa9dc32bead96f922387aef7a8c8b133fa1","observation_id":"76c52acc-6394-407b-9ea5-ec27461b406d","resolution":{"observed_at":"2026-08-12T15:17:19.946256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.926430Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"eb1e582a-351d-4d85-96d2-effd5d4bc616","year":2019},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.502684Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:88f65c5365fc65028570a5dafb205796b9b091b47f3ed03bf4452c83a5a1de64","observation_id":"ed617feb-2b64-4461-a4a3-8a9f2adf14dd","resolution":{"observed_at":"2026-08-12T15:17:19.930947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.911647Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding, 2023","venue":null,"work_id":"3f24f804-0d3c-44e8-8a1a-ee2006868937","year":2023},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.507722Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:ce99dff74efa4a327d09e8c9d1c5c4553ed972ef79501e7da2a01cbb24418626","observation_id":"e2cf9dd5-bb5c-4c4a-8943-43c299e5ecbe","resolution":{"observed_at":"2026-08-12T15:17:19.916189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-16T14:01:39.123151Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-12T15:17:19.513134Z","title":"Ferret- v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.513134Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:2c5593cbb08a8a1f6e3af7402b5cbda4004e89a91946889393fa0fe874b4111b","observation_id":"84dfa728-6de5-460e-b61f-942252e29a55","resolution":{"observed_at":"2026-08-12T15:17:19.513134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.517778Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.517778Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:93984dfe748b97d223471dfac2d85dc5fa5e030286e7cb28e87e5136c0fd29cf","observation_id":"4ade763f-3bac-4b4c-987a-fe95caf799b4","resolution":{"observed_at":"2026-08-12T15:17:19.517778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.522013Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.522013Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:803061f46dc39af6d9cad71eee46c0f74528d95c554520974a338478a551e41a","observation_id":"caba4785-ef58-4e5d-91a3-f8d139b4d05f","resolution":{"observed_at":"2026-08-12T15:17:19.522013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09387","last_updated":"2025-03-24T14:48:12Z","snapshot_observed_at":"2026-08-17T09:43:26.139566Z","submitted_at":"2024-04-15T00:12:27Z","title":"RankCLIP: Ranking-Consistent Language-Image Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09387","snapshot_observed_at":"2026-08-12T15:17:19.526139Z","title":"Rankclip: Ranking- consistent language-image pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.526139Z"},"links":{"cited_paper":"/paper/2404.09387","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:76621d8146d36126bab715c29dad4d38a36772ce8f1f57cd71d64e6cea9bb70d","observation_id":"c64262c1-0a17-4e9b-be81-f3fbb8d16758","resolution":{"observed_at":"2026-08-12T15:17:19.526139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:19.877728Z","title":"Multimodal guidance network for missing- modality inference in content moderation","venue":null,"work_id":"681e26a6-548e-4f60-b611-d0de07a4b52a","year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.530734Z"},"links":{"citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:980cbc480fc5e3362807495654248fe1b7c476025801f2057ab1272815cc667f","observation_id":"46dc1631-eb8a-425b-998d-de6f1d6bcb56","resolution":{"observed_at":"2026-08-12T15:17:19.884148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-16T14:23:14.163704Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-12T15:17:19.535023Z","title":"A survey on gen- erative ai and llm for video generation, understanding, and streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:19.535023Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2411.14401"},"observation_digest":"sha256:225e43ab4f59d548adcc0695375cf26a6125761e7b4c27fa9baac0119d20e002","observation_id":"23d25d77-fef8-4ec5-8ece-71083439c966","resolution":{"observed_at":"2026-08-12T15:17:19.535023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:14:55.691325Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 3 inbound Pith citation observations for arXiv:2411.14401."}