{"as_of":"2026-08-07T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93029bf812c3d391dfd4f4ec8b175f4afdacc975e6fdf22466e9dbaf9923fec2","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:50.801112Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.654336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T06:58:05.988167Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2509.08016","last_updated":"2026-04-09T01:22:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T00:55:04Z","title":"Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T18:35:01.328250Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2509.08016"},"observation_digest":"sha256:eb6dc87d978380b02860654565c9f6be6c08f42ae8392a2fa2f4635a79e0e669","observation_id":"e99a8d45-4dcb-453b-80d4-725afbba76f0","resolution":{"observed_at":"2026-05-18T18:36:44.191878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:d606f0a6475d00c5c2fb1bb2ca282e73932b2cb5442ba36fd18bc97dbd61d56b","observation_id":"8cb5c6ec-fea4-4edd-8ed6-17874b0c7018","resolution":{"observed_at":"2026-05-11T23:11:13.772797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2605.19322","last_updated":"2026-05-19T04:02:01Z","snapshot_observed_at":"2026-08-02T06:11:11.606278Z","submitted_at":"2026-05-19T04:02:01Z","title":"DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T06:55:01.619441Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2605.19322"},"observation_digest":"sha256:da9bf5fa0f303eb947c13192b378e958531f3a264012a04cc22d5ae66457d16a","observation_id":"27a489f0-2b34-46c3-b16b-76908f60e426","resolution":{"observed_at":"2026-05-20T06:58:05.989905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-08-04T23:46:51.654336Z","title":"IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-06T23:32:52.420159Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.654336Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:21d95a6f5075fd2b04ee26461beecaa7df01b4c08633a8c758a34bd81ac7026f","observation_id":"d890eb34-3b8c-4d7c-8973-4ab572bb59d4","resolution":{"observed_at":"2026-08-04T23:46:51.654336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07990/citation-record","integrity":"/paper/2507.07990/integrity","json":"/paper/2507.07990/citation-record.json","paper":"/paper/2507.07990"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:32:44.920094Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.920094Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:416afa4ce534e0c1b605cf36bbab3eeb63d5be788907903c8531ed39e36dde96","observation_id":"246b891c-bda5-48f4-b44b-df2299f204f7","resolution":{"observed_at":"2026-08-06T18:32:44.920094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.429946Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"a269a57a-8cb1-40b8-8d73-3d04eaa34ed2","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.007491Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8b9b609605ae532418c57ee3d400880a98dbc1bd0a26572b3f205b521c744ab4","observation_id":"7d0f0eb4-1003-46b9-83f2-6d8fd01db424","resolution":{"observed_at":"2026-08-06T18:32:53.444166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-06T18:32:45.136591Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.136591Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:684cd0387934e9f9e57ff993db2cbf1ef1cb50a08e292fea9a217789f7dcbb06","observation_id":"1d098822-e46e-43ba-98be-c0a9f7a2e67f","resolution":{"observed_at":"2026-08-06T18:32:45.136591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.406154Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"73e163c6-627a-422d-8085-691304a6dc14","year":2017},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.252215Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9db2f455346a589ed8193b43eb79bd6b01b56bb66dc21e83637d133cf189a57d","observation_id":"0670cd7b-274a-459c-8110-fa130e3564d1","resolution":{"observed_at":"2026-08-06T18:32:53.411633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.386511Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"31fd9ad9-4c77-4f53-9781-46c01b275f41","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.386772Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:3d590e47c10929ee561c59b4f223925fbae1eaf9646fd73d72a78f9fadf30815","observation_id":"19b8f3b1-b4e2-4330-b2cc-7d25e356367c","resolution":{"observed_at":"2026-08-06T18:32:53.392591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.366721Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"4617d82b-e914-4ee6-8d28-ad46fc6a95c5","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.517307Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:50803e8a73041a56c554bb67d58d8af5cfafce3fd5e8ef81fd06841e98528674","observation_id":"37f2bc3d-cab8-4313-b194-437375aacf32","resolution":{"observed_at":"2026-08-06T18:32:53.374669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.345478Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":"3d48c1f2-b708-431e-afc7-dc947159e5a7","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.618165Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c25a95e90c9d2a4af4fe3ae6f0e6c21cc409d6c62cd6a2978f6873c8ccd2070d","observation_id":"b7c8df05-599c-413e-b4df-e5ea529487ce","resolution":{"observed_at":"2026-08-06T18:32:53.352568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.324351Z","title":"vid-tldr: Training free token merging for light-weight video transformer","venue":null,"work_id":"84cd3fb1-e2a6-40b2-849f-2197f31cff7a","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.710034Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:5bab520eb23f72c4d903aceef5144a26e1f8af19ac59f41049fcf39579bd5d3a","observation_id":"e62eee1b-61e5-463a-9b3c-2e7f17199433","resolution":{"observed_at":"2026-08-06T18:32:53.331836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.298647Z","title":"FlashAttention-2: Faster attention with better par- allelism and work partitioning","venue":null,"work_id":"59bf344a-772d-4e34-b485-8de499c8ec22","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.804392Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8942e5c598a3ddfae91a244abf7d888f91d14f61b44c1cd9bbab7dd5f2645d68","observation_id":"5e573a74-dfd0-4e4c-b898-554117a8c69a","resolution":{"observed_at":"2026-08-06T18:32:53.306539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.278570Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"de72764b-2401-4fd8-9a9b-053e84975f0b","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.866227Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c991d3329e790910c6360e6d2d8a661d7876d0a43eb72c6c3382e7ca392ad63b","observation_id":"be0085a3-55d6-4f57-a88d-a988eef926be","resolution":{"observed_at":"2026-08-06T18:32:53.284441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:32:45.999654Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.999654Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:e827f835a4b2aa3f73c9bdf93cd93d0c5d0f63c395edbe03250b74a490d87e9b","observation_id":"ec769102-d618-4f13-a71a-79fbae6b2218","resolution":{"observed_at":"2026-08-06T18:32:45.999654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.259589Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"c8352a11-55e4-4d1d-9009-b60335c09a5a","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.168771Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:52e9341ce63dbff32481d424952f6588ae9d183432bcb4deb95d209c12a86dcd","observation_id":"2f038acb-cd79-4778-b467-fe202eed1361","resolution":{"observed_at":"2026-08-06T18:32:53.265252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.238261Z","title":"Quad trees a data structure for retrieval on composite keys","venue":null,"work_id":"d41a98cf-cc84-42e4-980e-d7613965f872","year":1974},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.273906Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:5030ec302e538ecaca77596b15d013aff64b06e68fea1def9837841ff5de9bcc","observation_id":"77307511-04a3-486b-80c8-5018115eb2da","resolution":{"observed_at":"2026-08-06T18:32:53.245530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.216414Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"45d99bae-64ba-4bd9-92fc-061a08f872f1","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.372576Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8950a03d7f72e78d5526f2388600722d7acd2217690b76203cabf3ea08179f2b","observation_id":"86f94159-5ea6-41b5-a195-dcd31f95a052","resolution":{"observed_at":"2026-08-06T18:32:53.222087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T18:32:46.455680Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.455680Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:3cb8de6be185905968beb7e687ee6f607339020c9cf470fef714408b91f5fbb2","observation_id":"e842939a-c212-4e01-b7fd-dfc93bcc6dee","resolution":{"observed_at":"2026-08-06T18:32:46.455680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.198827Z","title":"Caching — google ai, 2024","venue":null,"work_id":"32db795f-f245-4cc3-86d5-b6fe7ad8632b","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.509746Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1813ba629f30bb6ac119a57730cb3cc290c67dca115e29abb73157a8e4bc8922","observation_id":"f045812b-d2eb-4998-a0d9-76435809e32a","resolution":{"observed_at":"2026-08-06T18:32:53.204484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:32:46.642984Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.642984Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:59bf3005924707d30d5867a80b39718c9c449a0c70b4425827c61f313e17a2de","observation_id":"dcec1c7b-82b6-43cc-bda6-1910dc2673e5","resolution":{"observed_at":"2026-08-06T18:32:46.642984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.759667Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.759667Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:91340bd637e44b4686cde9290083510d56fcf4ff5879342a5f86677618e8fbcc","observation_id":"e5902d98-fde2-470b-9f0e-c750d81456e5","resolution":{"observed_at":"2026-08-06T18:32:46.759667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.165769Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"3420807f-474b-4754-bc0f-c9a3551c1d34","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.855039Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:6e3aabe28a7019bc0c44927ae3f64f278fb651f16280c38507ae0e351a8be689","observation_id":"0d4efc77-4d15-4bd9-85ff-deabb6392d3a","resolution":{"observed_at":"2026-08-06T18:32:53.171666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-08-06T18:32:46.995554Z","title":"Prunevid: Visual to- ken pruning for efficient video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.995554Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:d7330d61b56e8ad4d64a0f0280e67c00c499527428a99c41b3a222495fff4090","observation_id":"d544c777-c601-45fb-a23e-d49639e58b38","resolution":{"observed_at":"2026-08-06T18:32:46.995554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.142684Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"da43fc5d-95eb-4b34-876d-dd202b4e18d1","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.097387Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:4e3ca611a8b702edf5663193c4bc3fa3138c923bb67b108c8451c59a5272fd91","observation_id":"39e5f196-45bd-42c2-a28a-cb5acb60cc83","resolution":{"observed_at":"2026-08-06T18:32:53.148978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.125378Z","title":"Needle in a haystack – pressure testing llms","venue":null,"work_id":"cd206bc2-d579-4bf5-95af-10449b6ede46","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.206402Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c7eb0c970c1b5bfa81eec1eb6ddbcec393072dcc962c93c0ca1482709390ac06","observation_id":"8d0fd6b9-ffdf-4105-9e21-fbf443daf535","resolution":{"observed_at":"2026-08-06T18:32:53.130345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.107926Z","title":"Handwritten digit recognition with a back- propagation network","venue":null,"work_id":"55e8a3d0-fe87-4596-bca0-45320bc8b80f","year":1989},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.301474Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:fd32823c80f27f82bc7da28b0576a7d64845740b5c68817616e2eb0ac0f3f023","observation_id":"e7b38e68-d904-4f5a-b31d-54e76909e05b","resolution":{"observed_at":"2026-08-06T18:32:53.113062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.367536Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.367536Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:eb8758d3bf848a8e93d5ecad5afd8f5365a0c4beccbc3e80932d1af4f2bdd0d9","observation_id":"85685f60-2fb4-4cc9-86df-c99a101a9a0c","resolution":{"observed_at":"2026-08-06T18:32:47.367536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.076392Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"5cc0cebe-e676-441b-8980-4d19dc4a306a","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.470093Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:38e9a24d54718ac7d29c230577e969c81119f129c8f9ad61df8fa171bbe7de41","observation_id":"8b0f4a29-485c-4221-ac3b-4e0064bc0f6f","resolution":{"observed_at":"2026-08-06T18:32:53.081714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T18:32:47.575406Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.575406Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7576d3ad0b0e1fb49038066eec657ee64a58c4645e035573603cb3c3cdee7091","observation_id":"3c22a84a-1f9d-4894-bd7a-ddec8a09b6be","resolution":{"observed_at":"2026-08-06T18:32:47.575406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.055838Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark","venue":null,"work_id":"c88c5ccb-2605-42c4-9aa8-acabb1aff596","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.618941Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:94cadd01bd99f8656f09811086243e304c6ce335621d4fe71b7d75dc377cf14e","observation_id":"e2e21bf8-0ea7-422d-92da-9f74675e0312","resolution":{"observed_at":"2026-08-06T18:32:53.063042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.034399Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"d5ba58fb-92d8-4af2-adef-4a12404d8145","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.732124Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b9b373fbba8844bc6cee802bc89da31c027db35f1fa6cb188c6c24d4bc58ea7a","observation_id":"77420b45-60dd-4a2a-ae06-5c850c902b2e","resolution":{"observed_at":"2026-08-06T18:32:53.042764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.008722Z","title":"Visual instruction tuning","venue":null,"work_id":"54d94179-a22d-4786-b13b-131d98316cff","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.844102Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9448a2c0b4788adca1587fc87f98b574fcb74dc1596aaecec8d76bd0ddf07cd4","observation_id":"bf4da92a-b536-4555-9aed-2d58320ef6c8","resolution":{"observed_at":"2026-08-06T18:32:53.017634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T18:32:47.962155Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.962155Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:53b9d439c53819cd1307e13e62fbb5d17c5bb0b675d547673e0d98ef32b30477","observation_id":"1e5324cc-5866-4d60-a22a-132504cbcc9d","resolution":{"observed_at":"2026-08-06T18:32:47.962155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.983122Z","title":"Ring atten- tion with blockwise transformers for near-infinite context","venue":null,"work_id":"80a6f59f-f35c-4f41-aea6-4276c1a52811","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.093263Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:53f2afb389040fbaf78eae6599d273b901898d6ba2a1d622ad1c6d2c4cb64daa","observation_id":"caeac0d6-d89a-49eb-b1f9-09ba2d3d5223","resolution":{"observed_at":"2026-08-06T18:32:52.989405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.187988Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.187988Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:494a7f18470300c48ad691348b0cb1803698c026231b82469a00c82f3a22ca99","observation_id":"ed03f2a1-23f5-4a19-b587-574980db0d02","resolution":{"observed_at":"2026-08-06T18:32:48.187988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.940785Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"a5c9fc17-477f-4fb3-8204-7a5455ce1a71","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.260745Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:78ee03abd8eb3921c6d4066c6804fd0e9bbf1a702a3c4029d5ff562fb664fbeb","observation_id":"16437856-d4e5-4593-8847-7fa463692fc7","resolution":{"observed_at":"2026-08-06T18:32:52.947353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.907193Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"10f9fbce-f1a2-47c4-856d-f70f4c56cedd","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.312111Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b1806f39869c453543b0feca6e53f10411a490ea8c8cddbe61317e41f95637ac","observation_id":"4b8f8318-4e79-4561-9f1e-926a1142560c","resolution":{"observed_at":"2026-08-06T18:32:52.915585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.876184Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"74840a0b-f025-4bcb-bba5-5833bccdff32","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.362612Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:fbe3d6cbc3775ceb87c8e575eb3229743045614dcefd35d2b70337946f53616e","observation_id":"687cec00-dd84-4cf7-ad26-d5f4fadf6b97","resolution":{"observed_at":"2026-08-06T18:32:52.887336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-06T18:32:48.415433Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.415433Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9c4236b97b98ac52d410ebf3b1b0163482389bde63bea31897a5a4463ea8a41e","observation_id":"83a72fcd-4822-4217-91f4-a59a1769c279","resolution":{"observed_at":"2026-08-06T18:32:48.415433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.851752Z","title":"The quadtree and related hierarchical data structures","venue":null,"work_id":"e1695e9d-404f-4a71-8a61-6f33ab53f5d1","year":1984},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.491626Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7d4bd97b5d33d7014ea19629d3fe1c4c362de6af71ea0a9979eec491388f557d","observation_id":"88fcb5da-9be6-487d-b531-a752d5631b86","resolution":{"observed_at":"2026-08-06T18:32:52.860677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.573421Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.573421Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:615fc62d3046312c3d8e80202fb0f2769482a49ff9d38a0ae8e7a4e1ce34643e","observation_id":"bbe2353b-5f2b-47e9-b11b-23ed357065d0","resolution":{"observed_at":"2026-08-06T18:32:48.573421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.820880Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"6243f248-01bb-4bfd-afdf-010e9213840c","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.647081Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:26c3b2b270b50819e0f99a525b5513aaa7ddf31abfc032198636724e0223f627","observation_id":"7ee7ef49-1ddd-424c-848b-70815a92fcd9","resolution":{"observed_at":"2026-08-06T18:32:52.830881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.725013Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.725013Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:dbfe6fd4e864f1fcb1cac4bfda6361458796f212c25fef9d8bfb5c198fcda588","observation_id":"afe23cbc-779d-4373-be94-3f1a48a468b9","resolution":{"observed_at":"2026-08-06T18:32:48.725013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.779401Z","title":"Efficient quadtree cod- ing of images and video","venue":null,"work_id":"a0715b88-6593-4843-bfd8-5228480be607","year":1994},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.768904Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:189e0dacc2055cc84b74b58199916d5d077ecae62ef48edf9188cdd0ae7d596d","observation_id":"1026ae0b-c4e0-46ae-a06a-306d747fec8e","resolution":{"observed_at":"2026-08-06T18:32:52.786169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.760693Z","title":"Overview of the high efficiency video coding (hevc) standard","venue":null,"work_id":"b4ab9d59-2143-435b-bbee-dadd1ecf3cd0","year":2012},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.839547Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:04255c8ac86966e1934185c8e47d0d9f6e4fc63d9348c75be682c067b9d36e79","observation_id":"827c1b70-8999-44b3-845f-e9a464a8003c","resolution":{"observed_at":"2026-08-06T18:32:52.766030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.686756Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"a51251ff-9dfc-4aa2-b50d-714ae804ad57","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.887333Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:51167eab9cd72e6bac7231c405dcc60081ab5dbdd937431c4e475f8fa8b9095d","observation_id":"1e0ee72e-7428-48f7-b981-87a41aa44524","resolution":{"observed_at":"2026-08-06T18:32:52.739311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.587752Z","title":"Efficiency of a good but not linear set union algorithm","venue":null,"work_id":"f2f4620d-6a2a-470a-8b61-f7f1f9f7e7a0","year":1975},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.958480Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:550985189fdf4469985e01a5823d83f35787b6beb21c640e9a5930ac716ef3b8","observation_id":"1928e642-4168-443d-9c79-469fbc97316f","resolution":{"observed_at":"2026-08-06T18:32:52.619484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T18:32:49.021249Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.021249Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7b210146d6ee8a5b805f020ac049595a28608be8486c174151521669d80ccbc5","observation_id":"b26d5fc4-c105-4f25-9614-c9a0da4e329b","resolution":{"observed_at":"2026-08-06T18:32:49.021249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.446473Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"33334c95-7ec8-478d-9955-20ed6f9fbb66","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.081969Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:6157367cc67321fba7882a23a35a9ab2497954bd9a0f039bf0bebb5cd71d0d39","observation_id":"c7ba62c1-f17b-40e1-b81c-0cf3e1fadad7","resolution":{"observed_at":"2026-08-06T18:32:52.511623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:32:49.147349Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.147349Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:704f3b82e6689ee3e0255beb0b02c1c0e706d863138a1bf04ca7bff81d260adf","observation_id":"f213867e-cd85-461f-836d-1cc6c5668753","resolution":{"observed_at":"2026-08-06T18:32:49.147349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.326362Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"c2495b60-5c31-4cfc-82b6-c21c7a83a8ef","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.185062Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:d0a790db837e5e6ba8f812ce66d1597db0d7bdfb29dd4f2acdd3312e04c88540","observation_id":"56b383c2-f3a5-4120-99e2-96f1213e87d4","resolution":{"observed_at":"2026-08-06T18:32:52.371957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-06T18:32:49.280218Z","title":"Look-m: Look- once optimization in kv cache for efficient multimodal long- context inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.280218Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:0dfc0009d872fab559d3056b4d2a69be5f36bb1b4e830d705c812b0ef0b61754","observation_id":"50d62950-433e-436a-9662-4ce9c855f577","resolution":{"observed_at":"2026-08-06T18:32:49.280218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:32:49.345961Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.345961Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:634ac0bf59c7b9620300da825e0379c17993998190a092ecbfecd2f1e2d1cc65","observation_id":"c5a0000c-cdb7-4c5a-8f89-03803715ded6","resolution":{"observed_at":"2026-08-06T18:32:49.345961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-06T18:32:49.423515Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.423515Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:11a942f8e5f323398868c424942ee566c4dd2a5fdbea5558c76205aea106eed7","observation_id":"0778abac-b905-4d0b-ab9a-8dd7e3b71467","resolution":{"observed_at":"2026-08-06T18:32:49.423515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.185879Z","title":"Sullivan, Gisle Bjontegaard, and Ajay Luthra","venue":null,"work_id":"0e9fedb7-f93f-488a-9b43-f319baabfcf1","year":2003},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.484414Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b1a48c3b58f0b07c1926ceaa72fed17ae201c74f184c5024c1d22ad57ea7f29d","observation_id":"8884aa8f-17de-46c5-99ab-cd1704ee6913","resolution":{"observed_at":"2026-08-06T18:32:52.254156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.036983Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"fe5c3af7-d764-4408-baa0-bbdbb6609df6","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.577022Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:5edcd140a04e348755bd1ac4fb7a8d3f16303eccc6e4f7ed09b34c3e853c97c0","observation_id":"abe2f266-b145-441e-9c51-376e10e9557d","resolution":{"observed_at":"2026-08-06T18:32:52.120020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.636803Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.636803Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:39648b2e1f466b355900feb7aaca080261556098a6c2dd1359835d195574517a","observation_id":"94cc60c0-1937-4263-a654-9ed27861d065","resolution":{"observed_at":"2026-08-06T18:32:49.636803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.888266Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction","venue":null,"work_id":"742a3e9c-db65-4bfb-96d5-701ced8848a2","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.707972Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:528b8ae1319db2aee88509ab76a1c139949fd1bcd5f76afbbc97ea17d75410d9","observation_id":"7560d55b-5148-499d-92b8-ca763da865a8","resolution":{"observed_at":"2026-08-06T18:32:51.945416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T18:32:49.783006Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.783006Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8e0c23079472ea39ab66265de78d30085ab951e18b6d62e9a773400b46121ea3","observation_id":"45a6af3d-703e-4459-8708-f0a4d375049e","resolution":{"observed_at":"2026-08-06T18:32:49.783006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T18:32:49.863938Z","title":"Pyramidinfer: Pyramid kv cache com- pression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.863938Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c1e1383bd3b6a1dbfe95a7153205ebd810f4c49c74155d781b4367a00655fc56","observation_id":"5c385049-5d20-4389-bb81-fc98a8695fd0","resolution":{"observed_at":"2026-08-06T18:32:49.863938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.738137Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"719122f4-5c98-4de6-b81c-414378da7cd2","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.034259Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:f1e9a6a03659ddb3aee0005d790935db0e3ea75ff69456d442f812521c174566","observation_id":"e182b257-b922-4262-ad32-3d431f68bda0","resolution":{"observed_at":"2026-08-06T18:32:51.847754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T18:32:50.185274Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.185274Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:044aca5492270ed8c7b1b3ffc24aeed2eed29033255234ef1157d0aa49cb8a1e","observation_id":"602199ed-14c7-4fbf-9815-939352dc8fa4","resolution":{"observed_at":"2026-08-06T18:32:50.185274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T18:32:50.312891Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.312891Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:43116cbbb5f8b27f3aeeb76e4068e9d6aae762978acfe390464c6fc42d43f259","observation_id":"dd7c2631-a2ca-43c3-be08-e90da971380a","resolution":{"observed_at":"2026-08-06T18:32:50.312891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T18:32:50.442322Z","title":"Needle in a video haystack: A scalable synthetic evalua- tor for video mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.442322Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:da3a18b8c7fd9836ac10962437ebb02e10df2fa0fed1268ec6e94d6ce50fab4d","observation_id":"f3fd2480-95fc-42f5-8e71-53514a96b734","resolution":{"observed_at":"2026-08-06T18:32:50.442322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.595904Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"89bb41e6-91df-4436-9d23-24f08d394927","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.667041Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:e4480afad8a1d529c626cdaf63045ba98df200d3a803ddb338761882596a1f03","observation_id":"a7e64a4e-366b-4623-9790-6ec1045e116f","resolution":{"observed_at":"2026-08-06T18:32:51.646767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.526312Z","title":"11 to 14 show the absolute values for the main comparison results","venue":null,"work_id":"a78ef21c-7866-4c02-af40-3195dddf5a04","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.801112Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:be8fc977e1f29200ae55c0ab6de8f55151c6af638639418a289a63cf2ba6a891","observation_id":"d05ef8e8-af0a-4b5f-8c80-030feee8b836","resolution":{"observed_at":"2026-08-06T18:32:51.576968Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 4 inbound Pith citation observations for arXiv:2507.07990."}