{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6e7bbf4652477ba1fc72c197f8131328f56a5f94934fb45f094387775a0e704","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:02.863981Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T21:37:55.887477Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-07-13T21:37:55.887477Z","title":"Quickvideo: Real-time long video under- standing with system algorithm co-design.arXiv preprint arXiv:2505.16175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.20190","last_updated":"2026-06-09T22:16:34Z","snapshot_observed_at":"2026-08-04T20:13:17.293244Z","submitted_at":"2026-03-20T17:59:25Z","title":"CoVR-R:Reason-Aware Composed Video Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T21:37:55.887477Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2603.20190"},"observation_digest":"sha256:955f53b197af59b8458fcf29e27f909fdf2dec6acab095b5e36d6f41ef9274bf","observation_id":"c3255245-49d4-4b80-a211-f65760303b0c","resolution":{"observed_at":"2026-07-13T21:37:55.887477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-07-13T09:09:32.932051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.06035","last_updated":"2026-06-02T01:46:36Z","snapshot_observed_at":"2026-08-06T06:50:01.259424Z","submitted_at":"2026-04-07T16:30:54Z","title":"cuRAMSES: Scalable AMR Optimizations for Large-Scale Cosmological Simulations","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T09:09:32.932051Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2604.06035"},"observation_digest":"sha256:658e3521164081805ca3373a8ee380405996293e4fdeeaa0c8462da650a63088","observation_id":"f928d3bc-10f3-4e00-a3ea-9b161ef66450","resolution":{"observed_at":"2026-07-13T09:09:32.932051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":"2505.16175","doi":"10.48550/arxiv.2505.16175","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","venue":"ArXiv.org","work_id":"73a0edd0-985c-479b-a79a-d4ba2d6f3ee2","year":2025},"citing_paper":{"arxiv_id":"2604.06036","last_updated":"2026-04-09T09:40:36Z","snapshot_observed_at":"2026-07-06T22:54:34.877944Z","submitted_at":"2026-04-07T16:31:45Z","title":"CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:26.555395Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2604.06036"},"observation_digest":"sha256:b06949b9110fedb391e3dba3fb0d3073775ea3c24fbcf97f8bb7b42b8ad89b0e","observation_id":"8bdc8817-a71d-4a51-8316-bb6c919749e2","resolution":{"observed_at":"2026-05-11T00:00:52.799503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":"2505.16175","doi":"10.48550/arxiv.2505.16175","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","venue":"ArXiv.org","work_id":"73a0edd0-985c-479b-a79a-d4ba2d6f3ee2","year":2025},"citing_paper":{"arxiv_id":"2604.10060","last_updated":"2026-04-11T06:54:56Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T06:54:56Z","title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:36.133404Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2604.10060"},"observation_digest":"sha256:cb4b50cbe7eb7b0b9bc9cdf9cfcc489a37d79f1042128c86cdf5f62e3f053cb0","observation_id":"d625753e-86c1-4920-8ef6-d5fcf85243e5","resolution":{"observed_at":"2026-05-10T16:10:34.374605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":"2505.16175","doi":"10.48550/arxiv.2505.16175","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","venue":"ArXiv.org","work_id":"73a0edd0-985c-479b-a79a-d4ba2d6f3ee2","year":2025},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:5c02584d51bfd2abaae1f984c2dc9f2bcbc0bfc6995afdcc7232147ded93e246","observation_id":"3df7cf18-54bf-490a-bce5-0e112bc67269","resolution":{"observed_at":"2026-05-11T23:11:13.760186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"cited_work":{"arxiv_id":"2505.16175","doi":"10.48550/arxiv.2505.16175","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","venue":"ArXiv.org","work_id":"73a0edd0-985c-479b-a79a-d4ba2d6f3ee2","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2505.16175","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:365b4b36ec54299909b3c6c036977b2378f09956cbe29285c09a2cf9c18f3dbb","observation_id":"42def0b6-30ec-4fda-a44a-e3722280bbdc","resolution":{"observed_at":"2026-07-02T17:27:15.530520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16175/citation-record","integrity":"/paper/2505.16175/integrity","json":"/paper/2505.16175/citation-record.json","paper":"/paper/2505.16175"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T15:08:57.325344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:57.325344Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:043677a6a237920613321b24fb49b8b064e1cafc28963e571bcf8f0fb223f42f","observation_id":"ad220a81-1908-4937-95dd-ef66c6e778ae","resolution":{"observed_at":"2026-08-07T15:08:57.325344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04533","last_updated":"2022-12-12T07:53:17Z","snapshot_observed_at":"2026-08-08T00:46:24.362202Z","submitted_at":"2022-12-08T19:50:53Z","title":"Deep Architectures for Content Moderation and Movie Content Rating","version":2},"cited_work":{"arxiv_id":"2212.04533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.04533","snapshot_observed_at":"2026-08-07T15:09:03.887873Z","title":"Deep Architectures for Content Moderation and Movie Content Rating","venue":"cs.CV","work_id":"d4549297-987d-4d47-a64e-bb7d67babba1","year":2022},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:57.466754Z"},"links":{"cited_paper":"/paper/2212.04533","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:d6cb692df05b30e57e92a8586ad68ea2cb99be1152288bc04fb1337a1ca179b7","observation_id":"3f980e2e-5d23-4ff3-b0f0-3c5d3cccaf3e","resolution":{"observed_at":"2026-08-07T15:09:04.034398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:07.474782Z","title":"Amazon ec2 p5 instances","venue":null,"work_id":"6764fe51-4a10-480d-be20-60b4ff1892ed","year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:57.597010Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:5f0e4771bd8b7af91dfe62e8851a842c6e5175a2a66f69d381cc69d5c94501ef","observation_id":"2ac4bdae-3bda-4181-858f-70268bb873ac","resolution":{"observed_at":"2026-08-07T15:09:07.635821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:57.755911Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:57.755911Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:8ba286c52ff062170c4611353776994ec58b26a13fd1b01f7b5cb7aa62f270ec","observation_id":"252502dc-737e-48bd-ad87-fce68d6b572d","resolution":{"observed_at":"2026-08-07T15:08:57.755911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:07.249744Z","title":"YouTube: hours of video uploaded every minute 2022| Statista — statista.com","venue":null,"work_id":"f564efab-b082-4e75-af5c-d29945c00f7a","year":2022},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.001673Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:82e36b934f5a211263181a286f85b350c3da52d0c18cec608b822088b18f79ec","observation_id":"fbf6c014-a83f-47b5-8413-cfae70d5ef7b","resolution":{"observed_at":"2026-08-07T15:09:07.331028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:07.056825Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"df75b22e-c199-47ed-acd0-906a2c6dad49","year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.182960Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:616d7814be26009c2b188b896a519dce65c0da75afc19eb00bd60bb0948313e9","observation_id":"8d9b09a8-591c-47ad-9595-2972c42d2b4b","resolution":{"observed_at":"2026-08-07T15:09:07.158292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:08:58.336854Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.336854Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:d8fd894591df47c5153f50973fb2bcbf4284a79befd83c9f3589b5fc06ac3097","observation_id":"cfd80a0d-2535-4e0e-8341-55ac8772c364","resolution":{"observed_at":"2026-08-07T15:08:58.336854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T15:08:58.643779Z","title":"Flashattention-2: Faster attention with better parallelism and work partition- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.643779Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:456c1e8dd8b39c33a87f9a1e9766d8dd510ee1772bcae57ebff044de2b642fdf","observation_id":"811c1184-7641-4290-a1b1-cf8ad31f6424","resolution":{"observed_at":"2026-08-07T15:08:58.643779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:58.734457Z","title":"A simple and effective l_2 norm-based strategy for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.734457Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:f408844e4e8cc732238709e220f06830d5773f5957050c06aa6eb03a46d2ca8b","observation_id":"64bf8cb9-74cb-4ed2-8d39-8b08676803cb","resolution":{"observed_at":"2026-08-07T15:08:58.734457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:06.783229Z","title":null,"venue":null,"work_id":"a7ce73ff-e895-4a05-97a0-13e5c69a71d4","year":2019},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.825571Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:68187a4b331973f3ae59d085b84d0c670d1ea46610d1fb3e0893551f3f5e9e5f","observation_id":"9063a399-1985-458e-8132-c815e7c1f289","resolution":{"observed_at":"2026-08-07T15:09:06.915683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:06.488489Z","title":"Global Expansion of AI Surveillance","venue":null,"work_id":"abcb795b-4681-4110-a9d4-ed966c4b0962","year":2022},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.938549Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:f7d54faccaa801533cec720e19eec3bf49d9a070b70a72f5e4229ce34dfc3ada","observation_id":"c6b01153-5754-4bcb-9386-c324953cad71","resolution":{"observed_at":"2026-08-07T15:09:06.612281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T15:08:59.036704Z","title":"Video- mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analy- sis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.036704Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:16145aeb8477582fe15a0a63d4e55b8844ed3fa3f838298386178cdb0dbfbdc8","observation_id":"aefb289d-6cb3-4faa-9153-0fb45712fa7d","resolution":{"observed_at":"2026-08-07T15:08:59.036704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:06.231108Z","title":"Gpu machine types","venue":null,"work_id":"c0b258a4-ec74-4d29-b53f-72d0d1a81aa2","year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.124942Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:7634d785d5be3a36d2f19a8ac870e3718b012632e916095e35dbac43cd2e162c","observation_id":"bd9548cd-1a58-47a9-a7f1-e3b680b73237","resolution":{"observed_at":"2026-08-07T15:09:06.360188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:05.971781Z","title":"Attention score is not all you need for token importance indicator in kv cache reduction: Value also matters","venue":null,"work_id":"f1866ae1-9e4d-4971-81e4-c9fdb8095a20","year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.275533Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:f58c786d6740dcbf08e1e85d5e4ca9b2a0d1346a9b9bef93bb47b4616b169452","observation_id":"2de940d4-e8e9-4719-8d0e-5928ab4f91f4","resolution":{"observed_at":"2026-08-07T15:09:06.109502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:05.745593Z","title":"The video codec landscape in 2020","venue":null,"work_id":"779c0cb0-4dbf-43cf-a369-f5cadae2a5f7","year":2020},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.378650Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:45a5de81641a07baf880c54b430a3f32445ad8d98fe238236744caeeedf21720","observation_id":"b54852ed-8063-4b14-8351-72249f017395","resolution":{"observed_at":"2026-08-07T15:09:05.835354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:05.470989Z","title":"Mpeg-4 overview","venue":null,"work_id":"d2375542-d6ee-4d49-9818-e3abe027d5c3","year":1999},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.495223Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:34bb2ddb33052a4eddfb674125b46405fe3bad2538485133a7d43740859011e5","observation_id":"c2d29906-50b1-4075-b8a9-94a8ac06066b","resolution":{"observed_at":"2026-08-07T15:09:05.600116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:59.606163Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.606163Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:4f6b834faad8bd23b25abd604a2915f12e9b4600e6a42ed36b7bd2a72335a40d","observation_id":"db9fcf24-695a-4aec-a574-7ae3ef652bb9","resolution":{"observed_at":"2026-08-07T15:08:59.606163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:08:59.692862Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.692862Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:423d061256194844a9494ff9866234d6e3243105c3768c3740e8c5587bd1705a","observation_id":"12fb61f6-4b5d-4952-aa51-67b730de0eb5","resolution":{"observed_at":"2026-08-07T15:08:59.692862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:05.250035Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"c0a21d07-7269-4af4-b5d5-6ea0944e16a2","year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.745158Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:f9a2ea72d4e7e140b5d7045232211c9521a2b29ec3db892424aeff4f0223cc69","observation_id":"ac245947-e8e5-4ba4-898e-2918d830290a","resolution":{"observed_at":"2026-08-07T15:09:05.331274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:59.809043Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.809043Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:11a13fdf6a088ef2c1545d892d9f870a6e883fa3aa45c78e0115870b74b37db1","observation_id":"71d3d810-404c-4111-99a7-9e411e6639ed","resolution":{"observed_at":"2026-08-07T15:08:59.809043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:08:59.880737Z","title":"Torchvision: Pytorch’s computer vision library","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.880737Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:fa6aa29c401802d9b0a302bb78f97ac0af40c0e3986b95bc40abc0872aae23fa","observation_id":"9552e308-723a-4e74-bdbc-aa9c6648000a","resolution":{"observed_at":"2026-08-07T15:08:59.880737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:04.982758Z","title":"Nd-h100-v5 sizes series","venue":null,"work_id":"5146fd76-54e8-4476-9734-02ef075c0d50","year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:59.924660Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:6cd8d6248161a0e2962e219c8a7a6d8e329a75208fee2dbb021760b5a1618ab7","observation_id":"96f232b4-0979-4d45-8381-e1451d40afc5","resolution":{"observed_at":"2026-08-07T15:09:05.109963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:04.730054Z","title":"Slowfocus: Enhancing fine-grained temporal understanding in video llm","venue":null,"work_id":"4b3429ec-fe10-45f7-87d2-0b51ccc4f749","year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.015450Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:5ca77afc32cdd5981faddf0988f7a094ab523cd9dd35ff27923969d4bac6ea7d","observation_id":"2658dd93-e59c-4028-a90c-33833fc8716c","resolution":{"observed_at":"2026-08-07T15:09:04.842954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T15:09:00.103049Z","title":"Cosmos world foundation model platform for physical ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.103049Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:c1d376038f2067b1a5d94a32bd2e4e521dc1df85ed56ef273d53a34da495f8fc","observation_id":"4e2ee009-0eea-42d5-80d2-b1e18af85000","resolution":{"observed_at":"2026-08-07T15:09:00.103049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:04.445814Z","title":"torchcodec","venue":null,"work_id":"50baaeb3-6c70-4731-af69-4df1055ee73e","year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.206310Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:3d9b277b8815b9a2efb202700785cc58e507f0463769be46376d4e6c2703a513","observation_id":"f0ec15a1-ae3c-48d0-8bb1-3800a70dee46","resolution":{"observed_at":"2026-08-07T15:09:04.570573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:00.322271Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.322271Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:4c0d15fd1bb4495534572e60e0f7d2723ffcaf4355c949d45d5e82192f1562b8","observation_id":"2dcecacd-925a-46e2-b249-3da4fd109665","resolution":{"observed_at":"2026-08-07T15:09:00.322271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T15:09:00.413151Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.413151Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:bfaba87ed3387dc0a8ec85db102fd5f9f10be9ce7787553edcb66d6555eadc9c","observation_id":"89736361-1637-42ea-a8a8-008f86d131d4","resolution":{"observed_at":"2026-08-07T15:09:00.413151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:00.505815Z","title":"Reducing traffic wastage in video streaming via bandwidth-efficient bitrate adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.505815Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:b1b778bd616e1b72f9f39c0978248cb581ba25f5d6f221609c7ac6f25b920f0d","observation_id":"bf034485-8057-420d-aab4-16d8ef8b1483","resolution":{"observed_at":"2026-08-07T15:09:00.505815Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:00.626260Z","title":"Sullivan, Jens-Rainer Ohm, Woo-Jin Han, and Thomas Wiegand","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.626260Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:c80ffb6084ae96c52a1075491d85b704b01eb04553bdd44e623ced8493499e50","observation_id":"2271bb92-5821-4c86-808c-57a53eba606e","resolution":{"observed_at":"2026-08-07T15:09:00.626260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:00.747842Z","title":"Converting video formats with ffmpeg","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.747842Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:769419fd36948e35dd9d6e60d5736a36e9fcdcc3ee0bf989225b9394e33bbad5","observation_id":"7cbbf95d-23e6-4de7-9713-305bd8a0bb45","resolution":{"observed_at":"2026-08-07T15:09:00.747842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:00.846963Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.846963Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:b31b5d0ebd119a2c72259ad52c68f85649faf6d65a736a3c7533baae8dc351d1","observation_id":"d9eb447b-a3df-4d50-88d7-8f26f853b5eb","resolution":{"observed_at":"2026-08-07T15:09:00.846963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T15:09:00.920595Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:00.920595Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:68fbfa8789dbcae486a6a4a22b20668f307b9eea6cd6d3dfbb371e8f706ee0a7","observation_id":"c5a491e5-87fc-457d-b189-90a230f2a774","resolution":{"observed_at":"2026-08-07T15:09:00.920595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T15:09:01.009435Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.009435Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:12f7365eedd2aaae2b1ffed31e07cfa0ebf0dd516d35b42cc9d44261b1d28898","observation_id":"3b4f82a9-424b-4afe-922d-3d11b78ce6a3","resolution":{"observed_at":"2026-08-07T15:09:01.009435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-07T15:09:01.081340Z","title":"Stop looking for important tokens in multimodal language models: Du- plication matters more","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.081340Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:7d7bee58b5ff79cd5e2f58b011f929fda6fc6f282cedd5acab8d45aba53bf7f4","observation_id":"556af35a-f87c-47f4-9e94-d83197cf4798","resolution":{"observed_at":"2026-08-07T15:09:01.081340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03384","last_updated":"2024-07-20T07:17:00Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T11:33:29Z","title":"LongVLM: Efficient Long Video Understanding via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03384","snapshot_observed_at":"2026-08-07T15:09:01.176007Z","title":"Longvlm: Efficient long video understanding via large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.176007Z"},"links":{"cited_paper":"/paper/2404.03384","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:5e137979bebc9c07d94bbdb83c3acb9f76b17b3779d1512ef5fd3d0575ae0830","observation_id":"8d4d7a48-0c57-4724-95c2-1949778989c6","resolution":{"observed_at":"2026-08-07T15:09:01.176007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:01.308068Z","title":"Wiegand, G.J","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.308068Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:4b86e8e8ff87cd47ea0187835f28928559b00850f9e3ac19d5bd3509d3f826ed","observation_id":"21f4183b-859e-434e-81fc-e3e0ce269c87","resolution":{"observed_at":"2026-08-07T15:09:01.308068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:01.428834Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.428834Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:3a287180f634ddc2ba251ee3e0a67d51cf691f181b732397967a1ef4aa4697fa","observation_id":"ddaeca31-db4e-410a-88f6-5ddb7030a003","resolution":{"observed_at":"2026-08-07T15:09:01.428834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T15:09:01.557498Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.557498Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:645be1a57bb5149172b6c77d53d3232ecd45bfd440fe4ad5c3e32ec1c37fa46e","observation_id":"12eb9dac-3327-471b-a1bd-e057e52bebb7","resolution":{"observed_at":"2026-08-07T15:09:01.557498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T15:09:01.693596Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.693596Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:64bb8bf47b514cfd44dee202b506fff7af4973f1bf4db61607c3be6441d8c058","observation_id":"d9797340-f40b-47eb-b2ac-873e1785ae1f","resolution":{"observed_at":"2026-08-07T15:09:01.693596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T15:09:01.834128Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.834128Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:e766f38d004cc3e7835921e1a855367786f3cfe24b2d9ce0394134f476af904a","observation_id":"d845edd9-fd66-4d33-9543-b7d481dec836","resolution":{"observed_at":"2026-08-07T15:09:01.834128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:04.152003Z","title":"Towards surveillance video-and-language understanding: New dataset, baselines, and challenges,","venue":null,"work_id":"e4256a0a-db35-430d-856a-0ea0701c6e48","year":null},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:01.923406Z"},"links":{"citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:996bbdc442832a5d0422f87b06639b2f0d71bdc44481f2481450ba37b7c453ba","observation_id":"b2be132b-8cf0-4626-8968-7c65d98a184e","resolution":{"observed_at":"2026-08-07T15:09:04.292742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T15:09:02.207599Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.207599Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:490773169414c1df4b72429f9d53d13d572cb959d967f17cee7e8d8f83a796ce","observation_id":"a1a68158-024f-4428-8b46-b41501f1b8a0","resolution":{"observed_at":"2026-08-07T15:09:02.207599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-07T15:09:02.326672Z","title":"Barrett, Zhangyang Wang, and Beidi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.326672Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:1a2d990bd43b7b44e3fdd23f89beb8a9fbb1848e5445afa30a5eea587899e8ce","observation_id":"0446f2e1-6718-42ef-9695-d2069951736d","resolution":{"observed_at":"2026-08-07T15:09:02.326672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T15:09:02.433510Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.433510Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:b58e4bd33a615de19481952546beff0c67d73fec042e997076ad3fa341b95677","observation_id":"6c627c0b-e94d-41a4-9e07-decad9278543","resolution":{"observed_at":"2026-08-07T15:09:02.433510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-06T12:45:18.285554Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-07T15:09:02.584217Z","title":"A survey on generative ai and llm for video generation, understanding, and streaming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.584217Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:15d9ebc3b0f207c483a81e96a4e23c9e749a7052bcd472c9b1b7de37d7703e92","observation_id":"aa11f0f8-8e95-4899-95da-55d7c9a06ec2","resolution":{"observed_at":"2026-08-07T15:09:02.584217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:09:02.863981Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.863981Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:48cca55fbfec3f728ecc59ab4f3248ab77b5d21df74cc6907d29bd10e681d968","observation_id":"c3b24cbf-3b98-4fd6-9d57-9e382a28dd35","resolution":{"observed_at":"2026-08-07T15:09:02.863981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13925","last_updated":"2023-12-04T13:34:01Z","snapshot_observed_at":"2026-07-06T16:23:10.371062Z","submitted_at":"2023-09-25T07:46:56Z","title":"Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges","version":2},"cited_work":{"arxiv_id":"2309.13925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13925","snapshot_observed_at":"2026-08-07T15:09:03.098818Z","title":"Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges","venue":"cs.CV","work_id":"727609da-2150-40a2-a04a-7e9f6f26bbfc","year":2023},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.065778Z"},"links":{"cited_paper":"/paper/2309.13925","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:6a9d28cdf91359246198b116a7001b052cd5de8963d6c90d1a3df482baa5f187","observation_id":"b6fc6b63-aef3-41a6-933a-504c6ef83247","resolution":{"observed_at":"2026-08-07T15:09:03.187420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:08:58.536816Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.536816Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:c7ea8e1687a2f0686d06b564dc63d673f2b85a45e8378419c74bb3f964611ab2","observation_id":"ec2dfef2-143e-46ba-a653-f8d36c27625e","resolution":{"observed_at":"2026-08-07T15:08:58.536816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:08:57.859255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:57.859255Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:1a954f9c091b511cce445f469ddb565fbb6e5284b94192895beb70bbd053d2d4","observation_id":"cf2bdaea-b699-480c-8978-b137f78de9a6","resolution":{"observed_at":"2026-08-07T15:08:57.859255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 6 inbound Pith citation observations for arXiv:2505.16175."}