{"as_of":"2026-08-07T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ad1cacf13e423c74b5bf14813f0c09476b202c6c58017627459d0016a0a0643","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:56:05.308899Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T18:36:44.180127Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-07T10:56:05.308899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-07T10:47:31.423763Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.308899Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:5273eda7c04fb9c5bdd2af985a8650986836f4b64790e84344c4a3ea4c8c3754","observation_id":"a916a4f9-d205-473b-b4f7-13df30d1a489","resolution":{"observed_at":"2026-08-07T10:56:05.308899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T23:51:05.316975Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16054","last_updated":"2025-06-19T06:25:02Z","snapshot_observed_at":"2026-08-07T13:41:59.610268Z","submitted_at":"2025-06-19T06:25:02Z","title":"PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.316975Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.16054"},"observation_digest":"sha256:d2e0cd57928e8d14af034d8fecc7154665524aa2d78022c005632e815df1800e","observation_id":"ca7d1ebe-c8c2-49ed-9433-75b741fd4dc1","resolution":{"observed_at":"2026-08-06T23:51:05.316975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T18:32:46.455680Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.455680Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:3cb8de6be185905968beb7e687ee6f607339020c9cf470fef714408b91f5fbb2","observation_id":"e842939a-c212-4e01-b7fd-dfc93bcc6dee","resolution":{"observed_at":"2026-08-06T18:32:46.455680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2509.08016","last_updated":"2026-04-09T01:22:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T00:55:04Z","title":"Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T18:35:01.328250Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2509.08016"},"observation_digest":"sha256:796f49f31a524665b4b904ba02aefe7d9ba02811e18945555d0e9101f6f62c97","observation_id":"6c4cd2ce-78b2-4a17-a86d-c31cafcbcdc1","resolution":{"observed_at":"2026-05-18T18:36:44.182879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:645e0facfe762032c4d5cd2e5295980ab14403cf47cd26ecbcc74cdafe928902","observation_id":"f2b099df-6088-4428-8865-d4a635427214","resolution":{"observed_at":"2026-05-15T18:26:26.952439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-08-03T01:43:21.251112Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:0254db6a4b56d5c21df4ff7cd8efb8aa21ceaa450d4c69c10ea3f844a6a406b6","observation_id":"f1fb8254-03a9-498b-8f29-a67fafa8698c","resolution":{"observed_at":"2026-05-15T00:58:25.578048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:df4cc62b7ffedc8192b1754bb5cd4a4d130ef2bb42412d26d6d3617da053d008","observation_id":"e751a35f-1465-4842-b509-70896a92690c","resolution":{"observed_at":"2026-05-11T06:56:04.303398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:fe46f41efaca14deb9a27b6d771a8ca119ca14db001e5731b69dafc6a2fefad9","observation_id":"283bf54e-4e36-456a-8fb0-281b24c26d04","resolution":{"observed_at":"2026-05-11T23:11:13.939144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.11803","last_updated":"2026-05-12T08:58:49Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T08:58:49Z","title":"OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:36.807884Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.11803"},"observation_digest":"sha256:12f21cbde808f35fb4f7b42499d9b7b5ac4e2397909c167d0e01cd23334d9407","observation_id":"d7ea209d-850e-41a8-a95d-ce6317404937","resolution":{"observed_at":"2026-05-13T05:52:22.314857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:3afb070d272a7b758f4e4c76773474cca97a68292d308bbd7eb4a82b266196be","observation_id":"e387f156-1e65-4a9d-a278-1fd740ff47d1","resolution":{"observed_at":"2026-05-13T04:52:16.246111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01986/citation-record","integrity":"/paper/2501.01986/integrity","json":"/paper/2501.01986/citation-record.json","paper":"/paper/2501.01986"},"outbound":[],"paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2501.01986."}