{"as_of":"2026-08-08T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4b216fd4a709696ac57a696cbfc9e744a5e24421345e57759d7b934e75e0d17","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:41:15.586140Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T17:05:52.493660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:08:00.954550Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"cited_work":{"arxiv_id":"2508.21044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmg-vid: Maxi- mizing marginal gains at segment-level and token-level for efficient video llms","venue":null,"work_id":"b7fd4ad9-ea98-4087-810b-822ebaf383ad","year":2025},"citing_paper":{"arxiv_id":"2604.04055","last_updated":"2026-04-05T10:59:48Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T10:59:48Z","title":"DINO-VO: Learning Where to Focus for Enhanced State Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T17:05:52.493660Z"},"links":{"cited_paper":"/paper/2508.21044","citing_paper":"/paper/2604.04055"},"observation_digest":"sha256:cc5848275ddab3455a91980afeb3d3ca3d7ff532aa60279e0a2cebf147ebe69f","observation_id":"29f1ba24-1c86-4ce9-8209-8e21e967bea8","resolution":{"observed_at":"2026-05-13T17:08:00.956426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"cited_work":{"arxiv_id":"2508.21044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmg-vid: Maxi- mizing marginal gains at segment-level and token-level for efficient video llms","venue":null,"work_id":"b7fd4ad9-ea98-4087-810b-822ebaf383ad","year":2025},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-02T23:37:34.955988Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2508.21044","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:7bf6b7694d742e74094fe0107ce974ff89ebf38279c1820a3bec6c75bf176cb7","observation_id":"d356d0ca-6110-45a7-ab72-1ed6e6e22b76","resolution":{"observed_at":"2026-05-10T00:49:48.956060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21044/citation-record","integrity":"/paper/2508.21044/integrity","json":"/paper/2508.21044/citation-record.json","paper":"/paper/2508.21044"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-08-05T14:41:15.535604Z","title":"Li, B.; Zhang, Y .; Guo, D.; Zhang, R.; Li, F.; Zhang, H.; Zhang, K.; Zhang, P.; Li, Y .; Liu, Z.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.535604Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:b352a2ef68be0bbecf87e87c86cb53fa87bcdc4892626a0c02ec555fba39bd24","observation_id":"f29c4805-84c0-4a34-92c7-6508dc49d3ec","resolution":{"observed_at":"2026-08-05T14:41:15.535604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.541099Z","title":"In European Conference on Computer Vision, 323–340","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.541099Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:e832d1534664d8de7b101a3a2c3faceacd76e6d332d2d2e5c996f3dd166313cb","observation_id":"ce4e96b2-8cef-4572-8cf7-50b4b1ef4c25","resolution":{"observed_at":"2026-08-05T14:41:15.541099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.547335Z","title":"arXiv preprint arXiv:2403.15388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.547335Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:977278e4d5c1e0b3b527de37cbc0fedff569784c6a8b94ed67b0e5167c37f4af","observation_id":"cbfd5e3d-863a-4930-afec-362e3a42d90c","resolution":{"observed_at":"2026-08-05T14:41:15.547335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.552875Z","title":"arXiv preprint arXiv:2505.21334","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.552875Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:fefc7dbc66147ae56846666c3410c4cd9627064598e4d0b8527aa2ef2130def5","observation_id":"1fb9ee88-8002-412b-98db-60ff0724ad84","resolution":{"observed_at":"2026-08-05T14:41:15.552875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.559338Z","title":"arXiv preprint arXiv:2503.11187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.559338Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:1a6a1e4811bba0e68650a05e12968a1a80619849adae9155f5da40bfa8fa9d76","observation_id":"e844714e-1986-46ad-abc5-1084ac886157","resolution":{"observed_at":"2026-08-05T14:41:15.559338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-05T14:41:15.565494Z","title":"arXiv preprint arXiv:2506.21862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.565494Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:453ff6ac6fd5c433227677e8372fddb5366baa9956bd8eba4164a05f2ce31d18","observation_id":"6e288fbc-89bf-4447-b45b-1edfde484ffc","resolution":{"observed_at":"2026-08-05T14:41:15.565494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T14:41:15.570938Z","title":"arXiv preprint arXiv:2409.12191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.570938Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:97e5e63128de82bd295cc4f87bf65f7d9a38b93cb8d258ac6e9828063b28d03a","observation_id":"ea89fa3a-6c78-4761-b489-6d1bd969cae8","resolution":{"observed_at":"2026-08-05T14:41:15.570938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T14:41:15.575985Z","title":"arXiv preprint arXiv:2410.17247","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.575985Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:15603ec95a17609f30629318011eb9442a33c8e7c0e5f39aecc94133841aadbc","observation_id":"e26d286f-8408-4b14-bce5-80b80213c53a","resolution":{"observed_at":"2026-08-05T14:41:15.575985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T14:41:15.580800Z","title":"In Proceedings of the Computer Vision and Pattern Recognition Conference, 29836–29846","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.580800Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:982457262e638a4b3fcb02b96c28b72765ea8a34b4253896ead6165b8f40bd34","observation_id":"f5871a72-838b-4606-a26c-86655c41fd12","resolution":{"observed_at":"2026-08-05T14:41:15.580800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T14:41:15.586140Z","title":"arXiv preprint arXiv:2406.04264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.586140Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:e1616be8f55199de7005b34c9d57045be586e5110142d43306b69b814fd286f3","observation_id":"3852654f-126a-4d63-bc82-d74c946be87f","resolution":{"observed_at":"2026-08-05T14:41:15.586140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.530096Z","title":"arXiv preprint arXiv:2411.17686","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.530096Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:cc236a358ce32c39180a498da7373665e6262f7f0c086932756ba1e61ed8b0ff","observation_id":"5901147d-987a-471d-a87d-180b646201cc","resolution":{"observed_at":"2026-08-05T14:41:15.530096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T14:41:15.525180Z","title":"In Proceedings of the Computer Vision and Pattern Recognition Conference, 9392–9401","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.525180Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:32eeed51899541f87482a8ab037a9f713d258af1ea3a8b0a55d39bde04de214f","observation_id":"09ded1e6-3c85-45f7-881a-d26649f03049","resolution":{"observed_at":"2026-08-05T14:41:15.525180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:25:08.974964Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 2 inbound Pith citation observations for arXiv:2508.21044."}