{"as_of":"2026-08-21T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6028ecd22a1ebf20fdd9c590d6cf487175813568b373afa766e93d33a344792f","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:39:08.840327Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05707/citation-record","integrity":"/paper/2608.05707/integrity","json":"/paper/2608.05707/citation-record.json","paper":"/paper/2608.05707"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-08-20T03:23:18.251450Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25979","snapshot_observed_at":"2026-08-15T14:39:08.655128Z","title":"LLaV A-OneVision-2: Towards next-generation perceptual intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.655128Z"},"links":{"cited_paper":"/paper/2605.25979","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:0fb04675aeea01baeae83c9d0ef5719da15487bea72f088dc427716b366b0cca","observation_id":"fee22884-ee9d-4572-a6e7-eb3430ad59c6","resolution":{"observed_at":"2026-08-15T14:39:08.655128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-15T14:39:08.661233Z","title":"Qwen3-VL technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.661233Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:ddb5ced15bd559daa51a73ccd919dcd0ae0d3296862e64fa922272477d40eee4","observation_id":"7fdf519b-8ff5-46c1-a4aa-950f2871d53d","resolution":{"observed_at":"2026-08-15T14:39:08.661233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-19T14:46:37.218640Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-15T14:39:08.665758Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.665758Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:79bfa7a4c1609aaa0b27a5d598375abdd9b9661c219bb5b8afa5dea0cb7fe9a5","observation_id":"a255419b-f8da-42cb-bc6a-271fcbbc047a","resolution":{"observed_at":"2026-08-15T14:39:08.665758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.00983","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.572855Z","title":"Event-anchored frame selection for effective long-video understanding, 2026","venue":null,"work_id":"a327c09f-a132-4f08-a360-eadf670a3710","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.670128Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:df1d194f03237c4ac4a77a73f6cc7ce6065d0c70af3bc9c0f0f2ddbaa128e05b","observation_id":"7693e0ee-425f-4544-9324-faf97550a288","resolution":{"observed_at":"2026-08-15T14:39:09.580633Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.674102Z","title":"Wavelet-based frame selection by detecting semantic boundary for long video understanding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.674102Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:75e7286d2429fcdd9e764e009ed1da9667ee49a1034f00ebed0941e925f7e63f","observation_id":"e95530e5-1449-46c2-8a37-58a5d5b8faa6","resolution":{"observed_at":"2026-08-15T14:39:08.674102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-16T00:44:08.264820Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-15T14:39:08.679341Z","title":"Molmo2: Open weights and data for vision-language models with video understanding and grounding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.679341Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:63cc63713a8c3845a78712a07a3bc8e75000ed129187319b62cc574abbfaaf5d","observation_id":"830fb610-1057-4df5-bf95-459f62dc55f8","resolution":{"observed_at":"2026-08-15T14:39:08.679341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.684598Z","title":"The blur effect: Perception and estimation with a new no-reference perceptual blur metric","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.684598Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:2efad230ce2d9fdc077f3a8fafffca11aba76bf1ccf4f7531df18498866084e1","observation_id":"3ff31317-a781-4cec-9271-dfed0adf97a0","resolution":{"observed_at":"2026-08-15T14:39:08.684598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07707","last_updated":"2024-12-15T03:45:36Z","snapshot_observed_at":"2026-08-19T16:56:44.641239Z","submitted_at":"2023-10-11T17:57:14Z","title":"MatFormer: Nested Transformer for Elastic Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07707","snapshot_observed_at":"2026-08-15T14:39:08.689169Z","title":"MatFormer: Nested transformer for elastic inference, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.689169Z"},"links":{"cited_paper":"/paper/2310.07707","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:7c601e8acdb687eeba0e6c185dd4368b6608555360abfc97944ac52b9f0adbe9","observation_id":"4b2f008c-e1cf-41ed-b984-0d536141ad48","resolution":{"observed_at":"2026-08-15T14:39:08.689169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16032","last_updated":"2025-03-20T10:58:12Z","snapshot_observed_at":"2026-08-19T13:28:16.090978Z","submitted_at":"2025-03-20T10:58:12Z","title":"Agentic Keyframe Search for Video Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16032","snapshot_observed_at":"2026-08-15T14:39:08.694284Z","title":"Agentic keyframe search for video question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.694284Z"},"links":{"cited_paper":"/paper/2503.16032","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:ea77d9ff46c039d8a11cb01f4bdb6c7cac4233ecf4026ed314ed7061e870a0a2","observation_id":"912ec55e-287c-46f0-bba3-64e5e3f65f79","resolution":{"observed_at":"2026-08-15T14:39:08.694284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-21T02:56:38.286351Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24158","snapshot_observed_at":"2026-08-15T14:39:08.699220Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.699220Z"},"links":{"cited_paper":"/paper/2505.24158","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:216055968f232d2d0c9dac36d0bf8656d840c3fad55c79791445e6dfd5dd5fe1","observation_id":"df5b6b56-6f9f-4886-9414-484068385707","resolution":{"observed_at":"2026-08-15T14:39:08.699220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.864763Z","title":"CaptionFormer: Unified segmentation, tracking, and captioning for spatio-temporal objects","venue":null,"work_id":"b1e6a08e-4718-4f50-ba65-f836d1e89f12","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.705289Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:ae25edbf025da9b9cd124b4bb16efb1619045e3e5b76380272d6355a2c5ecbf3","observation_id":"3f9de5e5-869f-4562-bf73-36b4badbadfa","resolution":{"observed_at":"2026-08-15T14:39:09.869309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.850710Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":"a75310b5-2653-49f4-950d-32e20785f801","year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.710011Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:5bee31cec0e1e9f486f2f1976f9bdc2d020191ec2924ef92ed17449d797558a0","observation_id":"4fe15752-7c47-4557-b6f0-b4ee1a3f0d06","resolution":{"observed_at":"2026-08-15T14:39:09.855302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05015","snapshot_observed_at":"2026-08-15T14:39:08.714567Z","title":"Video-MME-v2: Towards the next stage in benchmarks for comprehensive video understanding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.714567Z"},"links":{"cited_paper":"/paper/2604.05015","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:438ceb22590fe1094ca8014586c90a915bb1145cd9e08968be1a80cf6a79cfd1","observation_id":"d84f121f-d0be-4c49-aee4-7260e2bf2880","resolution":{"observed_at":"2026-08-15T14:39:08.714567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-08-16T13:48:07.615752Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-08-15T14:39:08.724129Z","title":"Matryoshka query transformer for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.724129Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:b001a18bb2614f9bdccfd20d3368771c06b26575c81b8cfc9a8919ab4d7ebb5d","observation_id":"d71be289-6e55-4f99-9554-61f1a5ab511d","resolution":{"observed_at":"2026-08-15T14:39:08.724129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.835694Z","title":"Matryoshka representation learning","venue":null,"work_id":"b3368287-c781-4908-8fc3-bdbe9cf17d0f","year":2022},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.729135Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:39a28d58d1f4b4961719533083219b690da06d0aa2e6b599e9ff91c035306219","observation_id":"b3808f1b-af17-42b9-bdfc-b39c3a2ae6e9","resolution":{"observed_at":"2026-08-15T14:39:09.840792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T14:39:08.734046Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.734046Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:4cd3d4f8282d49bcaf2ab5b24fa4fd34eeb364cc7fd7e209d0c8ae36adec5445","observation_id":"ce44ada9-19d2-4f02-8643-505729c67a4b","resolution":{"observed_at":"2026-08-15T14:39:08.734046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.821879Z","title":"VideoChat-Flash: Hierarchical compression for long-context video modeling,","venue":null,"work_id":"d6006a30-e618-42f2-8e65-b6b9a30385a7","year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.739356Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:c6a6f901942379067817c7ff88c6fcebcdbe43f28a011c8ff4dbb7c7e08179b9","observation_id":"78ebd74b-d4bd-435f-bf7f-a145dff6af3b","resolution":{"observed_at":"2026-08-15T14:39:09.825865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.807592Z","title":"BOLT: Boost large vision-language model without training for long-form video understanding","venue":null,"work_id":"ea3d16b5-8084-4c83-8a9c-893352e0c7d1","year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.750547Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:20932449999ff374625297ba1210512858f0ac56ac1de45dd140121df0ed6df3","observation_id":"a5132a82-e81d-4dba-8861-3d12af0cfa9e","resolution":{"observed_at":"2026-08-15T14:39:09.812709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.792558Z","title":"Keyframe-oriented vision token pruning: Enhancing eﬀiciency of large vision language models on long-form video pro- cessing","venue":null,"work_id":"3a635b58-beaf-48bf-bd31-46ed4c322b81","year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.754446Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:1910436dde536a4f50c9f27fe14e8b54874a5b8fe3c2762bb3208d0d6e10054f","observation_id":"93203fe6-26bd-4347-bfce-bdd996d0f35a","resolution":{"observed_at":"2026-08-15T14:39:09.797691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.777151Z","title":"QuoTA: Query-oriented token assignment via CoT query decouple for long video comprehension,","venue":null,"work_id":"59c885c4-adbd-48e5-8fc5-a246da906090","year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.758366Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:09c1001dbedcfd1e603c76165eeeb49ff1baae8bf498d1a18eebec893c88dfab","observation_id":"12be401c-c4d7-4588-bd69-867102effd16","resolution":{"observed_at":"2026-08-15T14:39:09.782019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/pg.2007.17","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.872714Z","title":"Exposure fusion","venue":null,"work_id":"ea180e04-af60-4a85-84b7-91e2c7017375","year":2007},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.767588Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:d0ddfa3c2f5871d7010da6053ba96559d5e55e3465aac07c1b6c6aa5b2e44284","observation_id":"2f53d855-b540-453b-aad5-1640138216df","resolution":{"observed_at":"2026-08-15T14:39:08.878619Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08689","last_updated":"2025-03-11T17:59:57Z","snapshot_observed_at":"2026-08-19T01:06:20.200680Z","submitted_at":"2025-03-11T17:59:57Z","title":"QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08689","snapshot_observed_at":"2026-08-15T14:39:08.762405Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.762405Z"},"links":{"cited_paper":"/paper/2503.08689","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:66a2ed31f3ac8dbed6c2e1dc97c75745ca8014bbd386b816de42deb31f5f458b","observation_id":"6cd299df-29fd-4924-8246-2bf884d2ad26","resolution":{"observed_at":"2026-08-15T14:39:08.762405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.747918Z","title":"MovieRecapsQA: A multimodal open-ended video question-answering benchmark","venue":null,"work_id":"93cc1e0c-eacf-411e-af46-7c39c5480c31","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.778334Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:80a2d4e783de9100bf6e4ce7fe775581ef5e00a09b0ae221485da8c48c34c557","observation_id":"9e51d890-69e9-485e-8a0b-904661c36be9","resolution":{"observed_at":"2026-08-15T14:39:09.751933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.761409Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":"95d7a16c-d080-458d-ba86-1a8f99d5ffd9","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.773546Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:0f40b0dbe864ee59bebff7f91af9ee112348b5e6ac0ce0b0485ba5637f073563","observation_id":"8db751ac-510a-4904-8c1f-e94bffb5ed87","resolution":{"observed_at":"2026-08-15T14:39:09.766190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-15T14:39:08.791550Z","title":"InternVL3.5: Advancing open-source multimodal models in versatility, reasoning, and eﬀiciency, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.791550Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:f56db22fcbd2d5bd0fdddae6e2f4259a881f4c67fd15ef8fd5420fa0aa341c40","observation_id":"b6d8aced-93b9-43b1-a17b-33134db38047","resolution":{"observed_at":"2026-08-15T14:39:08.791550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.734614Z","title":"Adaptive keyframe sampling for long video un- derstanding","venue":null,"work_id":"c13d605e-c7f7-4e3d-9262-f3aaeb489667","year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.782828Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:46e188cb0864d116c1748725fa0ff69082ad2ead8ef5febc83863a2d98b03a82","observation_id":"e0d74a05-62c8-4b5f-80c0-a4853cca8f5b","resolution":{"observed_at":"2026-08-15T14:39:09.738796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.787076Z","title":"URL https://arxiv.org/abs/2502.21271","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.787076Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:2897b632071c089e707a0e7dbf2d4cd4323ed3144e325e08a30f8d04eee6fb6b","observation_id":"a04f6f4e-fc86-46c7-b29b-9ce45b09b6e2","resolution":{"observed_at":"2026-08-15T14:39:08.787076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.719468Z","title":"TimeLens: Rethinking video temporal grounding with multimodal LLMs","venue":null,"work_id":"0c5b0bc3-f917-4d1c-83e4-0e91f6b15dbd","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.806292Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:5516dbd48f73ae8939fa23b4367c6247d30b46fde7540b77dac2ba76dae630e1","observation_id":"9ee14c71-720a-4f8f-bdc4-67e1c9e184ff","resolution":{"observed_at":"2026-08-15T14:39:09.724560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-15T14:39:08.796357Z","title":"LongVideoBench: A benchmark for long-context interleaved video- language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.796357Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:c8813b85c06e04c789c97b9ea69af3ba49e0d267845dd0e781d2d500205a3851","observation_id":"6b05253d-2d9d-4dcf-ace6-0d079ddfc991","resolution":{"observed_at":"2026-08-15T14:39:08.796357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-15T21:35:01.894426Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"cited_work":{"arxiv_id":"2607.23265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.23265","snapshot_observed_at":"2026-08-15T14:39:09.204933Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","venue":"cs.CV","work_id":"4fb63cb1-1101-468f-b2aa-d60029b63a49","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.801658Z"},"links":{"cited_paper":"/paper/2607.23265","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:b78b1388f7397a94a8c9248c90f9273e2f07531e02fd0cd990a067a0efa1d0f0","observation_id":"7d69fa49-2367-4afc-8969-2a60642d6871","resolution":{"observed_at":"2026-08-15T14:39:09.210487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.820556Z","title":"Deep video discovery: Agentic search with tool use for long-form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.820556Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:58c2f12cab6598219d408a555854e7d6f7f3335db18cc8e3cd79e8a395aa7d98","observation_id":"72b1b799-b471-4040-9058-8a6dde17144b","resolution":{"observed_at":"2026-08-15T14:39:08.820556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-15T14:39:08.811166Z","title":"LMMs-Eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.811166Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:3c99e6b3086bbfedeace50d199f845c56507e3d4615001bf1a6bf839cf9fe5b8","observation_id":"a32642e9-2422-489c-9344-74ce05aa9e8c","resolution":{"observed_at":"2026-08-15T14:39:08.811166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.816251Z","title":"Q-Frame: Query-aware frame selection and multi- resolution adaptation for video-llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.816251Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:b3f8f37b01aef5402b1e13aab397a72e2193bcebfca02138d690931ab62911c9","observation_id":"d01cf865-37df-4d79-b516-0c466b9fe484","resolution":{"observed_at":"2026-08-15T14:39:08.816251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.703808Z","title":"A.I.R.: Enabling adaptive, iterative, and reasoning-based frame selection for video question answering","venue":null,"work_id":"3dd574c2-d83e-4ee6-8d3e-144c73b3440d","year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.833888Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:a21aa16a67bab934fe4633ed51363fef0b7eb8c8b1075e36893d0c588213fb9a","observation_id":"d238c998-8baf-485e-8b81-b41f25a13895","resolution":{"observed_at":"2026-08-15T14:39:09.709128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17374","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:09.101652Z","title":"Shot-aware frame sampling for video understanding, 2026","venue":null,"work_id":"61907f57-9f3a-4c0f-99cd-590d7861a971","year":2026},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.825006Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:e436659ef07ae8507980c7b3b88c550ae8af20c116c5705fd4e64cfec45023e4","observation_id":"94845f54-84f0-41dd-be1d-7ff3699dc832","resolution":{"observed_at":"2026-08-15T14:39:09.110701Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-15T14:39:08.829183Z","title":"ML VU: Benchmarking multi-task long video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.829183Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:2592148557f5a8fd0278af694e578607e34e35749a5c43049f0c44d2e0399abd","observation_id":"220788f3-2194-4ba0-8810-794b0e15eafe","resolution":{"observed_at":"2026-08-15T14:39:08.829183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-15T14:39:08.744823Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.744823Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:f8d4c3e7e9bc14bfe18556290f397f5fc662d154ec94fdbc7636e3aaa9455d34","observation_id":"ff6a968b-88c5-4d75-9640-05dcc13fcd9d","resolution":{"observed_at":"2026-08-15T14:39:08.744823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:08.840327Z","title":"13 MAC-AutoML Appendix overview","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:08.840327Z"},"links":{"citing_paper":"/paper/2608.05707"},"observation_digest":"sha256:711185e70c4485e4f3cabeafe3f6347c14693b85991851c6e2a4d02f5b4c97bc","observation_id":"10affe58-b0fb-4a0d-ae6e-c6f4bddb9e3e","resolution":{"observed_at":"2026-08-15T14:39:08.840327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05707","last_updated":"2026-08-06T07:47:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T23:10:32.294151Z","submitted_at":"2026-08-06T07:47:15Z","title":"One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.05707."}