{"as_of":"2026-08-09T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13c89166e60abf91115b3cb213b98385c9621fee2f138de89760938db5f7b419","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:58:12.511658Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05592/citation-record","integrity":"/paper/2608.05592/integrity","json":"/paper/2608.05592/citation-record.json","paper":"/paper/2608.05592"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-08T05:58:12.472240Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.472240Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:2430ca82a97db7659bda0c271e4e0c4135437818c81a98f5bc3a9d6cf760a3c4","observation_id":"6def475b-324d-4410-88f9-f47b87a9bc99","resolution":{"observed_at":"2026-08-08T05:58:12.472240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T05:58:12.482845Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.482845Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:bc596300334cb2f8684ab9e7e09f858d06c886caa7c5447be4be628b136c9ff5","observation_id":"ecaf5288-9df8-4e82-a509-3ba87408f1fc","resolution":{"observed_at":"2026-08-08T05:58:12.482845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T05:58:12.489448Z","title":"Llava-onevision: Easy visual task transfer.arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.489448Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:32ae879b933ff61f401d16d0cd5540421fe2c2ec9d16906d2ff657fb35ccc8eb","observation_id":"62a6bca5-905c-4c51-a7e7-0ad0095cd7bc","resolution":{"observed_at":"2026-08-08T05:58:12.489448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:58:12.492986Z","title":"Commonsense video question answering through video-grounded entailment tree reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.492986Z"},"links":{"citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:3b0353e683fabd59497f04c7b9a82adf143f6cc4c25236bac1f3d6e24e40088a","observation_id":"0c75d6b4-4d1b-4ecc-80f8-c31288db3ffa","resolution":{"observed_at":"2026-08-08T05:58:12.492986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20478","last_updated":"2026-05-29T09:48:44Z","snapshot_observed_at":"2026-08-05T15:10:01.360889Z","submitted_at":"2025-08-28T06:55:08Z","title":"Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20478","snapshot_observed_at":"2026-08-08T05:58:12.496025Z","title":"Video-mtr: Reinforced multi-turn reasoning for long video understanding.arXiv:2508.20478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.496025Z"},"links":{"cited_paper":"/paper/2508.20478","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:88217f93281a84188eff83d54b248da158b58951bce940def600a2b2ab013528","observation_id":"2963d8cb-b5c7-4071-a8bd-c57a84f4359e","resolution":{"observed_at":"2026-08-08T05:58:12.496025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T05:58:12.499254Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.499254Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:386a15f0632561a6cf820e32758685988050d87e562fef49682115cfb8d71cff","observation_id":"ee3767d9-c33d-43d2-bb66-3cda6ad7a77e","resolution":{"observed_at":"2026-08-08T05:58:12.499254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-08T05:58:12.502565Z","title":"mplug-owl: Modularization empowers large language models with multimodality.arXiv:2304.14178,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.502565Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:f7d119afcf9023bf65ac3fa076763171f319f6386bbf14e4eb32ce5fde3c71c8","observation_id":"f23307aa-93c6-45e4-91f0-af19404e5a18","resolution":{"observed_at":"2026-08-08T05:58:12.502565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-09T07:51:37.523530Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-08T05:58:12.505711Z","title":"Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning.arXiv:2508.04416, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.505711Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:5ef42a03c0f8d571a2cffa3aa7a7f8cba141f6b7f6f43ba7bae02d3ae349f252","observation_id":"22419d38-e134-4199-bea9-b3855609dab1","resolution":{"observed_at":"2026-08-08T05:58:12.505711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:58:12.508728Z","title":"Videolucy: Deep memory backtracking for long video understanding.arXiv:2510.12422,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.508728Z"},"links":{"citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:c08e3aa81da210c9ee8c63ebfc7e56b1614c5284067451957ee8008f8ef73202","observation_id":"53c686ca-3b8d-43fd-be20-a2701b80165b","resolution":{"observed_at":"2026-08-08T05:58:12.508728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:58:12.968649Z","title":"14 C.2 Ablation on the Global Representation Depth","venue":null,"work_id":"077106cc-4fa2-47af-9dde-0b3d050b76bb","year":2025},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.511658Z"},"links":{"citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:2339227eb8dd04e9a8a52ece4573c840eab38b9ee1b4872d3f39c343d7a03573","observation_id":"dbf2bbd4-9c1f-40b3-8550-3b437f0bf446","resolution":{"observed_at":"2026-08-08T05:58:12.973330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-09T02:09:40.214145Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-08-08T05:58:12.475954Z","title":"Temporal chain of thought: Long-video understanding by thinking in frames.arXiv:2507.02001,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.475954Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:d4139e49419d9eb1e1d3fb8d8465738c75c8af5126bf9ffbd2506bb2445683e2","observation_id":"b0d01f99-df2b-4f19-80e9-377357e4ccb3","resolution":{"observed_at":"2026-08-08T05:58:12.475954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T05:58:12.486291Z","title":"Gpt-4o system card.arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.486291Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:c718b8193b50b7dff0ec0116b1bc05ba0f9a7c7029b5c4885af01eb86bfce8bf","observation_id":"fffa4d07-097b-4e3e-aa76-2dfb45a3bd33","resolution":{"observed_at":"2026-08-08T05:58:12.486291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-09T11:58:18.895378Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-08T05:58:12.479352Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens.arXiv:2404.03413, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T05:58:12.479352Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2608.05592"},"observation_digest":"sha256:4a7112140f87c032b73d18fb1b6714e35b03488e0f63f578163cdf11a0c31042","observation_id":"884443e7-ef25-4171-a095-1834aa17c2ea","resolution":{"observed_at":"2026-08-08T05:58:12.479352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05592","last_updated":"2026-08-06T04:27:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:10:28.335670Z","submitted_at":"2026-08-06T04:27:59Z","title":"Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2608.05592."}