{"as_of":"2026-08-08T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac427dbb2f58f73fd922bc94b409bab8dc9ed6c69a4be8d7aef083ebb484e939","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.158387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.311466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T15:20:59.359347Z","title":"Frame-voyager: Learning to query frames for video large language models.arXiv preprint arXiv:2410.03226, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.359347Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:6104e98d7fd8d502c44c74eaef5de7e5836eb550efc94b2442e14e4b489ca67f","observation_id":"7a6ad6ee-18f4-468e-92b1-152590b8d05f","resolution":{"observed_at":"2026-08-07T15:20:59.359347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-06T23:49:48.564539Z","title":"arXiv preprint arXiv:2410.03226 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16112","last_updated":"2026-07-11T03:45:43Z","snapshot_observed_at":"2026-08-08T00:43:05.134755Z","submitted_at":"2025-06-19T08:02:53Z","title":"AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:48.564539Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2506.16112"},"observation_digest":"sha256:8f44bf42af97bdd1c53eab2e3450da2ccf3455d68b72f7ef6fd42cdc5bd3e025","observation_id":"9e52b349-53d8-4935-9c12-82ce955bb5a3","resolution":{"observed_at":"2026-08-06T23:49:48.564539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.05546","last_updated":"2026-04-14T01:04:46Z","snapshot_observed_at":"2026-08-05T11:51:07.603519Z","submitted_at":"2026-04-07T07:44:11Z","title":"Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:54:04.104227Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.05546"},"observation_digest":"sha256:b036c8085ded507f2c4266ffa017ea3e1b13f3f970027af368f3ba593182707c","observation_id":"9d9bea43-a372-45d6-b384-315d1127dfa2","resolution":{"observed_at":"2026-05-10T23:45:50.900812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-02T06:02:58.067734Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:ca0ab852b10af1793d5d426589f5f540567283a57c78f9a3c18871e055f3eb34","observation_id":"06bb0f4f-f16a-48d2-9ff6-5bc1390fabbc","resolution":{"observed_at":"2026-05-10T06:56:47.793873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.17422","last_updated":"2026-04-19T13:04:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-19T13:04:18Z","title":"Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T06:05:42.693414Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.17422"},"observation_digest":"sha256:a8db20f88fb093f12ad96c2867971843c1d9256b27454374308055f0f10c1447","observation_id":"4aa6b946-fcc9-4bb5-b2c2-e00affac752a","resolution":{"observed_at":"2026-05-10T06:06:18.453570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:28ac203ad6ac8227971fe134397589cf588913de4b0f52795f82927febe8d03a","observation_id":"43a3f401-4615-432e-9084-fb3c277ef531","resolution":{"observed_at":"2026-05-11T15:21:09.372447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-05T23:10:41.225358Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:06:09.753634Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:3e669164b92eeb159b997ea79259e49bc17398916e6ff5256827db24d28aa990","observation_id":"3f272805-1538-4152-a8ea-e4246272ed3a","resolution":{"observed_at":"2026-05-12T03:06:18.732601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-05T23:10:41.225358Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:19.742035Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:0c1243266e614c27e87d8bc5b3dd0319dabf4c7ab0ea20407e660e5da35f7927","observation_id":"a0b484d7-b770-47d4-b6b8-6108417516d6","resolution":{"observed_at":"2026-07-01T13:45:46.067925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-03T00:18:47.184473Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-05T23:10:41.225358Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:18:47.184473Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:accdf451c7ae415060b40063717e979ad8eb298958ea32aebc2f0a4723e8cddb","observation_id":"259f1a6a-af71-450b-ae9d-8f161d098566","resolution":{"observed_at":"2026-08-03T00:18:47.184473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09874","last_updated":"2026-05-11T01:59:59Z","snapshot_observed_at":"2026-07-30T14:13:44.494421Z","submitted_at":"2026-05-11T01:59:59Z","title":"EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T04:37:46.090777Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09874"},"observation_digest":"sha256:893d9674157f4822dd9f38d18838f32c5bd1c00a97e331a0e7d0839f4ee78a3e","observation_id":"6164b0f7-2f0c-485d-b498-4bde4d7aac52","resolution":{"observed_at":"2026-05-12T06:06:24.666927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.10762","last_updated":"2026-05-11T15:57:46Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T15:57:46Z","title":"GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:31.117768Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.10762"},"observation_digest":"sha256:523c1e68654a664553c5822a70878cf062fe824a7bfb81078cf5396bb9715c2c","observation_id":"3bee2c53-0ed7-4dba-887f-b6d0f707c14d","resolution":{"observed_at":"2026-05-12T06:56:31.888199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:f4d733cd973723b682f8425dc47634672518bf315eb6a7dd542d6bab0020c595","observation_id":"5c6ae177-15a2-4474-b644-ec505447ea3f","resolution":{"observed_at":"2026-05-22T05:56:07.987176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:96087ea4ec0e2dd7054f9c9e132484e42310e0c1b5aeb429f0e28c1dda4ec65d","observation_id":"32192981-6306-4a94-8f07-ba3494ad48c6","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:7d2d3ee4709fa1511963116ab3b44066d986c56638fc00dfe54068a7a865b3dc","observation_id":"7c5854a6-82cb-4e11-a9c3-16149366b5b3","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:8b693e25ca659383d87a06c158eafb87784cd5c9c17064007d132d5dc9b073b0","observation_id":"63b209a2-1207-4cd3-8edd-d2c2329d48ee","resolution":{"observed_at":"2026-07-01T19:16:01.323446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2607.01737","last_updated":"2026-07-02T05:46:42Z","snapshot_observed_at":"2026-08-06T03:19:52.093893Z","submitted_at":"2026-07-02T05:46:42Z","title":"ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-03T16:45:20.139230Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.01737"},"observation_digest":"sha256:6edabe0404dd9d5b41693ef69e8e497d8d562d7544b5c6797aeea50cf484223f","observation_id":"c65816b4-fe99-4de6-9260-bc06b7cd04ec","resolution":{"observed_at":"2026-07-03T16:48:39.312873Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T22:38:43.297703Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.297703Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:3f5d56fead98257b8d81ff9b29598dcef8eb10509cd6058a0bebffd03c966292","observation_id":"732a5076-6ed2-4016-b11f-da781c3c7154","resolution":{"observed_at":"2026-08-01T22:38:43.297703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T18:11:03.661242Z","title":"Frame-voyager: Learning to query frames for video large language models.arXiv preprint arXiv:2410.03226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17386","last_updated":"2026-07-19T19:07:19Z","snapshot_observed_at":"2026-08-08T01:59:24.054775Z","submitted_at":"2026-07-19T19:07:19Z","title":"SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T18:11:03.661242Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.17386"},"observation_digest":"sha256:fa6280c1fd7e3db4472ff2a47de1faab985203464162aafa789c3bb9a149aaf0","observation_id":"4a2ee8db-e65b-4904-8f56-7f723e0d407d","resolution":{"observed_at":"2026-08-01T18:11:03.661242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-02T09:17:00.686105Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-07T06:42:16.178257Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.686105Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:5307c09df310d7f14ebd1b98aab10cf0491b980754ad3f7fc0056b1b74737643","observation_id":"4d60bb00-203a-46b2-aa67-6539123e0776","resolution":{"observed_at":"2026-08-02T09:17:00.686105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T02:59:25.283484Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-05T23:11:09.274885Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:59:25.283484Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:05a589cbabc7375570d2ba591644c8980ee1790f867a7372ebb888417dcfe51c","observation_id":"6a6c0170-65b3-4825-8aa3-1f58c845d0a6","resolution":{"observed_at":"2026-08-01T02:59:25.283484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-03T01:46:08.921261Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-05T23:11:09.274885Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T01:46:08.921261Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:2a8126b4c8a0b0c92c48dc343f66ed16f61fc37e0e207aa8774fe7ee3494ac5f","observation_id":"7f1b878f-50f5-4223-a2f1-686a3e954218","resolution":{"observed_at":"2026-08-03T01:46:08.921261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T23:42:35.158387Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T18:16:02.885245Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.158387Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:97ff2fc3ac61a2698e844f019a96a302bba481c6e935b45093087b91f2977480","observation_id":"949b5c8a-2cf7-4ce3-a17a-63fc99fbed09","resolution":{"observed_at":"2026-08-07T23:42:35.158387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.03226/citation-record","integrity":"/paper/2410.03226/integrity","json":"/paper/2410.03226/citation-record.json","paper":"/paper/2410.03226"},"outbound":[],"paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2410.03226."}