{"as_of":"2026-08-08T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c03fa1269dcdadf4550ca841737eeb5061e7de61dcf2e2ccad8e378f2587285","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:37:33.282545Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28463/citation-record","integrity":"/paper/2607.28463/integrity","json":"/paper/2607.28463/citation-record.json","paper":"/paper/2607.28463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.893226Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.893226Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:bf5a50d1fa5b327a207027af0e4f9a8c52c93b5c0b9fa1ed7a09d4cc85b71613","observation_id":"b85b768a-13b4-4b7f-93f5-64695f20e3f9","resolution":{"observed_at":"2026-07-31T06:37:32.893226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.898930Z","title":"LLaV A-video: Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.898930Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:561e9438bacd13fe65f8fe747e5bdf99f5bb8fcf771f66238f3ed8c1a347b554","observation_id":"cb94bac5-d01f-4503-a2fe-744d3185aec7","resolution":{"observed_at":"2026-07-31T06:37:32.898930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.903658Z","title":"LLaV A-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.903658Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:845396c6e42c0384323dd9d617f042de468c8200b6e120aa00d513e84b26d9a3","observation_id":"ea62da92-f269-41ad-bcee-8fc920916d88","resolution":{"observed_at":"2026-07-31T06:37:32.903658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T06:37:32.908495Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.908495Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:acc0bc33ae152906ea69e061a32526235ef40165a04e819f0254d8319c6a12ff","observation_id":"02c38278-5b66-4c27-a4c0-7dfe9ba73f39","resolution":{"observed_at":"2026-07-31T06:37:32.908495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-31T06:37:32.913618Z","title":"Video- LLaV A: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.913618Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:605e8bec60531fd87475d8a3c2ed6c5f5049345fddd66e9822f603bdb54e3259","observation_id":"0dea72b5-709d-439d-9d01-f6f95e915957","resolution":{"observed_at":"2026-07-31T06:37:32.913618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.918662Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.918662Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:29257b94fe3b3a7743c4643123ba55d3937de545535fe39d0590344881864bcb","observation_id":"f1157303-bd66-4240-ab16-66892b8deb5f","resolution":{"observed_at":"2026-07-31T06:37:32.918662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.923742Z","title":"LongVideoBench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.923742Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:3348e1a2dbae4978d3cad6d54f8c680e9ca7d7800be9f5a6b4927b20679625cd","observation_id":"d9009200-6f30-4bb9-82d8-340c60ad6ba6","resolution":{"observed_at":"2026-07-31T06:37:32.923742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.928010Z","title":"MLVU: Benchmarking multi-task long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.928010Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:2ab8693c003fa552387678f492365c2066af95befadba6d56484f03f7fc11a0b","observation_id":"021b3815-4d18-4ce1-8094-b13d61d8070c","resolution":{"observed_at":"2026-07-31T06:37:32.928010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.932092Z","title":"SlowFast-LLaV A-1.5: A family of token- efficient video large language models for long-form video understand- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.932092Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:1bf90bdaa17080d022de816e7ff5d3eacf9edd60634bd4d9931118afc41d0255","observation_id":"b46c9606-395b-442f-8570-7fd1f68bc4fa","resolution":{"observed_at":"2026-07-31T06:37:32.932092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.936329Z","title":"Long context transfer from language to vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.936329Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:76f7a20f3577196e25549ad27d6a1afd1feba934bcc85680e58ad79ac6d10dae","observation_id":"5e7a7f3a-19a0-40c9-9c1a-774f61299f3d","resolution":{"observed_at":"2026-07-31T06:37:32.936329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.940600Z","title":"Adaptive keyframe sampling for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.940600Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:cebde48353ca81b4ddea3515cbf89a76ccab5b629f107d739ccbf0b1075793ba","observation_id":"3d1ad064-51f3-4478-97e7-c2463ed108ca","resolution":{"observed_at":"2026-07-31T06:37:32.940600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.945112Z","title":"Q-Frame: Query-aware frame selection and multi-resolution adaptation for video-LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.945112Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:fa5df47247724e2f60030a88df2b3d54dd2a5a4d01f72d8976e71dcedeb137c0","observation_id":"0060e0c6-ac84-43e5-afbf-a2f61b50c93e","resolution":{"observed_at":"2026-07-31T06:37:32.945112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.950792Z","title":"BOLT: Boost large vision- language model without training for long-form video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.950792Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:3ccfa571c41b29436d447dd7127313763b1badc274e0bf4fa541270e4960a44e","observation_id":"53d1db39-be30-4927-a2ba-103836f8a624","resolution":{"observed_at":"2026-07-31T06:37:32.950792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.955257Z","title":"MDP3: A training-free approach for list- wise frame selection in video-LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.955257Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:1f346b16949ff9950b91cd4a1fa39c0086b14dc0c4f2783fc9985bcf83040a1e","observation_id":"ec4378cd-1ac9-40e2-a7a0-18679656ba4e","resolution":{"observed_at":"2026-07-31T06:37:32.955257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-07-31T06:37:32.960181Z","title":"KeyVideoLLM: Towards large-scale video keyframe selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.960181Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:8950688249e4b832b829e040a1244d50ca870d4338c5f7168b6fa1caecb1e7d1","observation_id":"e8524394-313c-4732-8c3b-06a91ccf5ab6","resolution":{"observed_at":"2026-07-31T06:37:32.960181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.965907Z","title":"MaxInfo: A training-free key-frame selection method using maximum volume for enhanced video understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.965907Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:aae8e720a733e7bb4810986465eb11f2b846b5ceed1dc71b6178f769fc2dbeda","observation_id":"4d408267-d69b-4a37-8902-1a9e53a87c11","resolution":{"observed_at":"2026-07-31T06:37:32.965907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.970300Z","title":"AdaRD-Key: Adaptive relevance- diversity keyframe sampling for long-form video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.970300Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:5d91a734c9a1a189636b84de282e5429909a9c3ae636d5fc30dccf17f3dc861b","observation_id":"6659840f-9c13-4b3c-9844-5e3dee41d8f0","resolution":{"observed_at":"2026-07-31T06:37:32.970300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-07-31T06:37:32.975156Z","title":"InternVideo2.5: Empowering video MLLMs with long and rich context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.975156Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:8b9f18b5ff9e812b7c67ad08bc4649471b058ac08e3425942d45b79938ca6fc1","observation_id":"32732981-9dac-4e5e-b682-39fa7b19ab3a","resolution":{"observed_at":"2026-07-31T06:37:32.975156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-31T06:37:32.980214Z","title":"VideoLLaMA 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.980214Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:f066ee63c6f793e6ac5597167750730d4fb4bd3c043c8ca8ac6afb3c1350d61e","observation_id":"cf471211-9d4a-4e9a-a4c2-231a20393fde","resolution":{"observed_at":"2026-07-31T06:37:32.980214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.985690Z","title":"LongVU: Spatiotemporal adaptive compression for long video-language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.985690Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:04fe88e39d4f174dfaafe268e1001dc6c00ac4c1327cce0bb284f3671bd2231f","observation_id":"a1204b20-c776-4798-8fe7-6f10d97f197f","resolution":{"observed_at":"2026-07-31T06:37:32.985690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.990356Z","title":"Flexible frame selection for efficient video reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.990356Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:21836ca9ac0a3d61d0a18f8ceaed444cbf9a1af67c98b67a393ab705537e8b09","observation_id":"d8088731-e9df-4580-9e07-dab1a9233c9f","resolution":{"observed_at":"2026-07-31T06:37:32.990356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:32.995703Z","title":"Frame-V oyager: Learning to query frames for video large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:32.995703Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:8e45b21d1c9ed7dbbcb60a87c2e38f76acbca5bff74dc16cb307f36b0f7b41c0","observation_id":"02b70ab4-dcb9-4bc8-99f1-2cc42e68a8b3","resolution":{"observed_at":"2026-07-31T06:37:32.995703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.000151Z","title":"M-LLM based video frame selection for efficient video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.000151Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:c03c4b6103833cf21d8909961877b3dfa066da07e159983773cc6cffcbe78905","observation_id":"f811a44b-73e0-42e6-b383-f8d559a35a9e","resolution":{"observed_at":"2026-07-31T06:37:33.000151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.014743Z","title":"Self-chained image-language model for video localization and question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.014743Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:be2fc5c5b0a8433bc5de86654879fe84823bf2078dee08a5b1914acf698c77b1","observation_id":"640fca01-8386-449c-9aed-13b844b1a0ee","resolution":{"observed_at":"2026-07-31T06:37:33.014743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.019695Z","title":"Generative frame sampler for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.019695Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:843c810a40e746a12179ed280000c47d99962a607699168047cc7e0543002d00","observation_id":"4f0856bc-5b41-4f4a-bf23-0f2a705c0209","resolution":{"observed_at":"2026-07-31T06:37:33.019695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.024596Z","title":"K-frames: Scene-driven any- k keyframe selection for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.024596Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:390588dc5d44ba59faeeb7111ea47ee82eeee763d6a202fa296f5e49f19a3427","observation_id":"f78136fb-ea79-4290-acee-5f1f6fefb0fe","resolution":{"observed_at":"2026-07-31T06:37:33.024596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.029368Z","title":"Event-anchored frame selection for effective long-video understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.029368Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:df19d2e047e9fad03465d081e29c4cd0ede501302b4920f5ac763e2c4d763065","observation_id":"a45a8612-d07a-4653-8684-a7c7a3ea477f","resolution":{"observed_at":"2026-07-31T06:37:33.029368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.034100Z","title":"Wavelet-based frame selection by detecting semantic boundary for long video understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.034100Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:85ae730ab7d49f34b08c91198d997b2228cf9b8ef48d43fe1e39fc826b0b702c","observation_id":"bb5544f8-12ce-43b3-ac89-201b1cfa80a2","resolution":{"observed_at":"2026-07-31T06:37:33.034100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.038674Z","title":"The use of MMR, diversity-based rerank- ing for reordering documents and producing summaries,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.038674Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:4adef32dac15469d004bdcf5b65543a4df8b491b66253dc9a6c5b4403b67e5f3","observation_id":"22fbb8da-d30c-463f-b493-f56d00a0e88d","resolution":{"observed_at":"2026-07-31T06:37:33.038674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.043237Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.043237Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:5795c387e93beb6bd5ab37ba8245ab1474ffa208cf85cc10a103f0fdb06f7741","observation_id":"352f5502-243d-4268-9229-1230e2ffa605","resolution":{"observed_at":"2026-07-31T06:37:33.043237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.055972Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.055972Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:322cf5c3e83c0522368d9f3a354822f8f12cb6da33237c03397d09d61d64dfa0","observation_id":"42ce74f0-32f4-48b5-ad90-54912741af47","resolution":{"observed_at":"2026-07-31T06:37:33.055972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.104742Z","title":"Determinantal point processes for machine learning,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.104742Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:9591a9b49863b968a165383eefbca52a5886d45a6691e6d2dc130257c67121d7","observation_id":"f27c1b9a-4834-48b7-8b62-00864158f02e","resolution":{"observed_at":"2026-07-31T06:37:33.104742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.144753Z","title":"k-DPPs: Fixed-size determinantal point processes,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.144753Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:d9489afaf5114de92ff08321ffe60d83a60495529d605cbcffd69f51d2d544e7","observation_id":"7d92d894-6d94-46ab-9a1e-9e57c1fdec77","resolution":{"observed_at":"2026-07-31T06:37:33.144753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.184753Z","title":"Fast greedy MAP inference for determinantal point process to improve recommendation diversity,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.184753Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:326241a839e43febe240e765b4fe6e26f340ba526c8870dd57dc709753c59725","observation_id":"454b277f-3406-4a69-b501-b4562d78f71e","resolution":{"observed_at":"2026-07-31T06:37:33.184753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.193017Z","title":"LMMs-Eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.193017Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:20295d85e9ea8386445d01d81c144d51a2ecba469864726926076da315336b97","observation_id":"2a6d5c48-3ed5-460e-ab82-d798e829484d","resolution":{"observed_at":"2026-07-31T06:37:33.193017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T06:37:33.197321Z","title":"Qwen3-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.197321Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:df0207cd1a914ca8878ec353be1b407f7cf51c99b839a08783043ad3b21792f9","observation_id":"eba41349-aa3c-40b3-97e3-4978d4db6642","resolution":{"observed_at":"2026-07-31T06:37:33.197321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-31T06:37:33.204746Z","title":"InternVL3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.204746Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:e2ffe3c5a3bdee85712997b8ca0e5f88711fdea24764325419b94a221f605fd8","observation_id":"561d2acc-260f-4c6c-955c-ba1818d5b686","resolution":{"observed_at":"2026-07-31T06:37:33.204746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.244756Z","title":"LongVILA: Scaling long-context visual language models for long videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.244756Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:1e26a01a01e198a269601d0735a2c6855bf4b54909f63ba5daaa0fbbaefbb958","observation_id":"56ed70c2-851b-46dd-9b5a-cd8e2a53dc17","resolution":{"observed_at":"2026-07-31T06:37:33.244756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.268082Z","title":"Video-XL: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.268082Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:f013c9af6ae63a7473bf3d5c79c0d32181779169356c2e1cc2705204d3ee35d4","observation_id":"b1c71d7b-bc7c-46dc-bb34-a7b0fe49d5a9","resolution":{"observed_at":"2026-07-31T06:37:33.268082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.272895Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.272895Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:379e8d4e1bc2ffed09f2f8178d75ae761119d85c00b831e0f1b70d2338ed5b65","observation_id":"bdedef4e-de7a-4baf-8e13-0724e96f652b","resolution":{"observed_at":"2026-07-31T06:37:33.272895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.277099Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.277099Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:81fd9e239ec2af5d87e2ae0c2be18fcf784520022470fba0adb79b435f08bd9c","observation_id":"d5fcc2c9-5ecb-4808-b93f-f6c5de58c6b8","resolution":{"observed_at":"2026-07-31T06:37:33.277099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T06:37:33.282545Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T06:37:33.282545Z"},"links":{"citing_paper":"/paper/2607.28463"},"observation_digest":"sha256:e730ee82e89c3901c0edf016770a0600829be560224b7fc9a9cc25177f2cad82","observation_id":"aec06c51-aa56-44c5-803d-55c037d2c96f","resolution":{"observed_at":"2026-07-31T06:37:33.282545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28463","last_updated":"2026-07-30T16:23:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T10:12:19.900175Z","submitted_at":"2026-07-30T16:23:10Z","title":"VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2607.28463."}