{"as_of":"2026-08-11T19:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f31c6775dd08c8e496f8c325e55c5f0937480caf3cbdf80685777fab8632f7ac","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T22:32:19.740039Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.18558/citation-record","integrity":"/paper/2603.18558/integrity","json":"/paper/2603.18558/citation-record.json","paper":"/paper/2603.18558"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:42dbf6936cd4523dbe3a00d6a50665a9493ee0e63233742d62fd562fc5b311da","observation_id":"d6738284-e9e6-4e0c-98d9-987e1d095e19","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:02e40562ad5f243fbf292442490ca7033ac05b12c0b15d4ca650736bfec4fda9","observation_id":"9958e024-debf-4b83-a338-c1f63c36abe7","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"GPT-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:c8b7defe33511f391e4c41000c98590fab54549a14ee3e824a687eb1d23aa5c9","observation_id":"4ae7a0ef-d2df-401f-a625-01de8a66f0c0","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:0982fb707d35b39a81cf059b60eea49c01c3cc80ef9568113b25d65604b5ff1f","observation_id":"a73728c2-cab4-4408-90c1-b73503e49797","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Sigmoid loss for lan- guage image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f4178aacacc7c36845f91fb3ed972f8484dbd6c5d2ad6a96e6fc6b261d507f8d","observation_id":"ec097bab-a728-45fe-9453-927093126e24","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Bolt: Boost large vision-language model without training for long-form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:d6e581e58e9aae0151fbff4dd5791b37f4fdb084e3ff387d65b8e1d32ec722e0","observation_id":"82487c28-2fca-440b-933c-74a95e60b8ea","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:afeec2ddd8cb25525ad0abbf4f9c27fbd2316bb1b181468da9be2d4a19b2a739","observation_id":"c968043f-7be3-4680-b77c-f8119f3fb747","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Mdp3: A training-free approach for list-wise frame selection in video-llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:c11479b2d239432a0b2f7db08ff5db39800735051471a8e72da222fbea29427e","observation_id":"8832c725-0f15-4777-a70a-0ff31e2dfc81","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:29a58f0d0e4a66f3f1a524c8f270601dcde979d9953d39c390d2d11ba04a3aff","observation_id":"2142abf1-54ca-4439-8c8c-bc4c2c3bab69","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:4cf7cbf4082c03a976f6ad2099c92585558b4bce1982f39209b859cc8be6ac02","observation_id":"d44b23e5-5622-4de7-a18b-873e22040413","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"LVAgent: Long video understanding by multi-round dynamical collaboration of MLLM agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:e9a4fbe3d08171b35e02fbfabe43d5a8454dbbc1ce0c1bf0cbc77793cbc6af89","observation_id":"fa88792c-7a4d-46b3-8c14-5fae0adfbd1a","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Longvideoagent: Multi-agent reasoning with long videos.arXiv preprint arXiv:2512.20618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:cf01b705645366d8699887a7d981d34888a9e670c6f63614c40c6c0f1e182fd6","observation_id":"1a805de4-dfdf-49e6-a27a-88656248cfd5","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"SeViLA: Self-chained video localization and answering via llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:056bd4329eabc58e060f06e8bd5be1f80106ccdd7c7871fdf8bce076cf37a3fd","observation_id":"2fb535fc-be98-4885-b1f6-98241c05d648","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"A.i.r.: Enabling adaptive, iterative, and reasoning-based frame selection for video question answering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f0fd419ab6cdae7b7668eb87e32eeebe841bfa52a0d11ef83d6e6078bb2641a1","observation_id":"8d591e8a-fccd-47ef-838b-c877caf6de4b","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Video-MME: The first-ever compre- hensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:fc63f86d19750ba5b9d1d4457a16de4123edbc57df5ddaaa61a9df7bc63b3956","observation_id":"9ccf10fa-0efe-452b-a796-0381f79a7deb","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"LongVideoBench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:5966f742bab15d6b4a0a7684fa1c95c7925efc599bf5192ef5934b5dcfe54af3","observation_id":"b3cee4a0-0c8d-46b1-8d66-3921a4d4b07b","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"HERBench: A benchmark for multi-evidence integration in video question answering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:9c08fb8e1262e49b668834f8c2f6ec58a46742e1c14afe89c5ac4c9bd0a24564","observation_id":"8f3aa5d2-7c05-42fd-a2c7-ae2e4072ed79","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:2a5e17d55139653b5c89aeeefd0454b9b003d42c36a879a0b363f382d56af9d3","observation_id":"750a6999-5e16-44f1-81ce-fbf84f95c254","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Flexible frame selection for efficient video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:035770e49694792e53bdeea54087fc31ca0385d997aa066e88203ef49d9051a8","observation_id":"1fcb63c7-1a55-439b-8732-800df64e37c1","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"M-LLM based video frame selection for efficient video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:a0e17338b60d23b73a5fee667d0d5a614e55e487f3f99d03161a9a2788a83e6e","observation_id":"29a2740d-4d32-437a-b3cb-e982ca1d89de","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"End- to-end videoqa with frame scoring mechanisms and adaptive sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:7f5962df13897471b88f4dbd85a8cd506ca732f6538cbe3acbc5275ee3820ead","observation_id":"f949c76f-ee69-4056-8799-6da396f15b08","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Re-thinking temporal search for long-form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f26c5ab2aea502e91a0e066f4777b413cc8314d90053094259346701db896f54","observation_id":"d6b4837a-04c2-4c22-973f-12c158a2ccaf","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"YOLO- World: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:97530adef969746618104c62a564d8349e6f3008b6b717e23f5255be3d044654","observation_id":"c4b392d7-061c-422f-952c-cd1ba676b666","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Logic-in-frames: Dynamic keyframe search via visual semantic-logical verification for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:7ffc0f867d347fdeb4e79723774f4f552b55f91c6ed4541a8aa8ebcdfd25a81b","observation_id":"97377aef-fbd8-4043-a728-e47ec53a17af","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Neus-qa: Grounding long-form video understanding in temporal logic and neuro-symbolic reasoning.arXiv preprint arXiv:2509.18041, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:920d73e1c694f5b0ea2ea393f8793148ffe159a9ac1865803f74cb83d45bef9e","observation_id":"8ec8ec76-e740-47e3-aa28-e1bfb2158534","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword- to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:2d8232385b2ac874baab1fc08d9144842a1e02f287395649c0b9e2a32422c578","observation_id":"39c31ab5-6778-49ac-9a9d-98c233cfaedf","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"VideoTree: Adaptive tree-based video representation for LLM reasoning on long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:13513bbbba88893af7ad1b447ba7327bb37bfe26b9b382e7488db19eeb2ecdb2","observation_id":"9d4120b4-b2af-43c9-a419-e20f7f227502","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Videozoomer: Reinforcement-learned temporal focusing for long video reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f8f11e63d8eeffa120ab966b58a2e4ff50e2d5c750b2715266d3459bb3f9e82d","observation_id":"cbdb37c8-e94b-4ecc-9760-a13f1f585eb2","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f5fa930c1fc70a7df6606c2dd33f8df44814e3698040e1fa518690544af3a830","observation_id":"94d446aa-3605-4c2b-94cd-b1c4a5e75e73","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:4c624338278ac336ae5d00c037605a87b59655e18fa54b679bc0d1800a24ef34","observation_id":"c1e10ab2-780e-48ce-869b-371687cdf43c","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"docTR: Document text recognition, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:1a14ea3bedbf207d934fbe029e6852ac863da18b31367073914e14c41cf1867f","observation_id":"7b44f30f-fc35-4945-8818-6d42b7970cf9","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:8af26052a3bab3d6eaa49c41947ce230b9e034269d8275b9dee99b2436a07130","observation_id":"fc03578b-c0ae-44cb-9aee-0c1352a0eef1","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:24bbc7056813c50cd654783357c1c2d34d101c44435a36ef009bb7e8b0e9648e","observation_id":"a23808f1-337e-46b7-b49b-431f687413ac","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"VideoChat-A1: Thinking with long videos by chain-of-shot reasoning.arXiv preprint arXiv:2506.06097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:19c23503112bf94eb547d5e1e7f4b6ea4ba5bd113e6375e61be18e7ae8746897","observation_id":"549a1198-f88d-47f5-b6f6-baf0c119bc92","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:d99db61418303d5930dc67353ead12dd890468b60172543eba0e3d506e303f3a","observation_id":"1a41949c-1634-4641-89f0-d4e9a82a8f00","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:6b05e1a3a7d47b2942ada49cde28c256bf52d39c42b2c6e62e818d3bc8908d8a","observation_id":"d99c68ec-9514-4525-983e-998dde4490f4","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"EasyOCR: Ready-to-use OCR with 80+ supported languages, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:5751676276f12501e26fd781094a30a0aa00f7c751e5b84ab1222d3f846fc0b1","observation_id":"3bb763ee-3ff5-4972-8ff9-7fcda555b71f","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"LLaVA-OneVision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:871fd10c3c52e7550ead9b17ad278a4ea2550be3abf69c1fb588a9bde1b7060c","observation_id":"1947a29a-bdd4-4bc0-a9d5-acd628fd37d9","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodal- ity, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:3345533e687f93ac8a2c5ce79c6a858fdcfc9ff7d8bbcf32eef8984dee8077cc","observation_id":"f0d36972-f3f5-4954-b87a-57bf0651a701","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"InternVL3.5: Advancing open-source multi- modal models in versatility, reasoning, and efficiency.arXiv preprint arXiv:2508.18265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:24e42d0768d6e3f6a1c64e12eb7b0782baaf5e37d38cdc10b392674ed28849e6","observation_id":"ed63f80e-9304-436c-81bf-8eb3892c6e6a","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"person","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:dcce5e4cc2bae3bf3c8b975173aa77315dd13db66faa351b7063d382c6ad6ae0","observation_id":"e8a163c3-2c02-47c7-aae1-136e7241d4cd","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Exit \" ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:04580ac517b9999e86d6b0580d74178e2d18de2194010cd44931259d85757029","observation_id":"ea5ee306-92ae-473d-8226-735d3ac467fb","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"person sp ea kin g","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:ec7760b328bbdf7e8432e24019e8ccc974fce0e4052aa59c890e09c36b679f84","observation_id":"1d494086-659f-4af9-a962-d9424631e46b","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Add an ASR leaf with related spoken ke yw ord s a l o n g s i d e visual leaves","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:2efdfb04944fa8ecc2538f6200eeebe32e9dcd9e72d300c524237e20554b96ed","observation_id":"d7802363-5cff-4fb9-ae35-de30c1b60986","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"do or bel l ringing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:297650015cd4a6113845e289fa4c8b8cef60e5ca045a4938622f302edad71dd6","observation_id":"54e21d6f-ac7b-41cf-998a-175e972b21a1","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Never make a tree with only one expert type .] [ ELSE : Use mu lt ipl e visual experts when po ssi bl e .] [ IF_ASR ]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:788b18fc09a65f679ce78d142b7493db7e0fb4db71ce3809d73b601fc974b8a0","observation_id":"3c799bf1-e1b7-4d68-abad-8d430ca62ab1","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"[/ IF_ASR ]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:db9d69a39b1a339b3564455b3c59ba76ddf6e6c362787b63640811978b1b0857","observation_id":"41c5d913-dee5-4753-a11c-67553c717f42","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:cfabae2df2ff09f6df07b843b87e84765e8adb71310b0c600119a6594f377543","observation_id":"65aa8b31-bb53-4af4-b63d-f8bcc1f5eacc","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:c7a106062ea97211076638a8bc0a9421bcbd869d61a99b2cc41c35a83a0b4594","observation_id":"7e02f608-dea1-4cbf-9ae9-5b57503d0957","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:d37020c8f196d4a3fa8887d767a2f93b4d7db88c3173697595fab0a76bedb149","observation_id":"8d2ff39d-a7e1-4033-8e21-c130568ed575","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:6ae6c128ad353934e55e2f007688167cfc6d538830210ef06072cb8aa2d712d7","observation_id":"31a53722-8804-4dd9-aa85-22d0ae6f6f60","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f995098671f1336966b313e51f813daf45c7391c01dcaaa1f2cc6e9ab5107489","observation_id":"0df2777b-14ab-43aa-bfba-16145fb8d74c","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"Same \" ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:ab07bda46e970c894925b7df6be0b01c82d3bb335a8c6eb1cc4f896ae653d9ac","observation_id":"5ee2a23d-d4f9-43e0-87b5-577f30c086b7","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:0036dddaf3aef9ddd04ae88c5b19b8e5542e45b904c462243b816ee9fdd07adb","observation_id":"3713b8e7-a3be-43bf-b0b1-6e35b97742ee","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:f750f3fecc0434d6c5b57efe7344c700ebe4320fc48c5aad425773a611a97388","observation_id":"745758b3-123c-4406-9028-eb863821327b","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"[ IF_ASR ]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:6d25b9b11b3d5cf2eb4d18e275765c41de14b2bd2b62d2912c3aa0468acac8a6","observation_id":"8b438ece-e30c-47d2-acc5-65551b996fc6","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:095a9670547ac84926ec326f9613fd36787f086be4ce1bbeb4370d8395b83c29","observation_id":"df87a3ae-98a2-4c0a-aebe-53e14c050d6e","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:163d271fab2e1a8e0fadec9a949c0b7d6feb1bc3692084d60d982be17e771f41","observation_id":"11798827-8f08-468e-9e10-9e2750afe87a","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"op \": \" AND","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:81760df6104489b5be6c8791b9a073a8fd0c6a9ef2b9a57b4fc4adcd6cc8df62","observation_id":"18d0e814-6060-459f-a824-7f1670ead1b1","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2603.18558."}