{"as_of":"2026-08-06T15:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69aab3627e961ca7bc815c3a48c2ce5361f8363c16167801b8702c75066a4ba5","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T17:18:41.284513Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04559/citation-record","integrity":"/paper/2607.04559/integrity","json":"/paper/2607.04559/citation-record.json","paper":"/paper/2607.04559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:60ad92ce21926fc3448f091cb5e479a16d16cb4871b58bf122b28a92b87c7490","observation_id":"a94cde0c-1014-4b24-8479-8fe317e652ad","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:dc5da0dbabebdc7b055d63945bf0c2c2b303c89662c0a236b26b974edbc90484","observation_id":"f20514a5-0d65-4f07-aa08-dbc22e8f30c6","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b5bd039462a93232ef1ad04551084348ced8bb74393e9691f58aea873e813ed5","observation_id":"bf4d22a2-49b5-4e6a-abf8-852b67d4d956","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c0064c6a865e221e1af26d2e34983e030a42d62e2dedfb52e4904187d9f6be15","observation_id":"3a9987fa-e5f8-44f6-a695-35c0c5270cb1","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b61f72978f1cceb234cfbff8396cc0295f4eef4ae24e0a9275817eb099ecf98e","observation_id":"db50fd4a-f66c-494a-a755-57835c028305","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:e4bd82ae999eec073090e0d7d84fb48f8d92a4881ca65cfdcab22c0bbc566b71","observation_id":"16f0aad7-ddfa-4df6-8b5d-95b07e8f52ce","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6ea43658eaf7402413a71ce53a9ea22a13f1face256f406128fb46bc5bc47cff","observation_id":"0b1acd7c-2ea7-435b-a153-02773d498b1f","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c9a8d2782aa52459c40f2b103d4bb625bf69f6872cd0fe946057c5cb88150ae5","observation_id":"7d86c838-4bec-4f0a-8e9a-edb1bc51c966","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:112d8cf072e85095273927d6b63dd7890a4d1bdfbb1d6e3928895a80815ae9a6","observation_id":"9ab19e13-1145-4163-9777-d26a26b425ee","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2411.18211 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:e1a960e58e19c4bdb18bebdde19d38a1d6d8b6aeb8ec4fabf222ab8c8ae6770f","observation_id":"39b9dbd0-831e-4c26-965f-dd76647f9329","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2412.05271 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:d104c2f71e03fdd3e862e4eb83bd4dcc74770955fb501fae7ddd272b88524f02","observation_id":"062c5173-ee35-4add-b33e-1747444a655e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2404.16821 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:7672424cbe0d374f775784386c02f82356da9b01d268b5a391a3af05d17b1da9","observation_id":"1c2c49be-500b-4e52-816d-4c8cd79ff1a3","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:a5ad194caf55a382482a5040f89801227967d918472eba6c63ed81768f085a6e","observation_id":"942a9851-5196-4283-8151-9c76ca296d95","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025) QSVideo 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:4ffb477d78626fad0d889cdaa0be01b7723ace96122bd129f33e24fbcdd140e0","observation_id":"3d06e090-767d-498b-b94b-9b0e7f92ac25","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:d6bd52ee9d7142dd735acda51dde6e097b455430dca1fadc3c0be86693f689d6","observation_id":"87990897-a88c-4602-818d-27625d587e08","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:f8408cdd95282f34feebbe621b10908293a8dec619af0c4db6acda078cdc2391","observation_id":"e6b31329-791c-45e5-ad04-615fc9eb84a8","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2501.01957 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:ef0e75270f1af691db87614036ff0429d310b7ebc5e735100433430ea07ec64d","observation_id":"5e2cf9a3-16e0-4c3d-9fdf-72a57be1158d","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b78a67d412696daff9bdcfd1a39db2546b99957185d0291ea6f40c6a03e50da3","observation_id":"fa8659b4-dcc5-463d-b116-94d9bf8aff0e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:ae56b04fd0c4cdc7a970c2841eda7e4bead918561270a02294bb19ec37403329","observation_id":"ff926cb9-52c2-4bef-8285-52fb155719b0","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2505.07062 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:58f8510b6c6895f8b509bfa9b45b890f9d06baf651afedb3474e75a8322c513e","observation_id":"28aa7045-76a6-416f-a35e-7b913b70c104","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c7c436245a9a8c3ede26c55cc40fad3d8cc58e9b10d5ef40ed50716a329c1d01","observation_id":"30c8c09b-af40-4384-9635-f36b410c52cf","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"International Conference on Learning Representations (ICLR)1(2), 3 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b08bd6e0c314766e31be95e37890e5bf9e0b918de69d84787c9bef06e321d9c9","observation_id":"946b4418-3689-44cf-998b-99e0beb32b19","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:024440e59104592f452661fb0879e45e0bc32efc69e96da6300a21caf759a92e","observation_id":"86db27c0-b836-446a-9b02-6b404ebf81bd","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17447","last_updated":"2025-04-24T11:19:18Z","snapshot_observed_at":"2026-07-06T21:14:10.460633Z","submitted_at":"2025-04-24T11:19:18Z","title":"FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17447","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2504.17447 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2504.17447","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:cf1918072f08019972410d06c884bbc6b302d764ae0a432ad2403fa88ff72d40","observation_id":"d598b017-5f0a-4bc8-9264-60f35e2e2fb8","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:d6997bf5843d3526c0dcd20ae4f991220437f476a377d6556ba8d5d9e6620d5a","observation_id":"a5fd5539-ae14-45bd-80b8-bc77e36359c9","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:f10eca7044d37c90139fcdf387aaa4b7d45371491565ab6a8039ad6524e8bcd5","observation_id":"52a78758-7db9-452a-b668-afd32cb26423","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c1c5477a19176095d3e746641b513692d52e6837ce532e482f16956e37040974","observation_id":"a0a8c05e-664f-4019-8a2f-d293f4ccd357","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:da8f07e90e74a1869867f671219ca12d20d047ec5dbb4e59e765fd32469990a6","observation_id":"e9960568-9afc-491c-9a36-002405db543b","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:cba3cb481eabfb78b48cc040f13fbf69bf74808fc7d0bba141d32d30a997dd15","observation_id":"f5868435-43a5-48ea-965d-dac2c21e3ed5","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2408.03326 (2024) 18 W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:d24fc7ed1d6f3c6c26005abbd2b5eb91b65a0fd13ce7c831ae17caec6ae0a715","observation_id":"c9eaf1ed-c711-4f39-a882-0aa0e1f114f4","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"Science China Information Sciences 68(10), 200102 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:ce4e22c372ed5406af3e35cb9ed956ae591721e29ce6a97474ea63326f510db3","observation_id":"5b78b7c0-d9b2-4c8e-8861-18946733e7f1","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2601.04720 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:a3f16aa0e41fd57fe174ec420d3eab606ea032d729d38239c62d98efd2a05f6d","observation_id":"49582332-f410-4e21-bd72-7323e7c035e4","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2311.17043 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:62735d05cec83f24ae2b7e839c3a9e023242f8dc4a227c1f1b061ed8dca0b0be","observation_id":"6da9c10c-6546-4c8f-b1d6-032321ab34ad","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:dc9af550fd0fc0b444f954959ff592f2da0f5334742a2d0ad38798220e1f1323","observation_id":"67da3cc9-46f9-479f-a215-8639f6fb5b0a","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2411.03628 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:4816d58c77f02114020be1ed8ffad31d088c1effebbd9e9b95e41991349237fb","observation_id":"ab925452-f670-4ef3-848f-743a13b195e2","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:4a0337087f276fb060825df72dd4c664a2232ba4684b2ecbb6c8b7ab0409f65a","observation_id":"17860253-73b0-466e-88db-d1f968a0bba1","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:a38de5b9db93f234034e9c525432e5a238cb774255f47572265bd9d963b4796d","observation_id":"8ffe7083-aaaa-4561-82ba-53e147591301","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"Annual Conference on Neural Information Processing Systems (NeurIPS)36, 34892–34916 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:49d78b221a44ab3de359f3457add3fc0b6cd7dc36182504097bbc3c03a9629ed","observation_id":"94c219b6-4689-4194-819f-0ddfeb9658d5","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c9cb4cf7b45a71fd0b9cb3c62ccf4ce5aff0d9236ce99bd26fe70f6211e184c4","observation_id":"2e3c16a4-5d8a-4840-8034-e9a8edef245e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:97d1803d48f1e3f3de40ffbd2413eac8b6a0c6617fb9682f258315085cd820c2","observation_id":"646bfed6-cceb-4cfc-aa1e-ed4625ded81b","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2412.04468 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:e63a7a91f1c78303d2bc60b8ff50c9660da503df4ab07210cb0f8889ce64238f","observation_id":"d17f9179-1967-46e3-a4f5-ef6e5753af6e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:33df482d3e6c839a26eec2720e458b1c2fcb673da2340d79668e342fd289e4c8","observation_id":"b0d1b3d6-09f5-437e-8f62-ef7a3c39b423","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Meeting of the Association for Computational Linguistics (ACL) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:040ce9e8227a341dfabd8b07782207afbd9abcae6dc9b72a599fbb2cebc9dd67","observation_id":"8ee9808e-925f-4599-b54a-620e9e9a8c1d","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"Annual Conference on Neural Information Pro- cessing Systems (NeurIPS)35, 27730–27744 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b2cca8af6836e62ce01d015ceb276dbc153a2d7e76b0c1a3c36b03ccd9be555b","observation_id":"9903d774-1fe0-4164-8720-e10af5523d1c","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Learning Representations (ICLR) (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:06a653d7c2d620fff021e5fc7dce788a3c5f19fcfd05f56e00a96fd6a30b8bf4","observation_id":"80b5ae7c-ef56-444b-9c40-6fe551d11b35","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"MapReduce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:35d76bbf7c49a92386ec2816bb8bd6b88aa0babe6611ab1c6a9940dee4c16782","observation_id":"9ac91ea0-6d23-4d1a-b7bf-0995ea63b846","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b66503ace5930765ae6a3d3deb30924144597787c9180810d8c8eb0148fe79d0","observation_id":"a2222974-ceab-4366-af11-19fda03a979e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference for High Per- formance Computing, Networking, Storage and Analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:d29b4bb00de09f313df311f8ed75e8d114707fe941aaac63b137725e4d4d1a10","observation_id":"54877c1a-9d45-4394-8896-49bb84d43308","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:8e28a5e534ac0a64bd7f03904de5fa96bd423b97cec322e448c3f4a4cf0b0b59","observation_id":"29bdfdf2-ec78-43d9-9293-784b59ef3e52","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:2c67771b6e8a82efeac2be3a9fd2d276386150b3fe27db2c6f735a9fe9c4eb14","observation_id":"db3e4bf8-5a56-4996-befb-c38f0a97cb50","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: European Conference on Computer Vision (ECCV)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:3b73f1fc9571a0d2e2195942b76457f5e9ac93421ab9540bee21543776617002","observation_id":"35d3bd1a-33d6-428b-aa7c-abb9fad098ff","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2601.03267 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:3561f25d6195432a044f17574b42f978a88fa639a764c8813b0245da31b75abd","observation_id":"38735e6d-cda2-40f3-9c52-db5ec22e4d5d","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:5fbb23cb54e8316747d767a1395bdc8a0d358e1cee53e92772928579fc654152","observation_id":"bf223fc9-aa72-4858-a01a-54a1ca4d2ae4","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:54ea952b1d0f5f75bdaf6fda7442005c1400541abe7322e17ab44820f8d59b01","observation_id":"ab10d792-3c56-4b45-8d91-a1c286c342a5","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:970fb5a4d53e6bf7b8ed3558d003e7c60ce6592cdb5d038201dc899a1ea76040","observation_id":"310c3a61-b32d-4bad-af91-f2949190f346","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6df7f3d53bb3e58c944445ea7fab937535e6358b0101af86a52b9c8eddbefc5f","observation_id":"1e7deb93-cf3f-452d-af1d-900c47f0177b","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:8b8830d6bd84d24b04f03e9d60823a87be7302af3aa17db84231038d730df336","observation_id":"99efd1d2-aa6b-4390-9e18-1af4f0e4bb6a","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2406.08035 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:90645380e3c8a4c96156748628587baf2e1ab5e276f65bb7adc933e7f8ff9f9b","observation_id":"e07fcf52-e963-4bee-82f2-76e4ee296468","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:0d865d7d8b029717d794bc0f7a4bd327e478639faf4ebd1d67d624ea55ab3326","observation_id":"45f69790-cbcc-4a6c-a872-96d3ad6d8daa","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Learning Representations (ICLR) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:f27387d58e0251533c570671230ce1294edc4b2fdf1947e52ebe35728adbafaf","observation_id":"95c0d092-6efb-41a1-9c44-6ed95e95420e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:722a0f32d2351a21eae6f350074e3037354eb238d992e63ab903fd12f318ab21","observation_id":"f727063d-56b3-48c3-83e4-fae31b2d1c13","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Process- ing Systems (NeurIPS)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:38a97925f1cdd7992c7e972f56c83239cd51e9ba8258c46ca800afb62cff7498","observation_id":"8fb933e0-21e8-45c6-948e-7b221358af61","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Confer- ence on Learning Representations (ICLR) (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:1814195348399d687db73daaeba623c1e0931d242caadbea2b0105edcb235828","observation_id":"f02e34aa-d26d-4529-94cd-540ae96edef6","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6fe37a999ca99ef8a7996ec0c96c3f782e38e803494e3f1cb464da888ddb9d3f","observation_id":"7359ad4b-393b-47c6-aaa4-930e7911c443","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:e941de53da5b27728f3ae6f6c3eabb115b302291cf2a1f82e8a6edf03f99462e","observation_id":"be3900d4-bdc5-43fb-8eb2-8df26a2dc79e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: An- nual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:cb513bd3ae3c9040e2a2303ff201bd498a924d147f817d34f6f9d5166c2ef9df","observation_id":"6e757211-45d0-4075-b0f1-60c717d66168","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:9a33d0e9baa3d02f14f01e6abe6df8eb3a4f5c5a26e310d9efe0c2bbc10c86a9","observation_id":"20c6610c-adb8-4266-ada8-b40eda1036d6","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Learning Representations (ICLR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:c3cbb8d1d44de1ef58d36d2d66133a60db7dd4c4e0bc983e262c4886727d6ae7","observation_id":"ed8c045c-e3e3-4eae-ae3c-75910d5955cf","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:5db961bcb8bd3183350493efdb14a8781f6fb606e4d0529e5501a0b4938a159a","observation_id":"390d6bb9-f808-44da-88fe-1e8495522c20","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2408.01800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:967ab159c60cf0f27c296e9507484d39c23f0ed5420a5ebd70c75393185b1e28","observation_id":"77131dfb-d9fe-4298-836d-1c1733fe09d0","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6d61c5a117620fea34e634666bd97fe4a15a2ef0452940b1da4729d68758afdf","observation_id":"51792fca-7ee7-45d9-9aa2-fc4b16ed340c","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6112b7bf46690aeec04cdc3f86a6d143b3e71a6663275447ada489f0327f6e59","observation_id":"56bfff2d-254f-4941-85b4-96a8db7248e3","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"Annual Conference on Neural Information Processing Systems (NeurIPS) pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:89b895fb8050535f873e7461b766feb939c5b95c6f309095586352eedd45d6c1","observation_id":"e2e31995-a467-4864-8ecd-3b90f1438265","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:39fb1017eec16111a1e7f7529247f76ea467bb3f6ad8056d3109872a10fd551c","observation_id":"5cea78ba-4a3e-4874-b41a-f23d7d34a9ec","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2306.02858 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b89f666e3f1f31dcf59b11fed1252f386fc1647d50c743480a45d39238df3643","observation_id":"83e04f1e-a8f3-40e5-8d3c-89cfd6ebca6d","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Computer Vision (ICCV) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:08d89813aa2eae8d0f960d179046549568b7daf379e68bcf89727b111e159b77","observation_id":"764f6544-5dfa-4649-9ca3-3b929976729a","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: International Conference on Learning Representations (ICLR) (2026) QSVideo 21","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:e40bd5ea6ead7584f5fa476ce8d2566abe47ed07c48f9a3cce960ecfd6e763a2","observation_id":"46a3ccb3-2304-42b2-98a0-8c2bbaa6fe3e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:755093e8cde5b4a61aa0a4ea285669fba69467819a8790a2cfd3aecf306e22e6","observation_id":"2c76ae59-88f6-4bed-b93a-e403373929d3","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:7f0beb769b9e21ef8e96f8b36ccf54ad9e608aa135397537e27a37ddfcd4a05b","observation_id":"7dcf0482-b42c-40df-9604-aa1f6cf9cac5","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:9ad069023c59093633d884cad6b2e792a1a87a1fd5df165d6ba9b257018d48dc","observation_id":"91e93aec-3d5d-474e-a960-0ecd7b3de1b3","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:9f91223a6f48dc22a948d04c3a83d942fb6b7eda6f9d44698f490c6840f67fd5","observation_id":"ec3e297b-7053-4bae-86b7-292c1c1d1918","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:61d7e372bfc8632094007c0e0cb6a8714e2f2832d251db27305dab4961e151ca","observation_id":"eaebf377-2583-4ba4-ad7a-23f5d035970e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In: Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:aca8ac1cb6234246ab849a5a6ee1e2740063136861a3ff22b95a17a693957fd9","observation_id":"3a8209d7-c798-46fd-96df-fadc90923cfe","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-02T22:12:20.187464Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2310.01852 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:9448f98c5ad34f36a2dba2ab5d5a123cfcf29db80234dafdb02cdd6ddef52634","observation_id":"9a9d012c-7bc4-44eb-b3d2-7cd824bfbeed","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2304.10592 (2023) 22 W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:6b281398d13026ea8bc63709dfc3278fa8eb9aa51dcfbd8503098cac63859c89","observation_id":"870784c3-26f0-4f15-8727-53d02765bca0","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"In our paper, semantic ranker is a lightweight VLM (4B) fine-tuned on our fine-grained annotated datasetVideo-Ranker-35K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:47c863cf8dee6c1a9ab334d09dfbb3ce2a96fc852d88470b63ea8ab388cbcfa3","observation_id":"a323c20b-cd0b-46b7-acd7-63c1b3520cb9","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:a6fb148fd8568a8ee714ba4d6689069583e6cc74dafe77e291647969c2a2c891","observation_id":"3151b7d1-d787-40e9-b9a8-7c0282f067ab","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:075e98f81db02cc615a8224b4bf50201e8f13d198d39b6cf504fe4b94c807aba","observation_id":"73b2ce26-97de-4f3b-b1d9-9f002ee41bdb","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":null,"venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:8f110a35b007a20d176fce332c517c07bde9ae901bef42d3504033f90983329f","observation_id":"9a3580ed-faf8-41d4-ac09-085f13cf69b5","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-11T17:18:40.714265Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2607.04559."}