{"as_of":"2026-08-15T21:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6bb43bc7ee63de259ccd53dc06ddd9a210b6d0120d03389d2427b9bac31766e","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:22:50.302973Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16107/citation-record","integrity":"/paper/2607.16107/integrity","json":"/paper/2607.16107/citation-record.json","paper":"/paper/2607.16107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.437297Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.437297Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:43db3b3febfc3c27fa45d065d14be8e9fd542eb0943bb04434131890f8927f71","observation_id":"14fb054c-6582-4ac5-b322-e69b0d8aa1f0","resolution":{"observed_at":"2026-08-01T21:22:40.437297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.537286Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.537286Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:116f6d6cf8ac0dc57e9941af624bdf4270f55327d3afe534075a36a2fc2c6885","observation_id":"1f2d56e0-1e4e-4816-a437-e5f4d5a5421b","resolution":{"observed_at":"2026-08-01T21:22:40.537286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:40.614003Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.614003Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ae87c5d28ab40497f0350ebeb7040de135e1d2fffb911d934eb237a9ef71388a","observation_id":"212efb0f-8fe4-419e-b877-dfe28fa0303f","resolution":{"observed_at":"2026-08-01T21:22:40.614003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12109","last_updated":"2024-10-15T23:16:28Z","snapshot_observed_at":"2026-08-12T22:22:18.834008Z","submitted_at":"2024-10-15T23:16:28Z","title":"OMCAT: Omni Context Aware Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12109","snapshot_observed_at":"2026-08-01T21:22:40.689615Z","title":"arXiv preprint arXiv:2410.12109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.689615Z"},"links":{"cited_paper":"/paper/2410.12109","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:8dc5a2d3d03069dc7598d9e51cbe3d82756341e34d258570e88a39ef39ac0d7b","observation_id":"e1550466-f35c-4afc-858b-2eddcd710cf0","resolution":{"observed_at":"2026-08-01T21:22:40.689615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-01T21:22:40.797149Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.797149Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:41578a71182d066d15114f900f0348501083585e597b05256210462123f059c4","observation_id":"e9c2704b-7436-4211-8579-6aca9c607716","resolution":{"observed_at":"2026-08-01T21:22:40.797149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T21:22:40.901843Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:40.901843Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:53757892e2db4b25fe61c909e71ac425658044aa7ba535b101a4487a047b1d81","observation_id":"38d2d651-2e57-4ac8-9475-2ff65d45f4f2","resolution":{"observed_at":"2026-08-01T21:22:40.901843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-01T21:22:41.000381Z","title":"arXiv preprint arXiv:2501.13106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.000381Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:89f212b382e5d029a66a60bbf0504940de31779db6a51d332eccd73215e26134","observation_id":"e61542aa-ca77-444c-a21c-c24e12eed8de","resolution":{"observed_at":"2026-08-01T21:22:41.000381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.090879Z","title":"Qwen3.5: Accelerating Productivity with Native Multimodal Agents , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.090879Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:fbf9ee7884f794af8d00e23bcfa1ab6f88f4b9261955a758b7e9e28b616dd39c","observation_id":"7dc6ea97-3063-45f7-aae0-def63612fbea","resolution":{"observed_at":"2026-08-01T21:22:41.090879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-01T21:22:41.155465Z","title":"arXiv preprint arXiv:2305.10790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.155465Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:66b5b7aa723622ef0bb96179c562528a29a1eb11fc490aedbfa2dffef012985b","observation_id":"e780d499-6b41-4c88-aca9-5acb343089f9","resolution":{"observed_at":"2026-08-01T21:22:41.155465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-01T21:22:41.231325Z","title":"arXiv preprint arXiv:2310.13289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.231325Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:0a2d70409cfb092a19c579a37d0999a1e632766fcdea189e83a36d435e6428e8","observation_id":"3c6d3b1b-44e7-4df3-830c-b9c5dbce2a02","resolution":{"observed_at":"2026-08-01T21:22:41.231325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-01T21:22:41.305763Z","title":"arXiv preprint arXiv:2407.10759 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.305763Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:264099aacde0eeb80033d6efb94298f7331002ca5f0284d71c2371f0936b44b2","observation_id":"3e6c9454-80b9-4e57-8cc1-2b06661cce35","resolution":{"observed_at":"2026-08-01T21:22:41.305763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-01T21:22:41.376265Z","title":"arXiv preprint arXiv:2507.08128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.376265Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:cb35cd707404cff3fa5ff29fd175c4d053f85a3aa8a0a84870718a26c425b03b","observation_id":"bb551276-05be-4acd-a8ad-5fc8880eebb3","resolution":{"observed_at":"2026-08-01T21:22:41.376265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.446777Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing: system demonstrations , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.446777Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:36da978a84dbd106f490addb6b1551b3b0f612f0da22dcbe3415787004496150","observation_id":"a7372958-5c1e-4aeb-9e5a-23c64111fc5c","resolution":{"observed_at":"2026-08-01T21:22:41.446777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-01T21:22:41.513991Z","title":"arXiv preprint arXiv:2406.07476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.513991Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:7acbf2f9c3f469295c3ce87ebd9ad229d1d3fa2ff5ebaa439a0d5e8530f7534c","observation_id":"bbad4e9f-0853-418a-966d-4f70df750658","resolution":{"observed_at":"2026-08-01T21:22:41.513991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-08-12T23:37:09.264651Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-01T21:22:41.603969Z","title":"arXiv preprint arXiv:2406.15704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.603969Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:656b35a8ba2fa6713fef45024332d7aaaad8e46a98502f80bda80785276020db","observation_id":"81ebca45-58da-47b9-9c4a-b1bb9cbe8de0","resolution":{"observed_at":"2026-08-01T21:22:41.603969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.707564Z","title":"arXiv preprint arXiv:2506.15220 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.707564Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:6c1f2a7a9c6cd6a9e73fde44d36b1711746c95756ac20a9c29aeacd659cd51fe","observation_id":"20af0184-3800-45b3-b05c-27ec19a6ce3b","resolution":{"observed_at":"2026-08-01T21:22:41.707564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:41.799529Z","title":"arXiv preprint arXiv:2505.18110 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.799529Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:e893038a90c63d5eae3ff4c78db207547470e6583995e6e67b96df6d883b00ff","observation_id":"88feba05-0ed9-4955-99ce-cf8ee90383c6","resolution":{"observed_at":"2026-08-01T21:22:41.799529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T21:22:41.875668Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.875668Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:117a7eda328fc826f6a4caff44a1486fa0a3cdfb9c0dea93ada855f17906482b","observation_id":"fa56da0f-20c9-4e01-b3ac-3fe6c8c65e4b","resolution":{"observed_at":"2026-08-01T21:22:41.875668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-01T21:22:41.949877Z","title":"arXiv preprint arXiv:2403.05530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.949877Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:0c7cf2326e69a9bf12bf75bf9cdcc4ebce943f6bffa500992795500d687499b9","observation_id":"9566dfce-d775-4b18-98a6-47cc75d1a9c9","resolution":{"observed_at":"2026-08-01T21:22:41.949877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.018175Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.018175Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:90dc517ca4257d84a4c0e6e70f0c51ec325f8b39ff94ec89be55c6f55c841e55","observation_id":"8720fd63-fcdb-424d-838d-55f5e703c9ff","resolution":{"observed_at":"2026-08-01T21:22:42.018175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T21:22:42.090172Z","title":"arXiv preprint arXiv:2509.17765 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.090172Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:3821a7886cad26f81430b443750d0cf613deb4bc1ea13ed0003f2464f39762a4","observation_id":"00795037-c8fb-46e5-8510-11d543ba2b4f","resolution":{"observed_at":"2026-08-01T21:22:42.090172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-01T21:22:42.159270Z","title":"arXiv preprint arXiv:2503.01743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.159270Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2d5b231080c57891bff627dc1f06d86e59239c72fb4ce923de6f350e44cf70b7","observation_id":"42b117b3-9681-4ea0-87ee-540ea41917cf","resolution":{"observed_at":"2026-08-01T21:22:42.159270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.235632Z","title":"arXiv preprint arXiv:2510.15870 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.235632Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:a46b092b2c84b1c347fd57b910b304fb6d6462f987eba6263873adbfacf4a443","observation_id":"62bb7db4-accb-46de-8675-b296ba13e2e4","resolution":{"observed_at":"2026-08-01T21:22:42.235632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.321906Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.321906Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:6f5c3ef2214d0a30642ec5a28ddaf04696fa3634438fbbec6559e46078d30b41","observation_id":"82b24654-7de2-487f-a41a-b7a01fcb4b2a","resolution":{"observed_at":"2026-08-01T21:22:42.321906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.392444Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.392444Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:96b9a8fdeec4be3d626b4952cd4d5dfd7f97a6bad242e7237e1b150176917ec3","observation_id":"1a431ab1-ec56-4fda-8e91-21f43e848455","resolution":{"observed_at":"2026-08-01T21:22:42.392444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14145","last_updated":"2026-06-20T06:06:01Z","snapshot_observed_at":"2026-08-06T03:38:50.897522Z","submitted_at":"2026-03-14T22:28:38Z","title":"MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14145","snapshot_observed_at":"2026-08-01T21:22:42.469251Z","title":"arXiv preprint arXiv:2603.14145 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.469251Z"},"links":{"cited_paper":"/paper/2603.14145","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:fe49c6e9e3c74cbb57a5e277af84b2011fc5f0ca2f35b0e2a1ca2de57ecbd153","observation_id":"c97dc29e-8fc5-4ad4-86e4-5d6e0b14bfbf","resolution":{"observed_at":"2026-08-01T21:22:42.469251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.561452Z","title":"arXiv preprint arXiv:2510.20579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.561452Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:bac6ab074e04567200d3e9177cf17c1ef1400126396bb598c7befee144f3fe29","observation_id":"b668cce2-0fc5-4baf-b068-67c779f4af65","resolution":{"observed_at":"2026-08-01T21:22:42.561452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.659092Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.659092Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:384b3b1f32de13d1e490db6c5ba3d3a48948dc141fa1f775e5625ccf72fa6935","observation_id":"dd087e89-9926-4d0f-ab5e-8a5110d19796","resolution":{"observed_at":"2026-08-01T21:22:42.659092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:42.758210Z","title":"Proceedings of the ACM Web Conference 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.758210Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2c993d1696b0411516ce9e2aa49362329bfbd5c72112089202da42efdb3ab941","observation_id":"0cc3648a-60ca-40b9-8d7b-722b913a3c4b","resolution":{"observed_at":"2026-08-01T21:22:42.758210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-09T02:09:40.214145Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-08-01T21:22:42.836941Z","title":"arXiv preprint arXiv:2507.02001 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.836941Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:419396f14aacb9fefc981e3789552c080381bd9226a8a864b73ebf8897d2f928","observation_id":"be4b30a9-dbd6-4ef6-80e1-276ccb3bb29e","resolution":{"observed_at":"2026-08-01T21:22:42.836941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-10T15:19:55.764802Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-01T21:22:42.917716Z","title":"arXiv preprint arXiv:2503.11197 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:42.917716Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:36811c725cf04836f3322e1e20394e782da7316215c1928547b62479ce161880","observation_id":"1b580945-e9cd-485e-94c7-0b3bb827eaf8","resolution":{"observed_at":"2026-08-01T21:22:42.917716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.009396Z","title":"arXiv preprint arXiv:2511.15848 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.009396Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:09b5e8f1696eb7ad1252ce9c668288faaa9da15127ece86af5b2b2a413d0c6f1","observation_id":"4b996d6c-e279-4777-b4cb-428b4e22de25","resolution":{"observed_at":"2026-08-01T21:22:43.009396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.107901Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.107901Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:1da8b0d60dc51f152b8144ed858a933dc77be642fd5347d0c95b69900607a896","observation_id":"8c2dbadf-30ff-4138-85e7-4f09009d0f0d","resolution":{"observed_at":"2026-08-01T21:22:43.107901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.209064Z","title":"2024 IEEE/WIC International Conference on Web Intelligence and Intelligent Agent Technology (WI-IAT) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.209064Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ae87f77c208e623f77df4432082c36015e16cfe04b9ef32128e757e421e3a34b","observation_id":"2797f0e1-d57f-4a6f-8f08-150a2911757a","resolution":{"observed_at":"2026-08-01T21:22:43.209064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.299890Z","title":"Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.299890Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b275aeec84e15ad287a2ad9de3c99d8b4a36e412736be2b8733090bc5a65ce6b","observation_id":"b126fabe-ca66-4027-8f5f-65efd45d83be","resolution":{"observed_at":"2026-08-01T21:22:43.299890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24954","last_updated":"2026-05-11T07:26:38Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T19:49:21Z","title":"Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24954","snapshot_observed_at":"2026-08-01T21:22:43.362060Z","title":"arXiv preprint arXiv:2604.24954 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.362060Z"},"links":{"cited_paper":"/paper/2604.24954","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:42ec93409c8c7aaa2fb7b4eedfa929a1987c483892ef9096f57b6be073285750","observation_id":"69a30c48-55a7-4e38-b11e-07600fb82e9a","resolution":{"observed_at":"2026-08-01T21:22:43.362060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T21:22:43.444670Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.444670Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:e692fddf813f499bb3aba81a30487f841eb93df16ac95a613f0d16c7a9cb2aca","observation_id":"0c08b50a-da78-4480-9812-f013054d2b8d","resolution":{"observed_at":"2026-08-01T21:22:43.444670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.538706Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.538706Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:aae881bc29bd7606bd22ee0528f1482d9f67e810a48905f97e45d8701b892544","observation_id":"4da9fdf6-5955-401c-b3f3-4b64f8f548c8","resolution":{"observed_at":"2026-08-01T21:22:43.538706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-01T21:22:43.630184Z","title":"arXiv preprint arXiv:2406.16852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.630184Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2ea5780b0de2db97552da5e3b6a873f0ec4c9a66e53fbf1a3111b4fe30838526","observation_id":"c7fc28df-1016-4d27-a67f-bab84fb3303c","resolution":{"observed_at":"2026-08-01T21:22:43.630184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.720306Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.720306Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:c80b38ae6cfbecec13c3ee6463e79e79f887fd4b388a0bc3b2f127fbe052a38a","observation_id":"d422a69f-90a0-4bc3-98f1-3403dc3fa754","resolution":{"observed_at":"2026-08-01T21:22:43.720306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.783767Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.783767Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:a518ce6455a2a036d6602feca2e1f56570918a3196d21c83cf1985ccb23ffb94","observation_id":"5b48f25d-3cd4-4a78-96a5-bc02eb2089fb","resolution":{"observed_at":"2026-08-01T21:22:43.783767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.839298Z","title":"arXiv preprint arXiv:2511.10289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.839298Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:493ece13c741b0ba1f5001d1a350642bd1b88be311cc35221bbb80de199c7542","observation_id":"5798ff05-7636-42d1-a667-0b82db648e16","resolution":{"observed_at":"2026-08-01T21:22:43.839298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.897431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.897431Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:8ec5648e4fc70e64a73d04fdf8abd3059850fb0f3e167c6d05d1d0c1a3b0b8be","observation_id":"efffeae0-65a2-4a10-845f-16b9b7c89b5a","resolution":{"observed_at":"2026-08-01T21:22:43.897431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:43.984329Z","title":"The Second","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:43.984329Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:1b4ab2bd833ab024bd337a28150641a417ea6502a74b36016179d3561a39cec3","observation_id":"2a8502f4-d1c2-4928-bfc5-81c09289f904","resolution":{"observed_at":"2026-08-01T21:22:43.984329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.045812Z","title":"2024 IEEE Spoken Language Technology Workshop (SLT) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.045812Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b8da5cf92a0b08fab4b2577d770cb71aa54542d4c7b1a712c9a6ea9babad086d","observation_id":"49f84baf-e103-45eb-ad37-01437851bf8b","resolution":{"observed_at":"2026-08-01T21:22:44.045812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.107511Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.107511Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ae92e36d2003cb1a246b5b0a57727b33295dbe2cbd89ef045f14004459a9f8c4","observation_id":"46ad318d-c52b-4bec-84b1-4dde077421cb","resolution":{"observed_at":"2026-08-01T21:22:44.107511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.171672Z","title":"Computer speech & language , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.171672Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2d2f3acfb3a08fde4e981528bf0522b06891ffe693f09bb92d5ba77e2381aea0","observation_id":"aae0847c-5ace-490b-b222-6749d1ae8137","resolution":{"observed_at":"2026-08-01T21:22:44.171672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-14T22:10:56.475667Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-01T21:22:44.232624Z","title":"arXiv preprint arXiv:2007.10310 , year=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.232624Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:c0c79bda3e4a9baef1c16c579ba43aeb5ae8b0a47f813a98d6a1d5292d687d46","observation_id":"9e293a0b-0cb4-4840-914a-3c64e96a547b","resolution":{"observed_at":"2026-08-01T21:22:44.232624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.292757Z","title":"Oriental COCOSDA 2017 , year=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.292757Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:56c58d75918528bd800fb74028c19da62e04e628f0389034bbd7732e47378c05","observation_id":"05cbc8c8-da41-4b9c-a717-82222585d635","resolution":{"observed_at":"2026-08-01T21:22:44.292757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.378133Z","title":"2018 , howpublished=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.378133Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:dcc2fe7af25a1ae4623421414c4cd1a4619e02aa0c1049d94914dcc23f1aec72","observation_id":"41ff913c-4e78-4724-8f72-e8144eac96ab","resolution":{"observed_at":"2026-08-01T21:22:44.378133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T21:22:44.467470Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.467470Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b6bffb5c8235016d20198ac5a300bda77ab38369c9d1b96948b73dc10621e761","observation_id":"4c300cbe-48c2-464d-b347-962bb006cff6","resolution":{"observed_at":"2026-08-01T21:22:44.467470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.534118Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.534118Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:5ba443002d36a7244b7c54afe4a47fce4b75facfbffd3b153e1543a5a8c4998a","observation_id":"f118a2ad-9d96-4d42-ae46-6ccaee531d15","resolution":{"observed_at":"2026-08-01T21:22:44.534118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.592091Z","title":"2016 , eprint=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.592091Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b9c32b3f0af72e742fa478bcb1da3836d8cf3edcdedb9aa883e57902abfcd7e0","observation_id":"8cdae003-f0b8-4083-8e72-274d2a119585","resolution":{"observed_at":"2026-08-01T21:22:44.592091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.683400Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.683400Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:0fab76723b697ba9623963398b37db47b8fee47e3bae8d64cc8cc87e6caa6b52","observation_id":"55484920-d3df-4176-80d9-1493c33d750c","resolution":{"observed_at":"2026-08-01T21:22:44.683400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.769541Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.769541Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ea0bdd09968e4972b9043087d32db1f0f7113670a9c3250be409cdceee3f737b","observation_id":"b0b0c5bc-6cc3-4134-b9fb-d3a2511a4d5e","resolution":{"observed_at":"2026-08-01T21:22:44.769541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.859583Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.859583Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:078ce5e36dcf0785c2c490c046bfc60cdd3b911053b3f7001f1c096b5cdc9660","observation_id":"cb268a2f-c898-4e38-ba78-d62e7fc9b42f","resolution":{"observed_at":"2026-08-01T21:22:44.859583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:44.946062Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:44.946062Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:cb71d473e76a65e745757423fc82e860b5b8e80ac42a93ee942c57d55b8fe836","observation_id":"c77d002d-fb4d-4e8c-a5de-3c0f2ec0f28a","resolution":{"observed_at":"2026-08-01T21:22:44.946062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.009092Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.009092Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:6ad3e6b288fb013cb584d8a5f087abe6539058f5f7c333b14a8b6fd7c37ce6ee","observation_id":"8c2a1083-c05f-440d-be4d-63897827ef4b","resolution":{"observed_at":"2026-08-01T21:22:45.009092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.082704Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.082704Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2822a2f39ee88f951e793b7b279d0f4607f5a31501b754c7e4ce3eb75667b4b6","observation_id":"96317226-48b5-4547-8fd2-0670fbb0196d","resolution":{"observed_at":"2026-08-01T21:22:45.082704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.145377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.145377Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2014aebfd1263ceed99355db5fe09ec729889fef774e5169cfed91292b19a59c","observation_id":"bc54388a-5216-4ac3-a44c-c8d17e240de1","resolution":{"observed_at":"2026-08-01T21:22:45.145377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.209967Z","title":"and Ellis, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.209967Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:4c8f190e9864a924631b94bf45e783b0bb9b816d5803b0888d086de6c47668b2","observation_id":"a90ffa87-d61c-4411-b4c8-5627d63b2d05","resolution":{"observed_at":"2026-08-01T21:22:45.209967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.281555Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.281555Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:a780dec27a14479be6f861d4dec17a0d3f659a732b0071c1dffb5d60c1998f91","observation_id":"87141554-f6fb-4326-9ab1-e1830a397d5a","resolution":{"observed_at":"2026-08-01T21:22:45.281555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.364742Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.364742Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:7e3ee5cac5712e018b1d0180b3590dc7bf4d7fa9a68d739587ecb715f8892132","observation_id":"abee88e4-6156-40ad-bc02-041525c323f7","resolution":{"observed_at":"2026-08-01T21:22:45.364742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.424894Z","title":"1993 , howpublished =","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.424894Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:f4e62873aa351ca7a54fface042c70ef1bede510b202f9ee83fdead650af2117","observation_id":"4795bd32-d9b0-4ff3-9ce9-3f4068d7a821","resolution":{"observed_at":"2026-08-01T21:22:45.424894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.472290Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.472290Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:7463a581907a1e02f81c21794215ca111ad229af02168aed34cb9eae7c4d0562","observation_id":"74ae0bd6-beb4-4d4b-9c04-8eac09ef98c5","resolution":{"observed_at":"2026-08-01T21:22:45.472290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.559470Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.559470Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b066725d936b30f2ad47643e224823afa2146c7fcf6aba599c82b94207fee7ca","observation_id":"a821ec62-5c5f-457a-a95f-89cb3ccabd49","resolution":{"observed_at":"2026-08-01T21:22:45.559470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.616519Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.616519Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:bc108455963f3df5e185a84b8f7817cf2ae316b9bf640900675bdb3bf2b03dc6","observation_id":"923eb1b6-3088-44ce-a88e-d911f8792df5","resolution":{"observed_at":"2026-08-01T21:22:45.616519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.702118Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.702118Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:dee76a763ae5ef3371f85f8a95a84bce81904ef4d11453d748642b664202f966","observation_id":"93b0697e-ef99-40c9-a76d-4fbbf350dec7","resolution":{"observed_at":"2026-08-01T21:22:45.702118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.761624Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.761624Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:446a3715cbe2266dd738b156bd122af71c603c135e1464427afa8ecce23e58d9","observation_id":"9d2fec60-061a-425f-b866-b61bd84377ec","resolution":{"observed_at":"2026-08-01T21:22:45.761624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.846104Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.846104Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:68aa3b6304eab7aa9c324435b2fb5f5dd92b1a9dfc9774ad4a9cb42391e3a3b3","observation_id":"38f5dbcf-7489-4cd0-a4b7-e407b2a81ca1","resolution":{"observed_at":"2026-08-01T21:22:45.846104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:45.937648Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:45.937648Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:2eee5e116963cc29f4fd888a8bb81e43d443449002a8c7dd588472cb8ec1eb75","observation_id":"fb56dfb5-0815-48bf-bac9-41b1a072b9ff","resolution":{"observed_at":"2026-08-01T21:22:45.937648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.024191Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.024191Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:597d00e5d124da49283ed44543a5ab311f8da1508bc4303d6d5b0dff612f1b0e","observation_id":"95dd7b8e-426b-4df5-a651-3366a78072b6","resolution":{"observed_at":"2026-08-01T21:22:46.024191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.111036Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.111036Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:3557c46abee266aa965290aebe47d85d561fe033604249f81a24fda8e779a82c","observation_id":"26c99fd9-73a0-4e17-b117-54f1eb66f30c","resolution":{"observed_at":"2026-08-01T21:22:46.111036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.171684Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.171684Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:550f4f4faad727570592cc0b384169d5e046a4978b5e4dd0381906eb9db8bb3e","observation_id":"41121929-a1b2-483b-bec2-e4395bd05015","resolution":{"observed_at":"2026-08-01T21:22:46.171684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.277747Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.277747Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:22301c3e0d347afb51cc4a0c274489c4481f9d3341f5e60dc1f204c3db67a6c8","observation_id":"90a1066a-c69d-401a-85a6-b0b9cfbc3d25","resolution":{"observed_at":"2026-08-01T21:22:46.277747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.445898Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.445898Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:76cee6da3f820ba739c02286335441191778a3d89f606c2f316e12883d8a6a3b","observation_id":"dc2538a6-b8d4-4e69-9772-ac541b8629a3","resolution":{"observed_at":"2026-08-01T21:22:46.445898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.620323Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.620323Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:e06d27e213b41e3772c977eee63ce781533448db6175d89c067c28952810e46f","observation_id":"7b77b87d-a174-4afa-b4bd-9e8645427cb3","resolution":{"observed_at":"2026-08-01T21:22:46.620323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.713585Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.713585Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b1989ea57cbe7dd67fde7373cb0c6efa796a6f1eff8b2c2e97c2f45af02f64a0","observation_id":"bb1b1134-9667-4379-ab2f-c82d1a8e444d","resolution":{"observed_at":"2026-08-01T21:22:46.713585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:46.816255Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:46.816255Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:532d5f1a3ef3c4654b6e83ed396b1aaebd2ac7a48b18549d75c24b436edae7ea","observation_id":"9af27be9-a66c-46ec-807a-ac2d6fa845eb","resolution":{"observed_at":"2026-08-01T21:22:46.816255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.016118Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.016118Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ccd2fdac805fbe4dd4b0b68609d4eb8cc87cba7dc4f8cc47b4324103776aa52a","observation_id":"747537bd-1831-49cd-9a3a-063077568257","resolution":{"observed_at":"2026-08-01T21:22:47.016118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.128477Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.128477Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:5cde1d92afb9d23743f7862493455a795c6500cb16c2605a84a45cd96b39f2a4","observation_id":"48a0ef75-764a-4f0c-aac2-29abcb18e807","resolution":{"observed_at":"2026-08-01T21:22:47.128477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.266624Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.266624Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b3a58f7c15a98e2b420035dc3fe7be2a4e124bf8e162cd0cf7ae3b3a0c020c60","observation_id":"92a158d4-2ce6-4f4b-98b4-aeab81bafd32","resolution":{"observed_at":"2026-08-01T21:22:47.266624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.382179Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.382179Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:01f1d1909f0d9ceb03c5084c679b6fe312b3b4b3eeb7753190abd067869b99b0","observation_id":"a5ed575d-fac3-4920-b397-22f58c0e0c17","resolution":{"observed_at":"2026-08-01T21:22:47.382179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.556138Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.556138Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:adffe446527b5d8dade4677b8f6c5355daa84434efb6a07a1b98f2b3c4f0074d","observation_id":"bae5297c-fa4a-4f60-92ad-31438f0f95c4","resolution":{"observed_at":"2026-08-01T21:22:47.556138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.829504Z","title":"2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.829504Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b39bb4e7d5d35ec779abfa7d5fb55c8e00a004c92531e3981493c6045cd48090","observation_id":"ec011631-a1fd-4f6f-b15c-6a5e86328e2a","resolution":{"observed_at":"2026-08-01T21:22:47.829504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:47.996882Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:47.996882Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:11f68e2154d4bdb235c3d9c700c8cd1dfae35a088ef15caefae8f791c824f01b","observation_id":"8dd6dc99-3b28-4aca-b7b1-57ff937b624f","resolution":{"observed_at":"2026-08-01T21:22:47.996882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:48.154855Z","title":"TED-LIUM 3: Twice as Much Data and Corpus Repartition for Experiments on Speaker Adaptation , ISBN=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:48.154855Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:b78751b437d610b14ff78df2adcab1c14726c73684b32353e93fa50bdf20af85","observation_id":"8087c9d4-4ae7-483f-8498-6bc733bab06b","resolution":{"observed_at":"2026-08-01T21:22:48.154855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:48.332408Z","title":"GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio , url=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:48.332408Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:25fbee8145f00ec20fe1f6bf9809d8f3bba8053231ee09acfb81ef5aae318ab2","observation_id":"aac1044a-e4cd-47a0-a286-6cd07625d6f0","resolution":{"observed_at":"2026-08-01T21:22:48.332408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:48.511479Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:48.511479Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:54eb7cc9bb07e4258331d90ee309160645074d0d8783773b2e99dbed567312ee","observation_id":"22294c93-2c8f-4ebe-bbcc-026e02346527","resolution":{"observed_at":"2026-08-01T21:22:48.511479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:48.688062Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:48.688062Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:38c0246110c1904d66a38e9e06fa43c262b6e7c512802f0214cd4063c4873741","observation_id":"b4fd878e-699c-4e92-a96f-65d40b7122b5","resolution":{"observed_at":"2026-08-01T21:22:48.688062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:48.860270Z","title":"2026 , month = apr, note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:48.860270Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:709be7b6f0bcebbbcfa1b2ac8bb13f82d59ab78349120b75176c30b23a4b1027","observation_id":"e86bdea4-523f-4b6b-8dc5-e99f2d9c31ef","resolution":{"observed_at":"2026-08-01T21:22:48.860270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.004520Z","title":"The New York Times , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.004520Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:23aecb4856fa35f5cb3fc2faa60eac934cc8ec69dfa0b36a12dd93727248f875","observation_id":"d368d464-f875-484a-b7ae-915e17dc4df7","resolution":{"observed_at":"2026-08-01T21:22:49.004520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.190620Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.190620Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:a5daf13c300c6b1f80cc9041ad19f8be62c3845b62949453b78ab4ee492d6f4a","observation_id":"c6a0ac69-9de6-43d7-8ae7-c91326b3b2ed","resolution":{"observed_at":"2026-08-01T21:22:49.190620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.328060Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.328060Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ca50c20c7d1685b26defb56b25f6b640761d9a5143af3d6c5526ac3301cdbcc3","observation_id":"1c6c62ab-426c-4e75-aa32-036571d639fc","resolution":{"observed_at":"2026-08-01T21:22:49.328060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.466034Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.466034Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:9aae3845744ae389ea99177dae9e1c0f7d40904d2d156b22ae561c20157692f1","observation_id":"b2c56403-fc92-4fd2-a36f-5a6b49e17f9e","resolution":{"observed_at":"2026-08-01T21:22:49.466034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.630807Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.630807Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:1a20bccd83197051d7cd6981fc9879bf162a65bbf708523d7e1a0bf03e6d6703","observation_id":"0da4c31a-aafd-488c-89d3-fb9f96dc2ad5","resolution":{"observed_at":"2026-08-01T21:22:49.630807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.828306Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.828306Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:c0f778074dfa46efcd6918e8086d2d0615c14f080ff7cf392a02029812ad6753","observation_id":"182a556f-9aaf-4bb1-890f-e7f4b798a4e0","resolution":{"observed_at":"2026-08-01T21:22:49.828306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:49.999541Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:49.999541Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:ddc491ae890dd991149f1e740611ccaf3f595691b7a1619dce00cf69890d23e6","observation_id":"19310eec-35d7-4840-8a8a-fa0e767e5073","resolution":{"observed_at":"2026-08-01T21:22:49.999541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:50.151413Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:50.151413Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:8b6ad72b89c0fa349a263b25ab13ebae1bed5c40b3de80603743cbe9fd62f2f5","observation_id":"e4a5fd58-60f4-419a-ae91-ebe3d1e9d9dc","resolution":{"observed_at":"2026-08-01T21:22:50.151413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:22:50.302973Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:50.302973Z"},"links":{"citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:0cac49aa21ccb6785abc6af6795f2740e74d9b02cd1dbc95d82bfb5abb579c6c","observation_id":"a26cf0f7-ca21-4ff5-8627-43deb295b4c6","resolution":{"observed_at":"2026-08-01T21:22:50.302973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T02:28:51.093129Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 0 inbound Pith citation observations for arXiv:2607.16107."}