{"as_of":"2026-08-13T09:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6984c91945ce160c26d02e0f5765baf006d989d77ee32b7583f015125a70e5b4","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:31:16.265521Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09435/citation-record","integrity":"/paper/2608.09435/integrity","json":"/paper/2608.09435/citation-record.json","paper":"/paper/2608.09435"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.781188Z","title":"Proceedings of the 6th Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2021) , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.781188Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:3a26d1c79a0cb9f0eed6ac589a3e5b92e2e05f38c4deb4ff0a7e5129fc1662e1","observation_id":"04ff485b-0e38-41e3-be6e-6ee24df84986","resolution":{"observed_at":"2026-08-11T17:31:15.781188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.788703Z","title":"arXiv preprint arXiv:2606.19348 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.788703Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:16faa86d3ab84d1da243e36c0e17fa01ceff6e9464e13f42d20e451d2f6420ae","observation_id":"47f0f2ea-d125-414a-9cce-cecf045661f8","resolution":{"observed_at":"2026-08-11T17:31:15.788703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-11T17:31:15.794034Z","title":"arXiv preprint arXiv:2504.18425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.794034Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:7f4e4b611e2d42549c7f38f08648d39e2f9311a05fcc24a0efae503390ee174a","observation_id":"c202388e-43b7-4d69-ac9a-606476f21451","resolution":{"observed_at":"2026-08-11T17:31:15.794034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.799394Z","title":"doi:10.21437/Interspeech.2021-698 , issn =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.799394Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:d9f3d06316c9b7a98569e7534c3ad99b6a61e89e808aa648088c23ba097a67dc","observation_id":"843c9c46-6a0b-4418-9461-c2a2d923b5ee","resolution":{"observed_at":"2026-08-11T17:31:15.799394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.804735Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.804735Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:16f8563e3b050d5423ec2f577ac9b61bc45d4ad00ceca2216e788769ee28f9a7","observation_id":"cc6b64d3-383c-444e-a4af-c9a07548dd9f","resolution":{"observed_at":"2026-08-11T17:31:15.804735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T17:31:15.809739Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.809739Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:cd6a572d087bd5e3e1fcd3d2b002d84a2e82107b93f573ad7cca3e90e67b5746","observation_id":"5fe10506-c759-43ce-9ee9-8cbfb99ce73a","resolution":{"observed_at":"2026-08-11T17:31:15.809739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.815138Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.815138Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:f0593e2f6469c26a959372898613c4e53c8f91d1f98fc3ef9a6e7eafeb02c8ab","observation_id":"f23b135e-6e3b-467c-b500-eb567cae0515","resolution":{"observed_at":"2026-08-11T17:31:15.815138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.820170Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.820170Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:503c6269352050dc50f496f843c4ae6edf913e001bab25bf9082a9a50bd3ed85","observation_id":"41031b32-f7dc-4a41-8e01-1c39b633167f","resolution":{"observed_at":"2026-08-11T17:31:15.820170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.825345Z","title":"Classification Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.825345Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:c4a44409178321e324aa9ec3f346c56589d4114746d8771805236563f09ea035","observation_id":"e1c0333d-ec30-4f56-b9b5-d87866de500d","resolution":{"observed_at":"2026-08-11T17:31:15.825345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.830677Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.830677Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:8fc27cc70e9fe7dcb0b55eca1ee4145eae6e99426caeced589ade4250812fa46","observation_id":"8ee26178-0066-4839-9811-656a3f829e03","resolution":{"observed_at":"2026-08-11T17:31:15.830677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.835603Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.835603Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:594a16925da118a1e2c4f50f9ccffc3db3b0fa8fb19cfbfa363887f41a11ce9f","observation_id":"4fb795f0-557a-4ac6-8f84-560f27a32343","resolution":{"observed_at":"2026-08-11T17:31:15.835603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.840692Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.840692Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:59a720c7f8c198384a85b91eb67e6011041d2258f0f360cc5a5d86ba3cd3c8b4","observation_id":"82c3f7f9-b256-4717-9621-46724c1695ed","resolution":{"observed_at":"2026-08-11T17:31:15.840692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T17:31:15.845666Z","title":"arXiv preprint arXiv:2406.07476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.845666Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:ff5b4c06ca18142399912d54035b4f44fd8c6a2972ea007d658e78742b0faeba","observation_id":"a3068a52-6aca-47e8-ae3e-28e220fc6615","resolution":{"observed_at":"2026-08-11T17:31:15.845666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T17:31:15.850604Z","title":"5-omni technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.850604Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:f1af16799f39c1d56c8df88112913dbadfaf7c48f686e72581bf44c6d84e730b","observation_id":"f0b5e523-5afd-4076-a883-f2d74cf9bf09","resolution":{"observed_at":"2026-08-11T17:31:15.850604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-13T05:33:22.244747Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-11T17:31:15.855588Z","title":"arXiv preprint arXiv:2407.10759 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.855588Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:622e5992680d43baeb7e9d1fb641ada3480483998a18262bf9f3268321b52457","observation_id":"3cbf6da2-c105-44da-adf0-9723ae850916","resolution":{"observed_at":"2026-08-11T17:31:15.855588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T17:31:15.860490Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.860490Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:5b8bd3ff72dab3aab0ed090c44574129fbc5a1daafdae9545d3b85a5a2faca44","observation_id":"2264e4cb-49df-4d39-810c-01d03a6e82a7","resolution":{"observed_at":"2026-08-11T17:31:15.860490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T17:31:15.865581Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.865581Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:618def7f44c6b5342a1cf61d530b5ebf2dfabaa047d42a513925a54d3acf194a","observation_id":"3a5cc7ef-fb8f-46d9-b5b3-cd28baa34d01","resolution":{"observed_at":"2026-08-11T17:31:15.865581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T17:31:15.870460Z","title":"arXiv preprint arXiv:2306.02858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.870460Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:5b4de44b9ce0c11fb89ceb0a261f5bf64bfa17d0ee9d879ad8ed135929cb7c8d","observation_id":"5ec19816-a098-41b9-a12b-8c4baeaa26d0","resolution":{"observed_at":"2026-08-11T17:31:15.870460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T17:31:15.875213Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.875213Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:512d1a2ac0643f75018e80d4f5a1bbf086708a089841b91f6df1f7f0196a388a","observation_id":"3023b98b-7fdd-425f-b48a-c0b9cc93c7bb","resolution":{"observed_at":"2026-08-11T17:31:15.875213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.879683Z","title":"and Rennels, Glenn R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.879683Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:c7f91101c90ad45a3aae20bee217f1b241e15bf5e0c8041720f1a0aaec324636","observation_id":"5ee4db9a-a080-4102-8f84-6c395e45cc25","resolution":{"observed_at":"2026-08-11T17:31:15.879683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.884011Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.884011Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:cb9f8aed42e33bf56912693cf3e72d7894f8ed92128b4ab3bc9f05740492e2e9","observation_id":"c9cb7848-35a8-43c8-a96c-5626202d39d9","resolution":{"observed_at":"2026-08-11T17:31:15.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.888398Z","title":"Transfer of Rule-Based Expertise through a Tutorial Dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.888398Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:b06d09140e87b1aaf3821a1e7e0f5ea56f3a07886153f1a28170f8bb514190aa","observation_id":"24a9b67a-1139-43c2-ad0f-9ccf2e4259aa","resolution":{"observed_at":"2026-08-11T17:31:15.888398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.892716Z","title":"The Engineering of Qualitative Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.892716Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:6df123562ecd9ddfbfebcf22d5710aae014a4a67b924cb44eba87d6eec8c1679","observation_id":"26d93712-6eb8-4a18-8b51-98d4f49a2f53","resolution":{"observed_at":"2026-08-11T17:31:15.892716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.897094Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.897094Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:0ce6b1d92d514835f85ed4a407ae1a9bcd48d95b00c60377dbc94f3f4255ea93","observation_id":"66219162-e6bf-408a-aa00-6a97cb268638","resolution":{"observed_at":"2026-08-11T17:31:15.897094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.902110Z","title":"Pluto: The 'Other' Red Planet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.902110Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:45b02a14dbc1036d4f7a3512d50c38355c22b0945b7c4cc8ecf6b56d5ef5c891","observation_id":"7d1c5648-1dc1-4ccf-97e4-8dd99b8375b1","resolution":{"observed_at":"2026-08-11T17:31:15.902110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.906340Z","title":"2023 , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.906340Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:016bd43793598f524f78326bbc237ca5a4da951ff441a59b32eb6918e45627ad","observation_id":"676bcba8-5172-4f13-9719-69bdeb104726","resolution":{"observed_at":"2026-08-11T17:31:15.906340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.910427Z","title":"2022 , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.910427Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:39e61a3ea60d91ceeb512f1f0d5159894caa7e8aef06f83d52e1a5a39bbb847f","observation_id":"a012fd13-8076-4cee-b958-643ac5f54f41","resolution":{"observed_at":"2026-08-11T17:31:15.910427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.914764Z","title":"2023 , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.914764Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:58541655146e3d9abc7c5a0226f680e7cf04cec03ea5de75bb4e934020833e45","observation_id":"7d331210-c885-43b0-85cc-074cacf94faa","resolution":{"observed_at":"2026-08-11T17:31:15.914764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.919326Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.919326Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:3eccd77918708a43ee8b8bdd2257b2180bc9aabaa85129e6dc3510d2bcfcfa15","observation_id":"acfb5a09-47b8-4b30-a999-6862a9059b15","resolution":{"observed_at":"2026-08-11T17:31:15.919326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.924051Z","title":"Evidential Deep Learning to Quantify Classification Uncertainty , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.924051Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:8440dfdee9cdaf0249e2c38b4ab4d54bf6dd5610bb346444fbd51b2980b3e33f","observation_id":"870c1633-b832-4c63-a6a0-fa84da4488c4","resolution":{"observed_at":"2026-08-11T17:31:15.924051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.928813Z","title":"2023 , publisher =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.928813Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:5ef390ad66f434f99730013be137a43611a6a9ea47d184e0215c16c7a56f8a04","observation_id":"a916ee69-cc71-4b6d-afc6-ce3adca97a07","resolution":{"observed_at":"2026-08-11T17:31:15.928813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.933913Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.933913Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:611596aee04a2171d656ba7e4b8cfdd22e0cc77cf11065232e92f4bbb72eba99","observation_id":"48550468-28ea-4b59-9425-70adc020939f","resolution":{"observed_at":"2026-08-11T17:31:15.933913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.938937Z","title":"2023 , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.938937Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:6233c3a4db2e68e67daf4cfc80c69cb847d64259daeff6d41af6a00fbee82862","observation_id":"7acb0b4c-2c08-4884-b71f-aceedb5a25b8","resolution":{"observed_at":"2026-08-11T17:31:15.938937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.943748Z","title":"2021 , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.943748Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:650204e2ef8d0ec8f287be292d9d24eaf30160553acc6156c49dedfd2147da1b","observation_id":"3bd848ad-8b01-4187-9a44-6dcc03eb8959","resolution":{"observed_at":"2026-08-11T17:31:15.943748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:15.948542Z","title":"2015 , volume =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.948542Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:184f3c5d968d7799f415c662b4c53d8516281dc73fcadb5f74b7c09c065a5f8d","observation_id":"03255404-7148-4dec-a1ec-1120b607f241","resolution":{"observed_at":"2026-08-11T17:31:15.948542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:18.065739Z","title":"NOISEX-92: A database and an experiment to study the effect of additive noise on speech recognition systems , journal =","venue":null,"work_id":"cf6390a7-1d68-4b4a-81a7-5fbbaefea9b0","year":1993},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.953311Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:9351eab1bb869a18b786c384603aa880d925aa84b02f0dcf2c8af444d40c73ba","observation_id":"30225d71-b9c5-45ae-8afc-27b06bfa9847","resolution":{"observed_at":"2026-08-11T17:31:18.071321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:18.050494Z","title":"2019 , volume =","venue":null,"work_id":"3c544eac-3577-41dd-996a-2c2b3eb49077","year":2019},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.958040Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:94e0e380972f836e9ae9b654a9933b122e06d4db0e46abbb11cc57f5c66355d9","observation_id":"515d9a57-cb1d-40d1-ae16-4ae765ba57d5","resolution":{"observed_at":"2026-08-11T17:31:18.055527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:18.034184Z","title":"2022 , volume =","venue":null,"work_id":"2e654cf5-75a0-4f4e-81d3-79b1f94dbdf4","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.962751Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:8368e12a36480b7fe29c4686290ad76efb8a7ecd712e4867072b2c86a321381e","observation_id":"192b7d0f-712a-4257-85ab-9af64b5ac28c","resolution":{"observed_at":"2026-08-11T17:31:18.039365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:18.018220Z","title":"2023 , volume =","venue":null,"work_id":"c62ad4c2-6a7a-4b77-85bf-607d85c871f4","year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.967490Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:125d947711a7219542843da781438086d2c8e9136670028dd064b24460cbc74f","observation_id":"15a6608f-3cf8-48c9-aac5-445bc2d82a56","resolution":{"observed_at":"2026-08-11T17:31:18.023376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:18.002678Z","title":"Industrial fluid pipeline leak detection and localization based on a multiscale Mann-Whitney test and acoustic emission event tracking , journal = MSSP, volume =","venue":null,"work_id":"3d9a9461-1d47-41ac-b8f9-2227f2c01964","year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.972296Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:3a511b8777547d74beff81d5f7d9864bd91b6421fd34556454515bcd2a5fcbb6","observation_id":"1757f49d-7cae-4980-bc0c-d850b15210a2","resolution":{"observed_at":"2026-08-11T17:31:18.007665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.987030Z","title":"and Carter, G","venue":null,"work_id":"b65aa47a-91e6-466b-a21b-f6ec97afcd6f","year":1976},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.977365Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:da2b64a99fa60a7648c5ce5708f5fd27745b52540087e31f1e6d5e2b681342fd","observation_id":"b3098bc6-a8cb-497f-a78f-da50902bd1c7","resolution":{"observed_at":"2026-08-11T17:31:17.991751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.971535Z","title":", journal = IEEE_J_AP, title =","venue":null,"work_id":"cb747be6-376f-488e-ae52-f486308325ac","year":1986},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.982123Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:277de8b4e35424ea7ea1e558ceb4c86bbf3d081fee9a27486a6c7f301dfaeda8","observation_id":"bd3c126a-443a-47d2-adee-80981f8ab2f4","resolution":{"observed_at":"2026-08-11T17:31:17.976536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.956949Z","title":"2010 , volume =","venue":null,"work_id":"bf5f2dcd-6df5-47e9-be75-3b5569500d32","year":2010},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.986594Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:d2e25470951b208061749cab3c3da2d27c39c3d4d62dae5f9a5a4c93e4723c3c","observation_id":"e2263b15-eb2b-4b95-894d-aa33879e4823","resolution":{"observed_at":"2026-08-11T17:31:17.961456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.942502Z","title":"1968 , publisher =","venue":null,"work_id":"f4fdfbe6-cc86-4e92-8cc5-5b626ac2d839","year":1968},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.991371Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:45bafb416bd44b8dd35ae871741ef367def8667ac685412df68fc202a78a48d2","observation_id":"eebb7571-31ab-42b3-afd8-238127412615","resolution":{"observed_at":"2026-08-11T17:31:17.946982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.927397Z","title":"2018 , publisher =","venue":null,"work_id":"11f56636-897b-404a-88a5-b65749e54ada","year":2018},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:15.996346Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:bd9e79848b4b0d144a2f8d1ce4327276149d85db8a8ff11b83f8ae5810580a35","observation_id":"dfa5e560-54a6-4751-b9e6-f1967cc3f292","resolution":{"observed_at":"2026-08-11T17:31:17.932133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.910997Z","title":"Attention is All you Need , year =","venue":null,"work_id":"057d9f6b-a52a-4753-ab32-c0fa9758bfd7","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.001126Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:e3c63e2708e4dfb4955c02741dceb4837333ada1da54cd768047fd33b97dcb4a","observation_id":"b9d10312-a36c-4d15-90b9-7f01114468d8","resolution":{"observed_at":"2026-08-11T17:31:17.916281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.894912Z","title":", journal = IEEE_J_ASLP, title =","venue":null,"work_id":"4ee61c89-ef50-4cfd-a39f-4e4b428e4786","year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.005812Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:627278b4dc7d7fdbb0aacc2b4801f98e795c2640be0f4a2ef1940c34dc55d0dc","observation_id":"f2ef5355-69ed-457f-9d20-ef62f0526384","resolution":{"observed_at":"2026-08-11T17:31:17.900260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1121/1.2987429","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.416212Z","title":null,"venue":null,"work_id":"22b8c4f5-429c-48bb-88d1-ed436254c6e0","year":2008},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.010450Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:42346aa4b3d4c1f43dd7ed8ff3457f198675b8aa740f42ecdf3562b4fb7d1638","observation_id":"2f783be5-6288-4755-8f07-b8610c13ef83","resolution":{"observed_at":"2026-08-11T17:31:16.421301Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.878670Z","title":", journal = IEEE_J_ASLP, title =","venue":null,"work_id":"d9a37b57-7809-4bfa-8afe-70cf37e10b07","year":2023},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.015719Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:86b62b978911a719324aeec68a9053692a7651c24d261d953050a3144df61913","observation_id":"37d938c7-9752-40c4-9bb4-80522f824220","resolution":{"observed_at":"2026-08-11T17:31:17.883711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.861967Z","title":"and Evers, Christine and Schmidt, Alexander and Mellmann, Heinrich and Barfuss, Hendrik and Naylor, Patrick A","venue":null,"work_id":"7a8ee0c9-c58e-4951-a94e-d535cf4cd18a","year":2018},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.020881Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:915143fca536d8619e529af7bad31d43b7410b01c61a5c6cd7b9affec3cd636a","observation_id":"d0b6a5ad-8249-4b2f-82b5-e63cf19c180d","resolution":{"observed_at":"2026-08-11T17:31:17.867098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.845163Z","title":"and Moore, AlastairH","venue":null,"work_id":"7d24a20c-5c46-4453-9eba-340f2d0390aa","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.025748Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:ec2572e3ee8c7537dc1064c2a78a221aa16716753936483dd19230184b546d0e","observation_id":"945f2e39-8ae9-4e48-bb6b-f7798d538c91","resolution":{"observed_at":"2026-08-11T17:31:17.850673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.828282Z","title":"2024 , volume =","venue":null,"work_id":"b39f9052-9bd6-49fa-bb7f-60078dffb39c","year":2024},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.030585Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:1faf5e0100a99175e43fd80ba407e4366079f93d56ccc85e13a8918285b8a24a","observation_id":"9d615152-aac8-49ea-aa11-751f429677de","resolution":{"observed_at":"2026-08-11T17:31:17.834112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.811953Z","title":"2019 , volume =","venue":null,"work_id":"d8985a9f-521d-4531-864d-991e4f14f634","year":2019},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.035726Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:2ecc921a243054124c55e076c913a5cc8102c2d5ac3f93049eb90d7a7ae40a7c","observation_id":"8a5ad485-b3b4-4bce-9aeb-6ebd93e74e0a","resolution":{"observed_at":"2026-08-11T17:31:17.817280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.795120Z","title":"2020 , volume =","venue":null,"work_id":"149af3d3-4b24-4798-97e9-a16875edf43e","year":2020},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.040610Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:f9c8988fbfd5377a817806e6d47a5e53d0697d42cba29c9f13a161b6164b48f0","observation_id":"dba446fb-85c1-4279-8aa5-3e65257aceba","resolution":{"observed_at":"2026-08-11T17:31:17.800163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.777443Z","title":"2020 , volume =","venue":null,"work_id":"a2a9f6ac-f1c2-4b65-9db7-a511905af7f1","year":2020},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.045542Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:3f023ec3caa5c38b8ad0c6a6ef243919dfdfa3bb20adbd2b60d9688c0126f147","observation_id":"e84f8e48-1c60-4126-86f3-bad2a707b77f","resolution":{"observed_at":"2026-08-11T17:31:17.782696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.761061Z","title":", journal = IEEE_J_ASLP, title =","venue":null,"work_id":"e2f487ed-2339-4573-acbc-3da061be34d7","year":2020},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.050351Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:c4469e36aa50cdddd00c8178e8608e3ba9026ce3ae7952c4cd13b4cf643dcff6","observation_id":"55391902-fe70-4fcc-8d84-461d3a42c3e7","resolution":{"observed_at":"2026-08-11T17:31:17.766501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.744991Z","title":"2020 , volume =","venue":null,"work_id":"c5279f1d-a520-4778-a0c9-ba08c9530a86","year":2020},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.055548Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:05a37060d3c8658de53038be2ae45f76dabb14ae6fa991538da599bef3cc109d","observation_id":"885be313-bb18-4072-bbed-5d7aedea0aab","resolution":{"observed_at":"2026-08-11T17:31:17.750211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T17:31:16.060192Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.060192Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:56401cb490417720dcbac8030161350a9a6699fffc353fd92d26832099b9271d","observation_id":"64ef3442-540c-453f-90ed-a146b1ac9062","resolution":{"observed_at":"2026-08-11T17:31:16.060192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-11T17:31:16.065047Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.065047Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:b77507a69fa24093b03f7047626d8071f3ccfcfd614a98de799ae1f4543e6e1f","observation_id":"03caf2b4-19f2-46fe-a543-265d7ac08aaf","resolution":{"observed_at":"2026-08-11T17:31:16.065047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.727248Z","title":"2025 , eprint=","venue":null,"work_id":"ac2cef34-2f0b-4e9c-aaca-aba9f7f41c24","year":2025},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.070059Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:0ccce4b5bed3078d2ed2c00db8ad6a061540318e5f6902db7efe5b0ec89698fe","observation_id":"1a2bf955-bf87-49f7-bb6f-d63481c66ebb","resolution":{"observed_at":"2026-08-11T17:31:17.732636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.709810Z","title":"2021 , volume =","venue":null,"work_id":"ad08d18d-0c1c-46b4-8cf1-e1b85f4858fc","year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.074823Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:72ed9a0fbe63a4cd96357d4579b45e4b3092dbecc33010fe2c12a74a7d49cbde","observation_id":"d09b27b7-6870-41c5-af54-d4856ad65704","resolution":{"observed_at":"2026-08-11T17:31:17.715319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.692528Z","title":"and Nguyen, Ngoc Khanh and Jones, Douglas L","venue":null,"work_id":"4f5e4fd5-39ca-439a-b07c-e0ee66ab2029","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.079100Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:e380ee4c0a0f507c647ede1a047c0878288ce0f8e5f45b9d26080d2a2b91b4a6","observation_id":"ce133236-f5d8-41bf-be1d-972fcb397e15","resolution":{"observed_at":"2026-08-11T17:31:17.698438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.674623Z","title":"2021 , volume =","venue":null,"work_id":"c08fbbab-525e-4682-a9d2-740f21c51665","year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.083925Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:395d715c67d003fc2f845fa3224f65abf57fce893275ee83faaebbc3d38ec22f","observation_id":"aa264c92-641b-460b-bfed-09de2526bb4d","resolution":{"observed_at":"2026-08-11T17:31:17.680165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.658755Z","title":"2022 , volume =","venue":null,"work_id":"21fe66b5-d23e-4f01-956b-97d3f1e25651","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.088669Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:8e2f42b21347a25d11b5a05f7f1b82e300a1f38ee77a5f89d876b1ac1ba96c4a","observation_id":"53e4556f-ab24-4dc4-861a-ddcb5221bd10","resolution":{"observed_at":"2026-08-11T17:31:17.663645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.643010Z","title":"2022 , volume =","venue":null,"work_id":"53593fc7-448c-4186-af12-525043107ed7","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.093407Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:915ace51f351c789c3454220efefd8070b466b04d1d649735c735758f095e23b","observation_id":"e314c95b-b1e3-40e8-ab84-95377e68389e","resolution":{"observed_at":"2026-08-11T17:31:17.647492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.625776Z","title":"2021 , volume =","venue":null,"work_id":"12f617e8-f43e-48a5-9aaa-eb94b815f161","year":2021},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.097963Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:07f0f7c25fa8ab47ccbbaa642b6345cd2d0fb8369e255e0d8e655aa29d862b86","observation_id":"4fa6ccac-46c1-489f-967e-fb898138dc58","resolution":{"observed_at":"2026-08-11T17:31:17.630962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.608636Z","title":"2022 , volume =","venue":null,"work_id":"3dc06807-87eb-42e2-8c31-41a8f8ce0f2c","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.102583Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:a0a52eadd05de7e4c6050529c82f48a3dbbb202bdbf2be05f4202b5ac915e697","observation_id":"2b25fa94-79b4-4089-85b6-848642f1403a","resolution":{"observed_at":"2026-08-11T17:31:17.614301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.107231Z","title":", title =","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.107231Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:312f59c8a591f7058070010d60bbc6d1f513dc0c095018ff4cdb3e9020adb65b","observation_id":"1c3709ea-1b4e-4b02-9b31-b8d3a521dac6","resolution":{"observed_at":"2026-08-11T17:31:16.107231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.580491Z","title":null,"venue":null,"work_id":"bee66ee1-eaaa-4d87-8eef-b1c05def865d","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.111552Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:ab6c18626627ebb7b471c9c9fa7a72e1b603a50e8b51d60d266169cb0a0d5e88","observation_id":"baabb004-dea4-46c7-8c91-4d27febe5c94","resolution":{"observed_at":"2026-08-11T17:31:17.585715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.116295Z","title":"Nature reviews neuroscience , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.116295Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:66fc5a40b4233041011e3eb3ba52baf043be186f79270a5de9d64e350650c8f9","observation_id":"d0af885d-6ab4-4530-b753-52a2ce741c15","resolution":{"observed_at":"2026-08-11T17:31:16.116295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.553776Z","title":"Current Biology , volume=","venue":null,"work_id":"10290efb-aa11-46f0-aa8c-c40447e95a1a","year":2002},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.121137Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:870846b55f25458752e14d2aa0cc73c446ad1892b77602d51fb15f40991318e9","observation_id":"5f5522ad-c541-4fdf-a78f-f57f054a1d70","resolution":{"observed_at":"2026-08-11T17:31:17.558808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.537878Z","title":"Current biology , volume=","venue":null,"work_id":"4dd5b6e4-da7b-43d7-9e8a-f40615dc897f","year":2004},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.125920Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:6db41f05668a3fd96b8bb8f449d9bc0fe3308a57ac6d8960d8f15dc7048cbe07","observation_id":"5fa8f8db-6e3b-4feb-8ab2-820d1ee32078","resolution":{"observed_at":"2026-08-11T17:31:17.542840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.521771Z","title":"Current Biology , volume=","venue":null,"work_id":"71b46e5b-0eb6-4433-81af-edaa95be4685","year":2012},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.131121Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:e010e5438529e9d916c269bce55a9357d5680710e4d855c1825c598b5b22e530","observation_id":"1ecfad52-f551-45ee-81c4-0c3397c548bd","resolution":{"observed_at":"2026-08-11T17:31:17.526321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.136485Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.136485Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:a1a5d66428dfa6ef85004ff03ab61617f120b0fd976285139f8e5476f72646cc","observation_id":"401fc6ee-a3d2-4695-bd44-8c719a952e6b","resolution":{"observed_at":"2026-08-11T17:31:16.136485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.141393Z","title":"Proceedings of the European conference on computer vision (ECCV) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.141393Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:930d8ac41d06dc3c03c14805106384b3c871725d85037816cde166fa2faa7523","observation_id":"fa536399-949a-4324-ba3e-e496755c37b0","resolution":{"observed_at":"2026-08-11T17:31:16.141393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.483445Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"6dba5a40-535c-4341-8160-1d37244c17c0","year":2020},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.146558Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:2a6cd1728f4af8ec55221d45e2354c9c8f7b4a487fd4b9b5bafde6c0e99e861a","observation_id":"5694338d-cd5b-4870-bc28-bf0f9193b8dd","resolution":{"observed_at":"2026-08-11T17:31:17.488137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.467394Z","title":"IEEE Transactions on Audio, Speech and Language Processing , year=","venue":null,"work_id":"ebc75b6c-3ef7-4099-8ba0-386da8f48267","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.151687Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:71fef867fc2f45798fd23c34b7885dfbf4cb691ce6b5413c04bc22b19294ff59","observation_id":"a5ef01d4-88df-4a6d-8004-4bda707ad268","resolution":{"observed_at":"2026-08-11T17:31:17.472556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.14141","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.955688Z","title":"arXiv preprint arXiv:2606.14141 , year=","venue":null,"work_id":"40973b7d-d970-4cd7-b1ed-6111c2cf9a62","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.156836Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:d5347c1d80640012964cdec50ee8bee0cf14bb8821fb16e1274cfcc54a15063a","observation_id":"da8538ca-4c86-4a08-acf4-25631d099290","resolution":{"observed_at":"2026-08-11T17:31:16.964041Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26140","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.875956Z","title":"arXiv preprint arXiv:2509.26140 , year=","venue":null,"work_id":"615ec7b1-0df3-4330-91b1-b07f026288e1","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.161674Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:43a5cf87d8e2c5ed61559c39d5e3202618b3af89e98580d50952bd88524873c4","observation_id":"760509ae-286c-4763-a90a-dc6d4d4a010b","resolution":{"observed_at":"2026-08-11T17:31:16.884501Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.449590Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"fbcc1220-8cdf-496b-b66c-1d0dc269f947","year":2024},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.166733Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:be33f50149ea1352994e665481834ef081a99b04cafad5c97b6e9f9a5fe77003","observation_id":"e00a1f8c-f964-464d-bcdd-df7e295b997d","resolution":{"observed_at":"2026-08-11T17:31:17.455182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.172126Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.172126Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:ef81eb36e5fba96cbb72f84b6d47d25497d4157779a0893db7ee16cad734506b","observation_id":"9d069cdf-dc81-4eb7-a033-e99107dfc131","resolution":{"observed_at":"2026-08-11T17:31:16.172126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.422165Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"804a794a-a914-4310-b1f6-2ea7e950b55f","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.176825Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:7906cd3c26110129dd6a6f441c4fd0036eb77213a859ac3d8c8890b8a418cbb4","observation_id":"ec917b3b-e32a-403b-8d1f-1e6ace311813","resolution":{"observed_at":"2026-08-11T17:31:17.427303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.181629Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.181629Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:85c2aac573a7eb44f9ccf209aee1f22ea0ccda34683e0a0743aeabb48a5b6e0f","observation_id":"789c37cc-b439-494f-93e0-2a155973fb7f","resolution":{"observed_at":"2026-08-11T17:31:16.181629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.186425Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.186425Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:8921b025c948f077f27cbb14ef11012073d4721221e9af719b0000d42b00b610","observation_id":"3ea4af13-03f4-4333-a39c-de8504d6a983","resolution":{"observed_at":"2026-08-11T17:31:16.186425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.384189Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"76c25810-b94d-4ebc-b7e2-175e5169e03c","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.191233Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:26537a9b60c5340d1ce4b6131120a9c706793fed3fad122480704a8422efb5d2","observation_id":"a263c929-b1fe-42a4-b24f-f8b2cd1b23b0","resolution":{"observed_at":"2026-08-11T17:31:17.389626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.196054Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.196054Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:547c2c9f974ffaf3e617792edc1b8a8e89e5b72beedf559bb2d49f3477577540","observation_id":"8c27b1c2-6684-4867-9a64-b64b0118bf6a","resolution":{"observed_at":"2026-08-11T17:31:16.196054Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.201448Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.201448Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:c916ed2fa18f9de31bbcf5181c4ecf417fd947f2bf993d0fcf7941131bfd97ab","observation_id":"eb136918-b109-49a4-a57b-a5c4d1f3a405","resolution":{"observed_at":"2026-08-11T17:31:16.201448Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.206573Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.206573Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:63734877466895ef39e486cfc6c0a543bc8997902482dcf694aa5eec8b406fa8","observation_id":"0f613bc5-5873-40d7-910e-3aeb8e7868c2","resolution":{"observed_at":"2026-08-11T17:31:16.206573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.336563Z","title":"ArXiv , year=","venue":null,"work_id":"927aa45c-1552-4a99-9402-e4a5b9230ea4","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.212314Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:aa2c85d76ef7326b7cb4d8a17d59fbc02db68f4986cf0fdf24dfb83b6b91e585","observation_id":"9b24d4f4-de91-415f-9130-7d68eeed03b9","resolution":{"observed_at":"2026-08-11T17:31:17.341575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.320585Z","title":"ArXiv , year=","venue":null,"work_id":"9953f3bc-719a-40c0-9ce5-4a5394678034","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.217183Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:84b107e77ae05ebc52b8ffd638e6a9e1ff6786650b9d368e0a301e3fe0c883a6","observation_id":"cffd81c7-e1b4-4ba9-b390-487c6b57013e","resolution":{"observed_at":"2026-08-11T17:31:17.325566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.304309Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"4f5f02d0-8e7a-4cd6-8739-9b974f4c6dca","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.222076Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:4966b698d397afc2d48ca1b93f38103efe2c35bbffbf5079a927670017f93196","observation_id":"463bb80b-cd7c-4bc4-9f91-0df69a51585a","resolution":{"observed_at":"2026-08-11T17:31:17.309294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.287618Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"eaac98d1-461b-4753-8f89-f59c1234edfd","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.227036Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:4de4bfd6845298d031785cb5de64f6f93ff947452fb0543e755e71422aa4e4d2","observation_id":"93e195d4-2c9d-42ac-b53c-72d4a407703a","resolution":{"observed_at":"2026-08-11T17:31:17.292778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.270382Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"327c7373-2926-493d-9766-901dd8f0069a","year":2022},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.231979Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:5c917b44c64b9743418a86dee8904124358438757654e688746ccdb54ec724a3","observation_id":"0d5efc58-5f2e-42eb-ab42-a1ba8a67e65d","resolution":{"observed_at":"2026-08-11T17:31:17.275683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.254000Z","title":null,"venue":null,"work_id":"c91ad22a-6a81-437b-873a-bfc6cf66e423","year":2024},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.236830Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:9e769ff1fb9c6c9e7e42e09efb9074ad9716cbd43686168c62266fff65d12c40","observation_id":"1501dedc-00bf-41b6-b42b-c90e9153d020","resolution":{"observed_at":"2026-08-11T17:31:17.259108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.241435Z","title":"arXiv preprint arXiv:2511.06606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.241435Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:e0b5e9b03459d28a80c0d583adba78108ddd91fd1f12190240290c7cdf3a9881","observation_id":"891d5b95-18a3-41d9-a149-f6b227265870","resolution":{"observed_at":"2026-08-11T17:31:16.241435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:17.238891Z","title":"IEEE Open Journal of Signal Processing , year=","venue":null,"work_id":"036d9674-86f1-459c-911a-13e59f79930c","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.246221Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:41e1dec2cb96dfa88e6d4fabc2dbcd6452634eb0bba0de671762a4415e7144b3","observation_id":"db1ed259-4629-4dba-a18f-9765b5dfeab3","resolution":{"observed_at":"2026-08-11T17:31:17.243530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"cited_work":{"arxiv_id":"2606.10738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10738","snapshot_observed_at":"2026-08-11T17:31:16.703499Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","venue":"eess.AS","work_id":"84ffe45e-8e42-4593-a506-5795ed16d2d8","year":2026},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.251711Z"},"links":{"cited_paper":"/paper/2606.10738","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:25980a3853594e243390b3f71c405523499310328e9681ac53fc10d3c29f3e51","observation_id":"3e14a13b-8343-46f3-b9a5-78d6240aa579","resolution":{"observed_at":"2026-08-11T17:31:16.710107Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14666","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.676231Z","title":"arXiv preprint arXiv:2509.14666 , year=","venue":null,"work_id":"2e8f9930-d30a-4225-bd78-4c76dd979bf0","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.256772Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:5db5807ef49f719a3121ab2a7337db2989b237e28e6af6ff75d923e5089ae27e","observation_id":"e787f4e8-d21d-44bd-b531-256bf1a06540","resolution":{"observed_at":"2026-08-11T17:31:16.684681Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.261198Z","title":"arXiv preprint arXiv:2602.16334 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.261198Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:bfece06129a30ed72604ca91c137ab91d1de56d5fd18958676ac5c907d4f6e18","observation_id":"e2007e8f-a7e2-4323-99fe-a9ad24592ef1","resolution":{"observed_at":"2026-08-11T17:31:16.261198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2606.14141","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:31:16.398323Z","title":"arXiv preprint arXiv:2606.14141 , year =","venue":null,"work_id":"9ca8b522-a42d-4b2a-82f3-214a9cd6f163","year":null},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.265521Z"},"links":{"citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:ff3230366a53b7a995b88fa88af7eb6444215cbdd9cbdca924be2e5f2af93210","observation_id":"8086fb12-512e-4aba-81be-63248a32391e","resolution":{"observed_at":"2026-08-11T17:31:16.404582Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T09:19:07.506078Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":2,"unresolved":49,"verified_exact":5,"verified_fuzzy":43},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 0 inbound Pith citation observations for arXiv:2608.09435."}