{"as_of":"2026-08-06T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a7998aaa96e0631eeb615dd0cfcfaf96e172155d04265bc6126e438f4fc008a","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:33:07.477217Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09906/citation-record","integrity":"/paper/2605.09906/integrity","json":"/paper/2605.09906/citation-record.json","paper":"/paper/2605.09906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.tics.2004.02.002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2004 , issn =","venue":"Trends in Cognitive Sciences","work_id":"4893ddde-cf11-4aa8-a037-aac180a9510e","year":2004},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e791c9f9974aff80054515e6bdf2b716e021c66ea482e7626a0e680cf5a5082a","observation_id":"45764ddc-6dea-4eee-bb4c-79fe2afd35b9","resolution":{"observed_at":"2026-05-12T04:36:21.179467Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature Reviews Neuroscience , volume =","venue":null,"work_id":"151f2a2e-6442-4839-95b9-211656e9a44b","year":2008},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:9ddc22b201b1aee35d457ac057620a37756f1a4c377ea3624bd0444cb36f6ae7","observation_id":"0ba1a00a-68cd-40f9-82c2-15c8d53a8c9e","resolution":{"observed_at":"2026-05-12T14:31:39.478724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint=","venue":null,"work_id":"5dde1e7a-cab1-4d26-9463-7f388ef46dcc","year":2018},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:175a23a574a4b8a23da7255baf5108501ea1f3e0a76a43939f4c904baffacf5f","observation_id":"c1473872-cc1d-4610-97d8-4d9d3ca42ba5","resolution":{"observed_at":"2026-05-12T14:31:39.481954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.283","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying uncertainty in answers from any language model and enhancing their trustworthiness","venue":null,"work_id":"c2e415b8-a214-4da8-80c3-8f75c8d52736","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:085399a8b4b35df5e57d37ad2ae5363ecbe9ff87d820179c3a6749cfe3024756","observation_id":"637d90e4-6cb4-4887-9601-278f979901ed","resolution":{"observed_at":"2026-05-12T04:36:21.184027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 30th ACM International Conference on Multimedia , pages=","venue":null,"work_id":"5c295a37-e89d-4275-ad5c-d4c11bae3521","year":null},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:c8463ecbf6afd5a4ecda1e363aab8c1a7ece31935b0ed96515df7d9e46cb9d44","observation_id":"81efc321-d08d-431f-bc5d-80f6592c24ba","resolution":{"observed_at":"2026-05-12T14:31:39.485288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"5b8b56e6-e0ed-4ba6-8099-c66e7cbae603","year":2022},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:b9193a30baac3fc0e281ac1c3363b44255f0cb06eaff0132b72e7c8069cc1aeb","observation_id":"6fce5ff5-d4c7-4443-84e5-2b4bc0565708","resolution":{"observed_at":"2026-05-12T14:31:39.488860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.375826","doi":"10.1145/3746027.3758261","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , isbn =","venue":null,"work_id":"7f6a4da1-78e0-4558-b87e-738865460f85","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:bfb8ce5657d625927790c27234598dcb8afcbd3544a357eb5701d30e97ad8ba1","observation_id":"784d1f96-9c53-4826-8948-8ec487851706","resolution":{"observed_at":"2026-05-12T04:36:21.168220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i10.33138","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , isbn =","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"38f5bb13-272c-4085-af6c-f6320dcc7bf0","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e78b33c23a6cdb78f38002cbc1e580d7c18dd53e95c5fb2e0e0c7abca85d1c9f","observation_id":"9b5472ae-fd87-4225-b4c7-ee9bc99016c5","resolution":{"observed_at":"2026-05-12T04:36:21.172871Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"eff88690-88bd-44b6-b778-2fffbf612ca7","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:9135c156c94df74a9c0e5b61125b55a8f7f59da7504948861a099c3c1bedfde1","observation_id":"2f40871c-00e0-4560-9acf-372e1e7a5bbc","resolution":{"observed_at":"2026-05-12T14:31:39.562941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"9f2a618d-474c-46ad-b93b-6bf0c88c5f66","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:cb9a5d7e1fbff6a454eaa6c160dc6b288683b327cd331fbfa6c18daf807017d3","observation_id":"cce4da37-e48a-4fd7-971b-bf9192d7c46e","resolution":{"observed_at":"2026-05-12T14:31:39.548734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"24e53e9b-f784-4300-9204-fec4653cb8f6","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2dc26ccb6bb9aa61008292d7a0db90a784582a04c3c85302c608c18b6e371a53","observation_id":"563e8657-1180-4c9a-9143-e68c76b584cf","resolution":{"observed_at":"2026-05-12T14:31:39.559356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"c9bfbfc2-096b-46b7-aba9-a8d7d1d83ae8","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:8757e40b7b65d2f07372f2d7956ea2cc4f1f32a40d42094a669156e70bbb3a37","observation_id":"9b2fcdb5-0b37-44a8-b3cc-e25c59b5eb92","resolution":{"observed_at":"2026-05-12T14:31:39.508380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b6a2e6c2-ae9f-43f9-9cf6-24091dbf9537","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:779b8afd5c104ebb82f364c608a46aaf9ccb03a08930872b3d0cf90dcc8d9e31","observation_id":"8e286190-b0a1-4057-95f3-42b9b130d89c","resolution":{"observed_at":"2026-05-12T14:31:39.538141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":"bd0efba8-d837-4b1e-9f84-92496135241b","year":null},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2b8ed17b9493df31a57f4c2b24bd4cb5ab4861e650374e6a8cf73be3fa35c262","observation_id":"4833746b-58bc-40ae-947a-29e90032d0d3","resolution":{"observed_at":"2026-05-12T14:31:39.523968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"cdff9525-3339-4a56-8ac3-d565d30361f1","year":2020},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:568c6d11e99712112d2c5216fbf124be97776adbb05fc275f8fa0efcc64e9565","observation_id":"ffbb2a56-69b6-4fc7-a84e-6d0f7294b082","resolution":{"observed_at":"2026-05-12T14:31:39.545425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"fdc83ac7-c4b3-495e-b778-7841fb83d9dd","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:f4892ff88e2cc27f843984ee25fad11397e8ffe47394469d3996ec7de429ceaf","observation_id":"10a27652-d95f-4a40-a902-fd5b91862d7e","resolution":{"observed_at":"2026-05-12T14:31:39.495443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d3b8d94e-65f4-4398-aa71-f553350bb4da","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:173a3e5acb811f8c76b1650c222b93f5ac87eadbbf4f8c67dbc9b890d5371c79","observation_id":"c941e73d-9f9d-4f02-90f1-435e5887170e","resolution":{"observed_at":"2026-05-12T14:31:39.492273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nsr/nwae403","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T10:14:35.157974Z","title":"National Science Review11(12) (2024).https://doi.org/ 10.1093/nsr/nwae403,http://dx.doi.org/10.1093/nsr/nwae403","venue":"National Science Review","work_id":"c6ccaa7d-dc85-41a1-bdd8-10c1945d52cb","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2e34101cea38165af3cb3d3ee84480c2fe4f44440feeccb686075ddf57671cc7","observation_id":"04336c9f-6a13-483b-8152-3d6dd7ef0cfc","resolution":{"observed_at":"2026-05-12T04:36:21.141803Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:53.063431+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:53.063431+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"209f15e0-a8b7-4060-8a92-32074f0abda4","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:79d915935cd4bb3683facd32f1f0e275b73e662896cf2309953106ee580e6676","observation_id":"95ce46cd-8598-4e98-84d9-3c8fe0b0e033","resolution":{"observed_at":"2026-05-12T14:31:39.501728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"932c693e-9399-45a9-99a3-a753dc4e97b1","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:17b55344b845a3d09712a963bcf01c723521670a3d78c80c7c7cefec216ea8cb","observation_id":"7c1f4987-f77a-4b08-874c-2c967ab347c8","resolution":{"observed_at":"2026-05-12T14:31:39.527304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"2a21c15d-dd8d-4c8e-92ec-7822a4e75bf5","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e9b98663053bd53c51d1a70f01b754f5e050fce4d330c298b2a63e2b95216ddf","observation_id":"535c203b-40b6-4b16-88fe-2caaafcebe06","resolution":{"observed_at":"2026-05-12T14:31:39.530578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"2b95bc96-e1a9-4491-8d94-72a6e232464e","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e895dfb9401f4626e4fe708eea319b60312a72d658ea8bf36273db7d88bf1c50","observation_id":"89c4f683-7652-4e9a-8d86-6fa52c307737","resolution":{"observed_at":"2026-05-12T14:31:39.552259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:87cf0ea73ac91780a24c638ffd1fea4248418433f824170172459a07c1cd9ee3","observation_id":"05b6f224-a575-464e-86de-ac1697d48362","resolution":{"observed_at":"2026-05-12T04:36:21.137050Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"fb7a0ec9-252d-463f-a503-417a63f226fe","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:c133495caf398d19cdcc20884379627599e6967b6b6d523fd539482df6fc06a2","observation_id":"6f68a65a-daa6-4338-bfa5-7e2272e4520b","resolution":{"observed_at":"2026-05-12T14:31:39.505077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"a3d815bc-fe10-4af7-9f8d-54f1a080f667","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2c58924adfffd5acf6ca7313b9a2eb4d5d09792a8c6bf10959e2c878c3c640b2","observation_id":"942b2bbd-fe5f-487a-9dfb-7bd0c487b2ae","resolution":{"observed_at":"2026-05-12T14:31:39.514731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d2e3d037-719d-4e6a-b462-5cce4550357e","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:01ff5943d1fd5133390322b9e5590af4d2e6641884e0f695ccc064af8be08840","observation_id":"cb1cce58-5526-40ba-8235-24234745a489","resolution":{"observed_at":"2026-05-12T14:31:39.511484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"74e3e071-6876-4d5a-a8fd-93bcf0d24923","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e5a2f50c501924feb8bdc59a1b896ae9b239d3e0e623748ddf2674e9f910a910","observation_id":"e0687a99-8e46-4064-b446-db7046b61490","resolution":{"observed_at":"2026-05-12T14:31:39.567392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"e526fda0-3695-426b-8ecb-b916a4c029af","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:c001074f66cb1d7ebb68446a950a65dd2f347c243b49b2593c6c27a38d8db198","observation_id":"a3036e61-6463-461f-8834-8d9e36ea5f3e","resolution":{"observed_at":"2026-05-12T14:31:39.498839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"0210a214-b6e7-4f3e-a74d-b28e467e8feb","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:72b1b7125ce9ec5de351b0e817d7e79eaee6275fd0ff0071fe3f8d075293e6cb","observation_id":"e7cd9466-f6f1-416d-8bff-e7b30c04b9ea","resolution":{"observed_at":"2026-05-12T14:31:39.555757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"78f40846-9095-4211-af17-7e29ea52052f","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:7a8ca0051228adc041e087c12a8fbf7016faf5f256e3163c6abf05bba1f7dbe5","observation_id":"50742264-1049-4bee-baf7-72571cc144ff","resolution":{"observed_at":"2026-05-12T14:31:39.518160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:46:35.433494Z","title":"2025 , eprint=","venue":null,"work_id":"e6435118-6ff0-4575-93e2-7748e205a26c","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:8fa14ae220783dd08a6c98eee7476e02e4672303ab4a1b3934427ccf39a9d4e9","observation_id":"0b1dccc7-0075-4aab-a7f6-69cfd88af1b1","resolution":{"observed_at":"2026-05-12T14:31:39.521061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"aedfde7f-c30d-455c-969e-e222d1498bc5","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:103d426c07f94310562810a71f3b11034e8931a396b1717a2a610eda9b326158","observation_id":"b4bcb8fd-eb69-4731-892d-9a706369e735","resolution":{"observed_at":"2026-05-12T14:36:37.890631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-short.86","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Correlations and Beyond: Understanding and Mitigating Shortcut Learning in SDOH Extraction with Large Language Models","venue":null,"work_id":"7a9046fa-a0bd-48c1-ba8b-4b8e9f09a4af","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2fe1d1e63b4158254aa9649624bd5638793c052ce6f52f1e0aab3ab5076429a9","observation_id":"1d3b8829-05dd-4bc3-9a3b-51e3be4003e6","resolution":{"observed_at":"2026-05-12T04:36:21.145754Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f54e5205-0c6c-41cf-812d-6f3557a227b6","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:5724ac55722149270ab646a466c4c44fd01a61053aeb8c282cc89a49cc16b71d","observation_id":"a47b40e1-4c02-49a6-9872-ba4c2399f30e","resolution":{"observed_at":"2026-05-12T14:31:39.593131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"68de1e82-a68f-476d-b36c-e6250559a2c6","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e0aee8422c97b24728f024b6808d9f356dbadf0d718aa5363ec9833772b0d574","observation_id":"804fab10-fdfc-4cc8-8b9c-22dff6067d60","resolution":{"observed_at":"2026-05-12T14:31:39.588621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:13:13.427644Z","title":"2025 , eprint=","venue":null,"work_id":"d195075f-38e9-459c-a5c7-eb63d0057209","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e9b31d9f059c1d7d200da5d035010d9fe29db44302be58ff7aba4f486e486af7","observation_id":"f0b1ea68-cb16-4503-bd36-01a2903d33b0","resolution":{"observed_at":"2026-05-12T14:31:39.534652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"af0815fa-5125-4553-8dcf-8721789c8ecf","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:cb5aae5c06624bba1e490b5096c3c7d91cf4d2a6e478310b25cf9b2943c77eaf","observation_id":"2f420385-78fd-4acb-88dc-93418a9f5cd8","resolution":{"observed_at":"2026-05-12T14:31:39.542067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:9c3d702b0cd44759eecda62eb3d1f740f15f197ada07ddbb599b578c92999a02","observation_id":"9177615a-d806-4d8e-a6ac-fbe1f4500c81","resolution":{"observed_at":"2026-05-12T06:11:22.896828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"4d2211b3-2a17-460f-b94f-875b83bb972b","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:fcd0ec16197c4751ef0b7878a9ce04401c05cc43c49a282b39fa1d9a41fce30a","observation_id":"e7e3579f-1e70-407b-be99-2ea12c9a229a","resolution":{"observed_at":"2026-05-12T14:31:39.584931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"afc3e4b6-c706-402a-809c-609194cd759d","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:58389876dfb838a0a76abd03cedda1c45616dc11187cdcd486dc4c49653c4eeb","observation_id":"2822b90d-8486-4abf-8833-edf950f8e5ba","resolution":{"observed_at":"2026-05-12T14:31:39.581582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:07:07.043919Z","title":"2024 , eprint=","venue":null,"work_id":"6ab6df8a-78af-4544-b925-880827175ee6","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:5dcd5483840a6a169b7005f1e1f4f3a0ab91a5bda5b80aef2b455a752238318d","observation_id":"c9cd4231-90d9-4315-a4b3-142477646a18","resolution":{"observed_at":"2026-05-12T14:36:37.898575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.488352Z","title":"2025 , eprint=","venue":null,"work_id":"8fb5d482-cf5e-4141-b15a-3f607aa09f83","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:5ab1e92f3be119ae08fe3d95be173c05f0b46b7627b6afedd2ec7f11e099dfa4","observation_id":"11e68aba-61ac-4cfd-a653-fa6ba4269b21","resolution":{"observed_at":"2026-05-12T14:31:39.574484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:41:47.882398Z","title":"2025 , eprint=","venue":null,"work_id":"d6e38a0f-1e6e-46d7-8904-c1f5cc263195","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:f685204393dfc30fbc07a7ab2a22982c7badea5c36179caed3d0081eddb51455","observation_id":"edae379c-0136-4572-9937-f373bbe0f882","resolution":{"observed_at":"2026-05-12T14:31:39.578188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint=","venue":null,"work_id":"7af800e7-cc8c-4611-b3b3-237f9d7a689a","year":2017},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:7005e20541f4e5170e15ccca4240531b7af7f5f81a1f96b828c9757621beccde","observation_id":"c24e24b2-531e-498f-b247-6691d5386904","resolution":{"observed_at":"2026-05-12T14:31:39.571006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":5,"verified_fuzzy":35},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.09906."}