{"as_of":"2026-08-07T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:945da44f32e5fe53a0641902785f9d66c731ea3c3bfe52f6026b7da287525b3e","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T03:04:56.762735Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.10815/citation-record","integrity":"/paper/2605.10815/integrity","json":"/paper/2605.10815/citation-record.json","paper":"/paper/2605.10815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some modalities are more equal than others: Decoding and architecting multi- modal integration in mllms.arXiv preprint arXiv:2511.22826","venue":null,"work_id":"c8487051-2f83-4108-8d0f-cdce50809608","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:a27f7d3f7e9ddd905af8465e3c4eab91433534dbfee672173133de46bf8ba5fe","observation_id":"8c43446c-8217-4f62-9c1a-c5e70c1583dd","resolution":{"observed_at":"2026-05-13T03:07:08.707153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:74afe250907cbd65c873bc3114dfb4551de0a0ff39464115a06dca28d98b622b","observation_id":"b76aaba4-84db-42bb-824c-ca06d81be28b","resolution":{"observed_at":"2026-05-13T03:07:08.704483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06803","last_updated":"2025-05-11T01:01:44Z","snapshot_observed_at":"2026-07-06T21:22:02.557286Z","submitted_at":"2025-05-11T01:01:44Z","title":"Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation","version":1},"cited_work":{"arxiv_id":"2505.06803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.06803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridg- ing ears and eyes: Analyzing audio and visual large lan- guage models to humans in visible sound recognition and reducing their sensory gap via cross-modal distillation","venue":null,"work_id":"ce3509ee-d7e4-472f-9a03-73a8267aa25c","year":null},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2505.06803","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:690e4d212eb671d495d684c8b8f96fd13e9762d3c1fd622ba4e453c109a26ff0","observation_id":"94f2382e-1661-4d72-a753-a3c1da1aa451","resolution":{"observed_at":"2026-05-13T03:07:08.686182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fork-merge decoding: Enhancing multimodal understanding in audio-visual large language models","venue":null,"work_id":"e7c05b3b-770c-4e5a-b769-1955cdfe8b93","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:4a0d30d5ff58d00397586e9fde8a8f632b65e714110198a9ddb0264aca9e7f56","observation_id":"bb5e01b9-98bb-4aa9-9a7e-d71a8b752076","resolution":{"observed_at":"2026-05-13T03:07:08.695271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:502612d516f28771da9eed53a0972463aff0c13c78cccfb70047e7ffc8d25a9f","observation_id":"26ee8227-5eea-45f8-9223-3cd80b427a22","resolution":{"observed_at":"2026-05-13T03:07:08.701574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-07T01:32:56.463682Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":"2401.09774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the au- dio hallucinations in large audio-video language models","venue":null,"work_id":"1b94781e-fc4c-4648-a278-b08df6a50bee","year":2024},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:bd5eb2c5c513a6cea940feb4fc58119a4cd172007f71665bcdede09c285ca3d4","observation_id":"d5d3ea50-aaf8-4e5b-91ae-a3545a8b3d34","resolution":{"observed_at":"2026-05-13T03:07:08.692174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.281790Z","title":"video-SALMONN 2: Caption-enhanced audio-visual large language models","venue":null,"work_id":"a6dea8e4-6736-44e5-b9d0-6e036ce7a7c0","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:1fa3d2fcff865b1600b5fd45e3fc69b362133a3c0c50f54c5f51c09d355b6cae","observation_id":"c7bcbc8a-7830-4d1f-81f0-311bc2a3803e","resolution":{"observed_at":"2026-05-13T03:07:08.689231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:f579565be79c64e9cd3936057f142b4c57f27d5cacad553977608175b6dbb6cb","observation_id":"65dc4318-994a-43c6-bbf6-46277cfa1d9a","resolution":{"observed_at":"2026-05-13T03:07:08.709905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12265","last_updated":"2020-11-22T07:58:08Z","snapshot_observed_at":"2026-08-03T16:50:20.150329Z","submitted_at":"2020-04-26T01:53:03Z","title":"Causal Mediation Analysis for Interpreting Neural NLP: The Case of Gender Bias","version":2},"cited_work":{"arxiv_id":"2004.12265","doi":"10.48550/arxiv.2004.12265","metadata_source":"pith","pith_arxiv_id":"2004.12265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Causal Mediation Analysis for Interpreting Neural NLP: The Case of Gender Bias","venue":"cs.CL","work_id":"1141a30e-ae0b-4431-939c-70078f8130c4","year":2020},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2004.12265","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:a71582a9aaf5582b7d7aca237d292e46b437ff1220078a02437e8e5bd6676f68","observation_id":"ea141ae5-e609-48b4-a234-162fe52b04bb","resolution":{"observed_at":"2026-05-13T03:07:08.682622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:32.527259+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:32.527259+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:8cfe8419e896f66ce618b33e008cd5abed32805154e236590322bc71d6ef2f16","observation_id":"4d1b3571-0695-433d-b690-0d883765f688","resolution":{"observed_at":"2026-05-13T03:07:08.698135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The structure is organized as follows: A","venue":null,"work_id":"58c7ac4f-3a0d-4b4e-a4c3-86dcd1ea9978","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:204493e0bcd00d74e0f40d7fee2eebaa34899d10b959922158e1c9090105b69a","observation_id":"da79c865-359a-4ff5-9541-9a7530e157e5","resolution":{"observed_at":"2026-05-13T12:32:45.737554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specifically, visual sink tokens in VLMs exhibit massive activation along the same dimensions as the BOS token in the base LLM","venue":null,"work_id":"ed227942-87d4-41f8-8639-5cff1e3abac3","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:bd9c21e27dfe4ca3be3dc66558ca8b33635da16ec06238298065b24388276aa1","observation_id":"ae2f560c-04d6-4a1d-abc5-71ebd7422e4b","resolution":{"observed_at":"2026-05-13T12:32:45.739514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"While the original VCD applies noise solely to the image modality, we extend this approach to the audio-visual domain","venue":null,"work_id":"01bb4911-7c06-4907-a30b-167a6b10b191","year":2022},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:f3a8f15baa40f8d011ff2d66c47bc952e899e3e4c766497f8880a87dceeb15a0","observation_id":"860189c5-28c2-4f94-975f-f46bec40e12d","resolution":{"observed_at":"2026-05-13T12:32:45.741872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a274c2b0-8879-4a81-adc4-b51a64710687","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:185685f1e0470f547d34175fdf42209fea41d409c90d49b5c4d306c357f4a185","observation_id":"f2a7b017-2a83-4388-8cf8-5716597debcf","resolution":{"observed_at":"2026-05-13T12:32:45.743525Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67557a88-1c77-42d7-ba18-0cd809f5e3d7","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:bec5a6ba14c917676d3c9ecf32e757894cb4ccae8fc8b3b68d9fdf55b6b2affc","observation_id":"61663980-3933-4c73-8b59-681b57d5a65a","resolution":{"observed_at":"2026-05-13T12:32:45.746978Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As shown in Tab","venue":null,"work_id":"bad5dbda-61d6-4c44-8231-23f776ecb502","year":2025},"citing_paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T03:04:56.762735Z"},"links":{"citing_paper":"/paper/2605.10815"},"observation_digest":"sha256:f2ba7dbaa0ed284309acfda6df010ec1dbb7afc123aededc79b3afcdb189d922","observation_id":"8004c53a-042b-4592-8c59-4bf149a724f9","resolution":{"observed_at":"2026-05-13T12:32:45.745197Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10815","last_updated":"2026-05-12T02:51:58Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T14:20:10.009198Z","submitted_at":"2026-05-11T16:34:18Z","title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":3},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2605.10815."}