{"as_of":"2026-08-13T06:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38c54010c7dc7c0f8b83e17036c4a5ed727609cac9d900e32cd65edad40d1c5e","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:52:47.948163Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:31:16.251711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T17:31:16.703499Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"cited_work":{"arxiv_id":"2606.10738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10738","snapshot_observed_at":"2026-08-11T17:31:16.703499Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","venue":"eess.AS","work_id":"84ffe45e-8e42-4593-a506-5795ed16d2d8","year":2026},"citing_paper":{"arxiv_id":"2608.09435","last_updated":"2026-08-10T11:06:28Z","snapshot_observed_at":"2026-08-13T06:18:21.319767Z","submitted_at":"2026-08-10T11:06:28Z","title":"Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:16.251711Z"},"links":{"cited_paper":"/paper/2606.10738","citing_paper":"/paper/2608.09435"},"observation_digest":"sha256:86bb98228eb2f12e81f4b0c6972cbf0fc1c0f9cfe35516c1566614bc7d3864ec","observation_id":"3e14a13b-8343-46f3-b9a5-78d6240aa579","resolution":{"observed_at":"2026-08-11T17:31:16.710107Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10738/citation-record","integrity":"/paper/2606.10738/integrity","json":"/paper/2606.10738/citation-record.json","paper":"/paper/2606.10738"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-13T05:33:22.244747Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:f8d0bebd99945fff2f19719d3d2c9eb764d5a0b8d1922a84471a750b58b14b65","observation_id":"8c08df5f-416f-4df4-a881-3902981daf36","resolution":{"observed_at":"2026-07-03T07:47:44.505851Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:3adf788c2cf0aacb4312f2b2949feb4769f61455c6ce39bfc37318403b1a545b","observation_id":"38c1f98c-db25-4100-97e8-37d637422426","resolution":{"observed_at":"2026-07-03T07:47:44.503408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08907","last_updated":"2025-04-25T15:21:54Z","snapshot_observed_at":"2026-08-07T16:06:25.573244Z","submitted_at":"2025-04-11T18:19:59Z","title":"Spatial Audio Processing with Large Language Model on Wearable Devices","version":2},"cited_work":{"arxiv_id":"2504.08907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08907","snapshot_observed_at":"2026-07-03T07:47:44.498101Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–2","venue":null,"work_id":"a87ff487-77df-436b-9ba5-021f801f5bd5","year":2023},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/2504.08907","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:0e02e23d19722e65862108f4e7f3701e4ceab16fc967f806780d3d74f7dc5a57","observation_id":"48a6f8ea-6ce0-42a4-88e6-7002b690d392","resolution":{"observed_at":"2026-07-03T07:47:44.499603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:47:44.500718Z","title":"Spur: A plug-and-play framework for integrating spatial audio understanding and reasoning into large audio-language models","venue":null,"work_id":"def0b7ba-4bad-41dd-8ef4-8b0f0015ff25","year":2025},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:273fc009e9e56e7dfe9a3fba70d46188cf5d43da0019587d6a3096f6ad7db8b7","observation_id":"bf504ef5-4508-4e07-80af-1a5cf747cc8e","resolution":{"observed_at":"2026-07-03T07:47:44.502226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.16334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:47:44.498823Z","title":"Julian Straub, Thomas Whelan, Lingni Ma, Yufan Chen, Erik Wijmans, Simon Green, Jakob J Engel, Raul Mur-Artal, Carl Ren, Shobhit Verma, and 1 others","venue":null,"work_id":"da825aa5-eb8b-4df1-aa00-c51d3e951796","year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:010b2e0348cb5c48243e9e81e033acd3965cf4dc85323c4ce2bfd43def7ade4d","observation_id":"a2737980-9121-427f-bf01-dbf8af43d4ea","resolution":{"observed_at":"2026-07-03T07:47:44.500627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":"1906.05797","doi":"10.48550/arxiv.1906.05797","metadata_source":"pith","pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","venue":"cs.CV","work_id":"8145b3bf-a202-46d8-a3bc-fad366dd5d4a","year":2019},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:c9e9c80d4f5b0fece3cd3a58163f653e6015adab45a25e2f2794e747371db1a4","observation_id":"2b8069bd-6533-41d6-8946-aa21d8e752d6","resolution":{"observed_at":"2026-07-03T07:47:44.493224Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:43.390569+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:43.390569+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:47:44.506975Z","title":"Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Jun Zhang, Lu Lu, Zejun Ma, Yuxuan Wang, and 1 others","venue":null,"work_id":"da1c3e49-35dd-4340-a822-11c2bdf07cfe","year":2026},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:05b508bd700641b3a1b4e141375ebb1c97613a7dcc847274bfce3ab28655b4c2","observation_id":"3b425768-4f5b-4a70-8f2d-f8f73cdbf2be","resolution":{"observed_at":"2026-07-03T07:47:44.508666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02954","last_updated":"2026-05-10T15:03:28Z","snapshot_observed_at":"2026-08-11T15:36:41.247431Z","submitted_at":"2026-01-06T11:54:47Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","version":3},"cited_work":{"arxiv_id":"2601.02954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.02954","snapshot_observed_at":"2026-07-03T07:47:44.503602Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","venue":"cs.SD","work_id":"21ce33c1-a81d-48f7-b706-b895c7df924f","year":2026},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/2601.02954","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:785ca40cebb0d10bff811344d7f72059f14e8459bd7d02f49ca0fb5a279df508","observation_id":"6c9d90ec-c4a9-466b-8ad0-0e306304d7bc","resolution":{"observed_at":"2026-07-03T07:47:44.504881Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:d4a8b26992cff2a094c393bda4abf5fbe0be5234aa90dcc3f81ccf6713d2749e","observation_id":"5302527d-47af-44f0-8087-c08f727edf70","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:668c730a306615844892b2593fe9b43c2ac3ba063dddc4360c49ad0f2b7e79fb","observation_id":"2cc6b6ec-0990-4ee9-b0ba-210eb2eb2712","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:9f4295721b7a0c21f01c7f19e7fd39073f28af85bcb746ecf86208fb0960ea51","observation_id":"0452f6b3-2b98-4fbf-acc1-160c8da46fb6","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:b747524f5aa6d5e88ec9f32d1001864e0209f54f7dae8497d1e0ea225046cc14","observation_id":"6f77d462-bc6d-4c4e-bc2e-27100fe4a8b1","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":"Metadata: {metadata} Please generate {num_questions} question-answer pairs in JSON format","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:d053939a4da78205ae97ee7d927ef17326783d345c08d7b2bdfd8cc5cb2b0b4f","observation_id":"56f2edee-4117-446a-a3f7-b3157e442cd4","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:2055ae5a5d2de496a83ab45abf48fb29280f642e5498b4d9cbb88eb3d380cd92","observation_id":"23f3d262-1477-4a9d-93cb-7e619676dd7d","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:5845a33a5ff6ad8b880376bc76c674e6992421b24843bf721d47800975416cb1","observation_id":"f0c836da-0fb2-41ad-b7b2-c3d3a2513ade","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:306cd74d7d45761d7018d3055af4622ebdc17ad9a7faf6bcbfa1323b0d385dde","observation_id":"6cc5afb4-e041-47dc-bee6-da158806f95d","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:8874b02bfffdb9d8b376d37cae4761b769145e745cb6fc73cce8bb9997711ac7","observation_id":"924013a0-7ae5-4649-85dd-d8f92679b864","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:52:47.948163Z","title":"Original question: {question} Answer: {answer} Return only the rewritten question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:04780e2cf73943694ac40a7d73b5f125cd96a34bbd05a16a479b4b8ca141aea2","observation_id":"727ad75b-33ba-46ac-815f-08f8e273a0f1","resolution":{"observed_at":"2026-06-27T11:52:47.948163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T21:43:59.168342Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":1,"unresolved":9,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2606.10738."}