{"as_of":"2026-08-14T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac1c57074e1372c791b88167c1b10bca80a3a102f4d0101ada2008864e7c78f7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T19:31:48.172439Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06014/citation-record","integrity":"/paper/2607.06014/integrity","json":"/paper/2607.06014/citation-record.json","paper":"/paper/2607.06014"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.468900Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"7c16892d-dc0d-4a73-ad75-bf01f6cfa829","year":2023},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:d746821f01f53a42e6dc42b84d97d0aeece79cfe3d13c46f64ead23cadbde595","observation_id":"9c3e92d3-0a93-4943-81a0-2b96dddd8342","resolution":{"observed_at":"2026-07-08T19:35:33.470191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:9490bdd7f356050974c98d41e17dc8a17b2da03aabb44ae9cb6ffe0d310d0f49","observation_id":"48edd649-1e1e-476c-9210-c650a8476086","resolution":{"observed_at":"2026-07-08T19:35:32.857816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:a39495fe82ea4951ff035b3b45d3b4dba5838a40e2a253be97eb912773ec223b","observation_id":"715d16a8-ec10-409c-be6f-71e8d0b33848","resolution":{"observed_at":"2026-07-08T19:35:32.860447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.466910Z","title":"BLIP-2: Bootstrapping Language-Image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"d6d0518d-3ea2-4aaa-b688-8e8a62af7a20","year":2023},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:65a2d62bfdb961929b3b91ae76cc3ac5cbf1a3ec539e42b76820b1acd5a95266","observation_id":"33bbf68e-9afe-49f3-bac1-71b9ab762c34","resolution":{"observed_at":"2026-07-08T19:35:33.468292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.463465Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"35c19089-480b-4505-81d3-97cb89b27876","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:7a169c92863a7cebd9e423190cd963ef7b5cb84aacabd296dd3bac4063e0ea38","observation_id":"554eb018-c035-42f6-a3e7-204a1073be11","resolution":{"observed_at":"2026-07-08T19:35:33.464615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.465138Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":"c6eb9b0a-bac5-44ff-ad22-799f7fa467ba","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:f4d18987cb03a1e2b6329e2964960fa7dec588ae09a9192863cccdc8c986e1f8","observation_id":"f377f8b8-9683-48ab-8aa6-ffffb240dc22","resolution":{"observed_at":"2026-07-08T19:35:33.466416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.02768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.882924Z","title":"Desta2. 5-audio: Toward general-purpose large audio language model with self-generated cross-modal alignment","venue":null,"work_id":"610f2c2b-d9a0-4b63-8595-d0902c725b31","year":2026},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:eda0cdf7d09f34f7f3f555580c96c80be3953057a051f11577525f92f4e30040","observation_id":"9621c784-132f-41ec-86d7-6e2c085284c9","resolution":{"observed_at":"2026-07-08T19:35:32.884594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.470774Z","title":"Naturelm-audio: an audio-language foundation model for bioacoustics,","venue":null,"work_id":"cdc72f6d-1f3a-4d8a-8666-32c341c5fb42","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:82f1ba7e2e4d00f1d168037480c8b11ed08a87ea126b02a48f2c25edfce652f0","observation_id":"b14aa2d0-739c-4f54-8a44-816d6cdd3164","resolution":{"observed_at":"2026-07-08T19:35:33.471997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.472578Z","title":"U-SAM: An Audio Language Model for Unified Speech, Audio, and Music Understanding,","venue":null,"work_id":"ddadad93-79c2-4297-9ad8-279957e22c43","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:e9efdba5423f92f9224414207929bd0ddcda628c2fa4d8ab407f078516ceb773","observation_id":"5949cc26-c4f7-4743-95f0-a1f816cd8c72","resolution":{"observed_at":"2026-07-08T19:35:33.473834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13237","last_updated":"2025-08-24T16:09:17Z","snapshot_observed_at":"2026-08-10T21:46:33.866444Z","submitted_at":"2025-05-19T15:20:32Z","title":"SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information","version":3},"cited_work":{"arxiv_id":"2505.13237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13237","snapshot_observed_at":"2026-07-08T19:35:32.876839Z","title":"Sakura: On the multi-hop reasoning of large audio-language models based on speech and audio information","venue":"eess.AS","work_id":"548012c6-79f3-4338-9c8f-5e7df1026e7d","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2505.13237","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:72eecc704816baa89622d6e67c5d44665ca5c10faab959a6125b969018071f26","observation_id":"865f8dc1-fbc9-4c8b-8930-afa1b769520c","resolution":{"observed_at":"2026-07-08T19:35:32.879177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.760","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking contextual and paralinguistic reasoning in Speech-LLMs: A case study with in-the-wild data,","venue":null,"work_id":"2083bf56-23cf-4ee4-92ee-d6606ed06555","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:19205c60110abe4cd688169783971b9189f1ace488d769fbac569cf59911fe33","observation_id":"b4e77016-f666-4dd4-954f-afc310e54f0c","resolution":{"observed_at":"2026-07-08T19:35:32.560325Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:30.510806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:30.510806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.481102Z","title":"SD-eval: A benchmark dataset for spoken dialogue understanding beyond words,","venue":null,"work_id":"79ffa04f-1ef2-4479-8a0e-4869447b3582","year":null},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:790e07511e61d0155753c1f3cfe5295f03b402210131c324d00e1b190f598593","observation_id":"93ac2f19-8256-4256-886b-2cc14aef5128","resolution":{"observed_at":"2026-07-08T19:35:33.482277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.486254Z","title":"Available: https://openreview.net/forum?id=PnjbvbblGv","venue":null,"work_id":"c8a06638-a526-42da-a7a6-57b8ccfabe4d","year":null},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:34af11e6568555df082b01c8ce73069d01ca8b7eae669f60667e42eddc77c10a","observation_id":"3fd5c16c-e6d9-46c3-81cb-1a10b1f84392","resolution":{"observed_at":"2026-07-08T19:35:33.487390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-14T00:08:21.077963Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:bb4bf1f007a73d766538e6dd183d87622ba214f8b13d3caa860813506da2cc23","observation_id":"3b92229a-66d0-47e0-bf20-338e1d6bb808","resolution":{"observed_at":"2026-07-08T19:35:32.867407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.457799Z","title":"Do audio LLMs really LISTEN, or just transcribe? measuring lexical vs. acoustic emotion cues reliance,","venue":null,"work_id":"fee35671-9141-4d43-800d-f09bb993f6ff","year":2026},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:355c1241f4956a92b22b8a8c9ad6ed74b71bde1721899725c659880ad526cee0","observation_id":"35d5963c-d0d9-4013-a2e0-6871b9c17290","resolution":{"observed_at":"2026-07-08T19:35:33.459160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.18048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.867792Z","title":"Deaf: A benchmark for diagnostic evaluation of acoustic faithfulness in audio language models,","venue":null,"work_id":"b3930261-f209-4013-982a-1e8f6e119f15","year":2026},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:e2aec10afe5cd25bb271db061eab3451f20d053e7a715cdfb19d567036ed103d","observation_id":"7deac565-cb08-4138-84fa-8c8b3add6dfd","resolution":{"observed_at":"2026-07-08T19:35:32.869366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27772","last_updated":"2026-05-26T23:44:23Z","snapshot_observed_at":"2026-07-06T23:37:27.309837Z","submitted_at":"2026-05-26T23:44:23Z","title":"Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox","version":1},"cited_work":{"arxiv_id":"2605.27772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27772","snapshot_observed_at":"2026-07-08T19:35:32.848594Z","title":"Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox","venue":"cs.SD","work_id":"3034d16a-12f1-480d-bcd7-9c0dcb962d4f","year":2026},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2605.27772","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:0cdeef15d1cc7d45191fb5f508d42fcafe1d85e467e9e16cfa405456f7ec3e17","observation_id":"74185485-60cd-42d3-bc16-b633c2f85be1","resolution":{"observed_at":"2026-07-08T19:35:32.849931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12116","doi":"10.48550/arxiv.2510.12116","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding the modality gap: An empirical study on the Speech-Text alignment mechanism of large speech language models,","venue":"ArXiv.org","work_id":"bc154c34-fd1e-460c-9b9d-433859991eaa","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:f620ca7bedc6c9f0829c14b21bd40a34ce6423e7160bb4152f3c385fec542bd1","observation_id":"720969c4-fe76-4f2d-8022-29619b4276bf","resolution":{"observed_at":"2026-07-08T19:35:32.554836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:30.766862+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:30.766862+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.920461Z","title":"Anatomy of the modality gap: Dissecting the internal states of end-to-end speech llms,","venue":null,"work_id":"98e5708b-a185-4f27-894a-d04f2e702bf7","year":null},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:a24ba46a4af1287371cd39dc93322c73d4c98b9869b53f1589a3e7fb9047ea31","observation_id":"158692fb-df60-42a8-96e1-022cfa55ad50","resolution":{"observed_at":"2026-07-08T19:35:33.457202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01502","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.850980Z","title":"Anatomy of the modality gap: Dissecting the internal states of end-to-end speech llms","venue":null,"work_id":"c4189511-c623-488d-a99a-834ce372143e","year":2026},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:87422723211f32e8beb8b73c8275ae36c02d94bd7389cc7383bd9c3b0ede884c","observation_id":"4be9c554-e78e-4f40-b93d-6d95da27769f","resolution":{"observed_at":"2026-07-08T19:35:32.852629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-457","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeSTA: Enhancing speech language models through descriptive Speech-Text alignment,","venue":null,"work_id":"320b0e37-d7a9-42d5-91f6-02f15617a6a0","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:44765c0c2b530f57f4c87fa46b2b27f5aad630db836173eb948d0ccdbfd65b57","observation_id":"da4bbfd6-fd81-46bd-b00b-d707a3fc644b","resolution":{"observed_at":"2026-07-08T19:35:32.542372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:31.014703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:31.014703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.484574Z","title":"Representation degeneration problem in training natural language generation models,","venue":null,"work_id":"bb371770-f9bf-4533-a8e7-5ac16b6ccb40","year":2019},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:e2babe61a946f7283232870a9e3c5ad6263ed5f1ad5f082dd89e5245f1812d31","observation_id":"ad880d48-3033-46ec-9190-ed8852eef7ea","resolution":{"observed_at":"2026-07-08T19:35:33.485702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.459776Z","title":"How contextual are contextualized word representations? comparing the geometry of bert, elmo, and gpt-2 embeddings,","venue":null,"work_id":"e104071c-51f6-43cf-a8f4-330d66faa792","year":2019},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:a253e3cbbe5d26a0bc08544ede1a483c6c3facdc440d14b4cdb322e366a11b30","observation_id":"453d0db8-a6eb-4438-8630-9571bab9a2bc","resolution":{"observed_at":"2026-07-08T19:35:33.461223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.487899Z","title":"Understanding dimen- sional collapse in contrastive self-supervised learning,","venue":null,"work_id":"6b1c7799-883f-4b79-bddd-ebbe7341e247","year":2022},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:6ca91ea36461415c38ab2ae2768f23f3affb244e00992f31694f8ad6c44e48b0","observation_id":"1ace5fed-4f2b-44ef-90a4-a1e95d10a3b8","resolution":{"observed_at":"2026-07-08T19:35:33.489069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-12T14:31:51.567205Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":"1312.6120","doi":"10.48550/arxiv.1312.6120","metadata_source":"pith","pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","venue":"cs.NE","work_id":"adbbf9c7-c3a4-4cb7-9a00-c98b12f8a315","year":2013},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:df2cfd718d5c02419f4a3451f12872a5944209b5497ae2b24effd1e09a963289","observation_id":"6099f334-03da-4d03-8cc3-16cfe2d14fc2","resolution":{"observed_at":"2026-07-08T19:35:32.541188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:31.258619+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:31.258619+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09102","last_updated":"2018-10-22T06:22:54Z","snapshot_observed_at":"2026-08-14T18:11:25.624264Z","submitted_at":"2018-10-22T06:22:54Z","title":"Can We Gain More from Orthogonality Regularizations in Training Deep CNNs?","version":1},"cited_work":{"arxiv_id":"1810.09102","doi":"10.48550/arxiv.1810.09102","metadata_source":"pith","pith_arxiv_id":"1810.09102","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Can We Gain More from Orthogonality Regularizations in Training Deep CNNs?","venue":"cs.LG","work_id":"b2c726fb-42d7-4058-a6e9-65f9667aa69c","year":2018},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/1810.09102","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:55273d420d3dd6d906b0f99815a60719c8a4d79a89bab2ff4213c2b3e78c5ab0","observation_id":"4eb8c977-68e0-403e-9786-b0216dbc7257","resolution":{"observed_at":"2026-07-08T19:35:32.584503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:31.491086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:31.491086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.489613Z","title":"A generalized solution of the orthogonal procrustes problem","venue":null,"work_id":"626df5ab-318f-4a05-9452-15247e0ff580","year":1966},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:b15a23b9b6d92d2a028becc3e91a1ae4d8c6700454f4237cb3c243a775339183","observation_id":"919446e6-01eb-44d6-92d7-e077b175bcd1","resolution":{"observed_at":"2026-07-08T19:35:33.490711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.853736Z","title":"Angle- optimized partial disentanglement for multimodal emotion recognition in conversation,","venue":null,"work_id":"040b2607-4cb0-4822-ac9e-1df7fb63e431","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:8cd8fd063c62c42210d057b3950d14d5517d7c082e725e878890c4174abfeffc","observation_id":"0fe6a897-f388-4395-a7a2-5cf2ae86a798","resolution":{"observed_at":"2026-07-08T19:35:32.855455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22483","last_updated":"2025-08-14T19:16:46Z","snapshot_observed_at":"2026-08-07T13:03:42.862666Z","submitted_at":"2025-05-28T15:31:53Z","title":"A Closer Look at Multimodal Representation Collapse","version":2},"cited_work":{"arxiv_id":"2505.22483","doi":"10.48550/arxiv.2505.22483","metadata_source":"pith","pith_arxiv_id":"2505.22483","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A closer look at multimodal representation collapse","venue":"cs.LG","work_id":"04562443-bfcc-42a3-8b6a-6f7af94928b2","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2505.22483","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:5754c599194401b1ea3ff64192744353522ed961db7057c98d02ecea593d3449","observation_id":"b5eec3af-d386-4c60-befb-1c8aa95ed593","resolution":{"observed_at":"2026-07-08T19:35:32.578272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:31.728685+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:31.728685+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05983","last_updated":"2019-07-09T10:43:41Z","snapshot_observed_at":"2026-08-10T10:03:08.641193Z","submitted_at":"2018-02-16T15:43:43Z","title":"Disentangling by Factorising","version":3},"cited_work":{"arxiv_id":"1802.05983","doi":"10.48550/arxiv.1802.05983","metadata_source":"pith","pith_arxiv_id":"1802.05983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Disentangling by Factorising","venue":"stat.ML","work_id":"a99b1cb8-4cea-450b-8ddf-aa74e0057070","year":2018},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/1802.05983","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:d5b57e1a5b9ccd87b47afa7e4fb16d28be9742cd5fd8427dde1a45bb71cd5cf6","observation_id":"4116bc7a-c80b-41c9-8542-c86c3649c4e2","resolution":{"observed_at":"2026-07-08T19:35:32.569856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:31.979609+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:31.979609+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12359","last_updated":"2019-06-18T08:58:18Z","snapshot_observed_at":"2026-08-14T17:51:09.156124Z","submitted_at":"2018-11-29T18:10:40Z","title":"Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations","version":4},"cited_work":{"arxiv_id":"1811.12359","doi":"10.48550/arxiv.1811.12359","metadata_source":"pith","pith_arxiv_id":"1811.12359","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations","venue":"cs.LG","work_id":"5d284aa0-57d5-4a22-a3a2-ba4213f5a880","year":2018},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/1811.12359","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:78fa940396f1a967960dc599570c26e907d76542de79dda90826c87b458c9607","observation_id":"e566b5be-545f-4984-80c9-e5e8a1bedd7d","resolution":{"observed_at":"2026-07-08T19:35:32.590727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:32.23762+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:32.23762+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6410.371493","doi":"10.1145/3696410.3714931","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bakker, Jay Baxter, and Martin Saveski","venue":null,"work_id":"1344d1fe-4049-4316-b534-fa1613cfee51","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:6a060240b613f8d8f26ba9d5b38fc2865fbdedcae8f308d4b0056d46e97b387e","observation_id":"15d047a6-64fb-4f7a-851c-7b1429ce75ec","resolution":{"observed_at":"2026-07-08T19:35:32.547129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:32.571093+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:32.571093+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:72e6472d1d8f78c1fc4a60677b4f113550df7942561d8baaab5afd16887cfd4b","observation_id":"1a6f5877-297e-47bb-af5f-6ed41202de49","resolution":{"observed_at":"2026-07-08T19:35:32.565789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15055","last_updated":"2020-10-14T08:51:40Z","snapshot_observed_at":"2026-08-11T00:51:15.511781Z","submitted_at":"2020-06-26T15:31:57Z","title":"Object-Centric Learning with Slot Attention","version":2},"cited_work":{"arxiv_id":"2006.15055","doi":"10.48550/arxiv.2006.15055","metadata_source":"pith","pith_arxiv_id":"2006.15055","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Object-centric learning with slot attention","venue":"cs.LG","work_id":"9f2d99f0-0f07-442d-95d7-a2a808521930","year":2020},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2006.15055","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:1d389624dd4520a39637e70aab0a62412a8fa460f5099026ca7a0bb0969b609d","observation_id":"65563ecf-dc4a-465d-9799-28b35816f8b2","resolution":{"observed_at":"2026-07-08T19:35:32.575332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:33.037504+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:33.037504+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.461744Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":"fdf09ebb-00b1-4c26-87c2-aef50a513142","year":null},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:cf47a6fdc103373ad84798cb807739490a0e7492968282d922a01d88427cc576","observation_id":"e08afffc-9a70-4941-8847-e750b8ce5ed2","resolution":{"observed_at":"2026-07-08T19:35:33.462923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.233624","doi":"10.1109/taffc.2014.2336244","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Available: https://doi.org/10.1109/taffc.2014.2336244","venue":"IEEE Transactions on Affective Computing","work_id":"19a5f3aa-28a3-415d-b871-b2a677f0ed5a","year":2014},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:b42053fb3c57ba6d4a856ae33d3afe577eb05acb5e32fa5473a67bd947dea6e2","observation_id":"d68537b0-b5ee-464c-87b8-cfeb1f442afa","resolution":{"observed_at":"2026-07-08T19:35:32.581308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:33.426859+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:33.426859+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:1ab5ea2e65fab404d21af1b17df38354e38cdb72e268586975a4f82191b01b68","observation_id":"434d7c67-f278-4ea8-9c51-73854ddae7d6","resolution":{"observed_at":"2026-07-08T19:35:32.875509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:98fcb538daf98f63e8a208b73758f271c4f32cdc72ae7370049e97c1fa2fbc8e","observation_id":"c8c5d7c0-7b9a-4179-86a2-8a086c761502","resolution":{"observed_at":"2026-07-08T19:35:32.887361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:5ae8bdab995b66f99c24e7ada990d3f758a06306c3516828d3d2615051d68d48","observation_id":"2c790afb-e024-4674-967e-45d540e70bc8","resolution":{"observed_at":"2026-07-08T19:35:32.872738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:8d3e648f52ef39537c36bb17376bfdd561e38f4c8de01821275e3779c2321306","observation_id":"5d611b9a-c805-4709-9227-c783aa15e64d","resolution":{"observed_at":"2026-07-08T19:35:32.881713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.861541Z","title":"Aha: Aligning large audio-language models for reasoning hallucinations via counterfactual hard negatives","venue":null,"work_id":"213b5547-0ac9-4e6c-a246-6e921455cfae","year":2025},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:b9f3d684e7118dc7caf582f267024f2eef2eece5cae36df2ccc4d823cc420327","observation_id":"4a1c51ab-ecfc-4e45-b19e-726ae53cdc6a","resolution":{"observed_at":"2026-07-08T19:35:32.863833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.477804Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"1c1349ea-d690-4e9c-be18-2969d7162133","year":2017},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:e46e4e2eff59bc48122768716d7f3b0d63af412ff9c2e635c7279e02936fd544","observation_id":"4ea3c6f0-9bec-482d-b6bf-9c1fa9db4594","resolution":{"observed_at":"2026-07-08T19:35:33.478876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.479516Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"a78a3d78-32c6-4226-a90e-021402eed35a","year":2019},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:9c7ebdb2b5dc8fb925822b05aa56fd7ed22c78d192f13ccb18a67b1d51fad399","observation_id":"c9640508-b5eb-4c5c-a062-d4ab8fd94fe4","resolution":{"observed_at":"2026-07-08T19:35:33.480577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.474367Z","title":"Esc: Dataset for environmental sound classification,","venue":null,"work_id":"4443cdf7-1a8f-4f20-9346-2b3c15b63d56","year":2015},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:da2c2fbe5080346309ff2dd5e7cd9d167e59fdc7123937a3852b64f02b26d7d6","observation_id":"640e26b4-1c8c-40dd-9eaa-eb0d7ff8438b","resolution":{"observed_at":"2026-07-08T19:35:33.475494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.476021Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":"d3900f75-ce17-4ea8-bbba-a9ca34f84b84","year":2017},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:fee9a6367f67b3be6f7130da55633475868e69ea3e3111dc3a1b611a308a3c50","observation_id":"7001695d-9a2b-4f21-ae0f-0d43721296fb","resolution":{"observed_at":"2026-07-08T19:35:33.477217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1503.2021","doi":"10.1109/asru51503.2021.9688007","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Transducer: A Streamable Speech Recognition Model","venue":null,"work_id":"238c59a4-538f-43ef-86fe-8dfe6651948d","year":2021},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:079ec76b5f709f81329df869bdfa0fcd56764cb2a10055c6f37ddc435e2a818c","observation_id":"989921e6-6ed8-4932-9266-ceb169d19736","resolution":{"observed_at":"2026-07-08T19:35:32.551225Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:33.482826Z","title":"wav2vec 2.0: A framework for Self-Supervised learning of speech representations,","venue":null,"work_id":"42f9e573-741a-4468-8767-3ef5ac2d2a4a","year":2020},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:cb8a626e30a025be9f230663eefa92bc3853f8c3aa653421ab4eec3d271067b4","observation_id":"a349a61c-e475-49a4-973c-4f1266024f1a","resolution":{"observed_at":"2026-07-08T19:35:33.484091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.312229","doi":"10.1109/taslp.2021.3122291","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"01bc0841-3ef8-4720-9eb0-fe0a5a831e62","year":2021},"citing_paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T19:31:48.172439Z"},"links":{"citing_paper":"/paper/2607.06014"},"observation_digest":"sha256:0b9b4401674d812e2dacff8a9c983deb55e455d40ee098c43a32db897f0c0f2c","observation_id":"01cb965a-4e7b-4bc4-badc-fa0234c5dc14","resolution":{"observed_at":"2026-07-08T19:35:32.558745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T04:49:33.939513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T04:49:33.939513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06014","last_updated":"2026-07-07T08:57:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T18:43:43.361960Z","submitted_at":"2026-07-07T08:57:00Z","title":"Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":24,"verified_fuzzy":20},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.06014."}