{"as_of":"2026-08-15T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d20bbd49486832fab2e062884f6b166a5c033dfbab3e7cd14027673030c976e","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:43:45.136873Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06718/citation-record","integrity":"/paper/2608.06718/integrity","json":"/paper/2608.06718/citation-record.json","paper":"/paper/2608.06718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.876357Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.876357Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:13e4a263dea208c29afad8b886479e7d2b9f69b3be1085ad73bb911807a386b7","observation_id":"47cf122c-5fa2-4a8c-9958-a5c3f77a610e","resolution":{"observed_at":"2026-08-14T04:43:44.876357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.883841Z","title":"We Need to Consider Disagreement in Evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.883841Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:ce5b43221344300dadfeb052026b0231646386e2f364f1ca2baca4c2e9800c0a","observation_id":"bff05200-68bc-4092-a63f-054e6240c88a","resolution":{"observed_at":"2026-08-14T04:43:44.883841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.888997Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.888997Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:182fa5fb4439e42f7ba529c52c67d2541de0bb9c1f16cad11b031b2b1fedf7f3","observation_id":"d1a49339-3131-4a5f-988e-f2e5f60363a1","resolution":{"observed_at":"2026-08-14T04:43:44.888997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.894126Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.894126Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c7fdcac6260623a68ba08dee5a3dba2a292c85ecc84826aa27eb3733e9117fd8","observation_id":"8fd30236-f74d-40ff-9e59-08dfa2ab17ca","resolution":{"observed_at":"2026-08-14T04:43:44.894126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.899198Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.899198Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:89f6318f13daca22536bdc78478a1a1d7585b089463229b7e608584dc21de78b","observation_id":"ffd7d181-7f47-4719-8e31-1c74981340de","resolution":{"observed_at":"2026-08-14T04:43:44.899198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.904071Z","title":"SIMMC 2.0: A Task-oriented Dialog Dataset for Immersive Multimodal Conversations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.904071Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:ff2a093fb591f08428ceb4d300ea5927f8a102843031e417e461b40269641df9","observation_id":"c6e49a7d-4b5a-43ad-bec2-edcd41dae48f","resolution":{"observed_at":"2026-08-14T04:43:44.904071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.909331Z","title":"What do others think?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.909331Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:0ba090cdb9046b8d9a2ab49215be04bc4fe206445b790499defcca13742cdeec","observation_id":"8931778c-7f86-4561-b101-86e273b5ee0c","resolution":{"observed_at":"2026-08-14T04:43:44.909331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.914099Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.914099Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c3a30dfdc514e9b7f47d605c4ae16ed45e5b1017cd9c86e6c946bf1fb41d27ac","observation_id":"f34a9b77-ab88-4310-87d4-a4e3198e1a6a","resolution":{"observed_at":"2026-08-14T04:43:44.914099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.919332Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.919332Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:2ec686be5592e64381a317feb691fd2c51d36dbc08d9d54f76303b00793e26a1","observation_id":"a49e2e52-3037-49bd-8769-8cb1e38ba1d5","resolution":{"observed_at":"2026-08-14T04:43:44.919332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.924097Z","title":"N orm B ank: A Knowledge Bank of Situational Social Norms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.924097Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:d32900c2477bbd06a473fc36c3779a855b4b65138a95f0c87d0e53430294751e","observation_id":"95e4b5ac-76ec-471f-b48f-1f74734e85f4","resolution":{"observed_at":"2026-08-14T04:43:44.924097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.928878Z","title":"The Body as a Medium of Expression , editor =","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.928878Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:d152864ac4f48d92f452e3de3a10a354e3528cac5e186779c7d544de6abd6667","observation_id":"621312d5-5aaf-4267-bd95-6456b3966377","resolution":{"observed_at":"2026-08-14T04:43:44.928878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.933336Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.933336Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:264190d12a64e1ecb786710685941abc0d03593a5210ac19991c1082dc3e4bf8","observation_id":"2610613c-57f3-4f3a-8084-2513b701b6f2","resolution":{"observed_at":"2026-08-14T04:43:44.933336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.938388Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.938388Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:df7ffce10d1f042dc527c96190a46189061533ae8f5ea9316c7381763d84b5cd","observation_id":"2b883357-b5e2-4476-9daf-ff59d631eab0","resolution":{"observed_at":"2026-08-14T04:43:44.938388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.943153Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.943153Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c4e38583f69a9bad782030d148e12e09eeea172251fbc8aad8088fcb3eb512ea","observation_id":"88256a7c-77e4-44b5-8d5f-be1fd26db94e","resolution":{"observed_at":"2026-08-14T04:43:44.943153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.947547Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.947547Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:9b35104462fcebfbea021034a3d695ad985a6bd409712b5c160cb423b4808a04","observation_id":"1e60cff7-ca82-4f1f-8da9-bdc765abd5ea","resolution":{"observed_at":"2026-08-14T04:43:44.947547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.951808Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.951808Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:6787dd1cc7dd106347cef3f287b8e77df02ed1266655102da6092ddea9371c29","observation_id":"585b0aec-9408-4417-9a8e-5d234a1ea425","resolution":{"observed_at":"2026-08-14T04:43:44.951808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.956403Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.956403Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:0ca90e410d84514dd33cc5084d8695d74fb1a10f87be992df93ec63817bf8335","observation_id":"76533e01-dc80-4086-ac43-a97111ceee60","resolution":{"observed_at":"2026-08-14T04:43:44.956403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.960753Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.960753Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:92f51a118ad285601cc31f534012cfad4d0720abf28743d7fc0273fda3a6448d","observation_id":"defcd3d9-1ce7-4a5d-9bf8-e697847bdae2","resolution":{"observed_at":"2026-08-14T04:43:44.960753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.965326Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.965326Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:73514aa6bb2fb9ff55b1806f6822ff50d8a8185afe08ebc8c93726160130da6a","observation_id":"f7c3388f-207a-4a5b-8d3f-c1b65d7446be","resolution":{"observed_at":"2026-08-14T04:43:44.965326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.970448Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.970448Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:599ee3fb8adbf8f09a67cad5adbd21b8952cbec31a5459e1b7b68029cbd65b07","observation_id":"6fd09cb0-d146-42f3-80f8-6cc2521acc71","resolution":{"observed_at":"2026-08-14T04:43:44.970448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.974990Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.974990Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:963632ce40f24f27ea9aa1c013eaa081860a6d6bc36211d2f508f8e4c5f66d00","observation_id":"6914f919-5c25-44cc-97b7-5adcf7a972ac","resolution":{"observed_at":"2026-08-14T04:43:44.974990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.979683Z","title":"Do Audio LLM s Really LISTEN , or Just Transcribe? Measuring Lexical vs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.979683Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:f442b31cfc4a56641fe69ea354bedb441afb215b3315b37424269183f2476900","observation_id":"8edfd0c9-7b04-4c10-853f-943cf7d4f70e","resolution":{"observed_at":"2026-08-14T04:43:44.979683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.984788Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.984788Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:43997154b6828a2f22971a0dfa9284b7a425d069706dd50f709f5e19ba26f4f0","observation_id":"7c18bb57-b240-42e4-8b53-245173dea30b","resolution":{"observed_at":"2026-08-14T04:43:44.984788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.989595Z","title":"2023 , note=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.989595Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:7b2447d3b47a48452697c205752053b368c12567f893f02a8627874d2d1a47fd","observation_id":"7e66f52e-f9e5-4e53-97f4-2009ac8f7ac9","resolution":{"observed_at":"2026-08-14T04:43:44.989595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-14T04:43:44.994306Z","title":"Length-Controlled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.994306Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:5ca9fecbe1e5b911e890475159808d166d4b1a275879966acca0d6a3ef9728ec","observation_id":"54d5c626-3aa6-4c23-a321-bcea1cf73643","resolution":{"observed_at":"2026-08-14T04:43:44.994306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.000191Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.000191Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:44c676fd6e4bd3e121d2555eb20af02f1412678790f727e54d4db82f0a8de2a2","observation_id":"ebaebbe9-4a23-45ca-b961-db0432b75a8a","resolution":{"observed_at":"2026-08-14T04:43:45.000191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.005233Z","title":"Proceedings of the 42nd International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.005233Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c7d53ea7e7385b54e64c7c6977e4a628dd83c4966bec8cc6d64c6d349529ed8e","observation_id":"d9657f71-f19b-4445-a449-3763736eee38","resolution":{"observed_at":"2026-08-14T04:43:45.005233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05085","last_updated":"2026-05-07T14:20:28Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T02:07:00Z","title":"S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05085","snapshot_observed_at":"2026-08-14T04:43:45.011201Z","title":"arXiv preprint arXiv:2503.05085 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.011201Z"},"links":{"cited_paper":"/paper/2503.05085","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:af598472e3fabfc67413ef928a16750ab8dc965c92a0eb76a7c236389bfe7e70","observation_id":"6c883d0a-8567-4bf0-8c0a-71a8101e19da","resolution":{"observed_at":"2026-08-14T04:43:45.011201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.017367Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.017367Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:b1793b1461e0c3e10aaa066b40353bff9f4639b03f521bf507528d44ac3e0ded","observation_id":"20581ef8-625b-411e-9479-23324c45ca44","resolution":{"observed_at":"2026-08-14T04:43:45.017367Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-08-14T16:44:55.414938Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-08-14T04:43:45.022396Z","title":"arXiv preprint arXiv:1904.08352 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.022396Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:899d171a106a6c56396437ec2da3747ccc6e439ede9ad2804162cc4374ddd09c","observation_id":"778db9d8-3f12-4828-bdcb-562d76064021","resolution":{"observed_at":"2026-08-14T04:43:45.022396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.027941Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.027941Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:bc228420b9d73095d46a16f9f3346bbe784b69afa196b02aa0eeacd207ade0a0","observation_id":"e7b134cb-444e-45f4-ac64-98a0595e5538","resolution":{"observed_at":"2026-08-14T04:43:45.027941Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.032601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.032601Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:f2c4393ddb48f3a32bc61759a63d9b3ab28de2684237bb5dae871a3c17caec0f","observation_id":"f3fb4a6c-bafe-42c8-b1f8-0611fec2fbda","resolution":{"observed_at":"2026-08-14T04:43:45.032601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.037583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.037583Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:a38c13897b74f265066cd98d21f91518d9af3424ba57aacf32d768dad16f4a28","observation_id":"b5db910f-ecb1-4137-8e1f-8e8f2d818835","resolution":{"observed_at":"2026-08-14T04:43:45.037583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03606","last_updated":"2024-04-04T17:25:31Z","snapshot_observed_at":"2026-08-13T00:37:33.403954Z","submitted_at":"2024-04-04T17:25:31Z","title":"Analyzing Musical Characteristics of National Anthems in Relation to Global Indices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03606","snapshot_observed_at":"2026-08-14T04:43:45.042944Z","title":"arXiv preprint arXiv:2404.03606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.042944Z"},"links":{"cited_paper":"/paper/2404.03606","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:cab9b5d5efb58ca85ff74863f310b8e5ed979b57953241086ed76915c4728875","observation_id":"ea5f66fd-5df0-4e9f-9366-77c2b15dd2fa","resolution":{"observed_at":"2026-08-14T04:43:45.042944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04174","last_updated":"2023-02-08T16:25:20Z","snapshot_observed_at":"2026-08-13T12:48:40.450153Z","submitted_at":"2023-02-08T16:25:20Z","title":"The Hardware Impact of Quantization and Pruning for Weights in Spiking Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04174","snapshot_observed_at":"2026-08-14T04:43:45.048130Z","title":"arXiv preprint arXiv:2302.04174 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.048130Z"},"links":{"cited_paper":"/paper/2302.04174","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:0f73a80e7dd3e01bb1d7d48854c9a7f51b009c53a66e7e0dd11dff011fb4526a","observation_id":"43933f4b-a325-495e-8a9f-054fb8840124","resolution":{"observed_at":"2026-08-14T04:43:45.048130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.053023Z","title":"2025 , address=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.053023Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:de9e40d2d69fd9f154bf03aa507bedad37804cc3fb3bff24cebc8f21f94bf092","observation_id":"fbb70ad4-5afb-4211-8189-0df16c9c15e0","resolution":{"observed_at":"2026-08-14T04:43:45.053023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.057684Z","title":"2025 , address=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.057684Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:3aebedcba686bf25fdf96e2cba884d58accde533e2bc753b0a486449185f46f4","observation_id":"70aea57c-2ea9-45c2-b34f-5ef0c877c40c","resolution":{"observed_at":"2026-08-14T04:43:45.057684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12705","snapshot_observed_at":"2026-08-14T04:43:45.062463Z","title":"arXiv preprint arXiv:2507.12705 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.062463Z"},"links":{"cited_paper":"/paper/2507.12705","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c4c90e9d15f6a915230ded9cc14c715bc57c00d1355fa27a6cc6368c961beb2f","observation_id":"d38cd87b-2865-41a7-88cf-2cb2657ca200","resolution":{"observed_at":"2026-08-14T04:43:45.062463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-14T01:35:19.734011Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-14T04:43:45.067587Z","title":"arXiv preprint arXiv:2506.05984 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.067587Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:35aa35ab6f27509bbaa8e7b5f0badbe036373ca56cc827bf610d617c4cfd8f8f","observation_id":"fb5e74af-db89-40ea-9acd-822b6f268f8e","resolution":{"observed_at":"2026-08-14T04:43:45.067587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.072602Z","title":"arXiv preprint arXiv:2505.09558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.072602Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:5d4452b2b856f8b25347e7676ea4ea08bdc37e868fa456f1aa5563edd931840a","observation_id":"fee49e91-450e-48ee-9954-2aaa20fe2d44","resolution":{"observed_at":"2026-08-14T04:43:45.072602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.078507Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.078507Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:5861c0923066273b1963444eb969601f58c0f5e31173dfa14c206d2ee11bf4a3","observation_id":"aec3b046-70a3-4f7d-a807-52614a88daf3","resolution":{"observed_at":"2026-08-14T04:43:45.078507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.084109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.084109Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:f5dc9a0197cdc75131150349b75543e433f39aa6e6ce8b1dc81eab8f3f590eae","observation_id":"41a6fc0e-84b2-40bf-8b48-2cbbfa91bd1c","resolution":{"observed_at":"2026-08-14T04:43:45.084109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.088737Z","title":"Key-Value Retrieval Networks for Task-Oriented Dialogue","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.088737Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:8677a2cb2fb890dbab33d6f7eecb7e609da447e9011e6319fc239b200ea9c9c9","observation_id":"19c47ce9-6523-49ca-a748-ec2092a8ac29","resolution":{"observed_at":"2026-08-14T04:43:45.088737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.093465Z","title":"M ulti WOZ - A Large-Scale Multi-Domain W izard-of- O z Dataset for Task-Oriented Dialogue Modelling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.093465Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:6256bba2461f32c343b09019628ea8eb65ec746d26a6498ffe98ab84efb9e7e1","observation_id":"48fa56a4-8109-4e93-b0ba-525680caa300","resolution":{"observed_at":"2026-08-14T04:43:45.093465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.098090Z","title":"and Lastras, Luis and Lasecki, Walter S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.098090Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:42504f3889d79f40a7c9c2c6b1d7625a76cbef88e1dd403600f58aa6b15c9b97","observation_id":"43ddfd4a-d755-416d-88d4-5122a37e3b89","resolution":{"observed_at":"2026-08-14T04:43:45.098090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.102909Z","title":"IEEE Transactions on Affective Computing , volume =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.102909Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:091067ce1a4f654344a602cca6ca352eb8afdd841101bfbb400f3f402553a6b4","observation_id":"187dc25f-65d3-46d9-ae95-146969daf56d","resolution":{"observed_at":"2026-08-14T04:43:45.102909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.107453Z","title":"PLOS ONE , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.107453Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:f5580fa2144ecf14390f865b24254b69b077e18b5c551a05a78a0f6c07849a26","observation_id":"23ae8da3-9e83-43f4-a907-752e29e03b67","resolution":{"observed_at":"2026-08-14T04:43:45.107453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.112123Z","title":"Hearing Between the Lines: Unlocking the Reasoning Power of LLM s for Speech Evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.112123Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:4283e127dcfec4d456ad6fc859b3043ed53cae85dc009f02ed3a209eac51c55b","observation_id":"d84979bd-82b6-4e17-ab00-4874bf60488b","resolution":{"observed_at":"2026-08-14T04:43:45.112123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.116934Z","title":"2014 , publisher =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.116934Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:73f61f0730e3b419143193ec958dceaed642fe3ac84ab54cfd66eacea4850638","observation_id":"db480f7c-c0f1-42c2-b895-284035c6ed43","resolution":{"observed_at":"2026-08-14T04:43:45.116934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.121992Z","title":"Psychological Review , volume =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.121992Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:64d7d823ddacfa4a3373d59d7d5f5141764c8109af27417208f9d8b41ce02aa1","observation_id":"9acf39f2-6540-413e-ab80-bbf3cbd0990a","resolution":{"observed_at":"2026-08-14T04:43:45.121992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.126921Z","title":"Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.126921Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:ada4eccbeba76aedc1430e6e30bfafd155076a701e8a0601357122cd59f85e35","observation_id":"7b52f06f-8e79-41e0-87f7-03fd06d2838b","resolution":{"observed_at":"2026-08-14T04:43:45.126921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.132199Z","title":"Speech Communication , volume =","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.132199Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:364d6a5e18ad7330e3400606fe09870938b2d6f76a870536d33b2a9a427038e8","observation_id":"e1f90003-c7a7-482b-b5fe-f5363086f062","resolution":{"observed_at":"2026-08-14T04:43:45.132199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.136873Z","title":"2019 , publisher =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.136873Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:b318b88070f92d6e650220003bc7529f0a65a70db77d488f3e364c06a318aafa","observation_id":"3273062e-c8c6-4d93-b0c1-916c7e055d5b","resolution":{"observed_at":"2026-08-14T04:43:45.136873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T01:15:18.081048Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.06718."}