{"as_of":"2026-08-09T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0e502d0df3ecc25da9a924cdfcb268952a36f67c0238805fe3a176f8fb359d2","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:20:03.868153Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:19:55.932658Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13408","snapshot_observed_at":"2026-08-02T05:19:55.932658Z","title":"It starts with gentle rainfall, then someone walks through the scene. After that, a wooden door slowly opens, and the clip finishes with cars passing by in the distance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:55.932658Z"},"links":{"cited_paper":"/paper/2607.13408","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:e4e449a4bb935a8fe495779c222c3df92fb6d9d31bb43a1b6eaa4f15f64ad1ef","observation_id":"897b7fd3-7c2c-496e-abb6-b3bc3fcc7be8","resolution":{"observed_at":"2026-08-02T05:19:55.932658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13408/citation-record","integrity":"/paper/2607.13408/integrity","json":"/paper/2607.13408/citation-record.json","paper":"/paper/2607.13408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13408","snapshot_observed_at":"2026-08-02T05:19:55.932658Z","title":"It starts with gentle rainfall, then someone walks through the scene. After that, a wooden door slowly opens, and the clip finishes with cars passing by in the distance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:55.932658Z"},"links":{"cited_paper":"/paper/2607.13408","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:e4e449a4bb935a8fe495779c222c3df92fb6d9d31bb43a1b6eaa4f15f64ad1ef","observation_id":"897b7fd3-7c2c-496e-abb6-b3bc3fcc7be8","resolution":{"observed_at":"2026-08-02T05:19:55.932658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.009130Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.009130Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:98b935aea73f5f5b99343e60d5cbf39390a441fea2b4bb38cb5a8e63f95449ff","observation_id":"93faeea3-4eac-431b-a8db-3976a2457343","resolution":{"observed_at":"2026-08-02T05:19:56.009130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.153317Z","title":"Rain is falling con- tinuously","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.153317Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:bf7175efe0724c20384257bd583daa0cd28892927a29d561871502b065f74055","observation_id":"c552ab95-18f0-40c9-bd4d-1a1f569710d2","resolution":{"observed_at":"2026-08-02T05:19:56.153317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.317477Z","title":"It starts with the sound ofe 1, shifts toe 2, and ends withe 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.317477Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:82b1dedb12cd5869327f6b0520d13c8d52bc3be1905b01662d9bf8f119d10f60","observation_id":"7bed7c70-e320-44be-81fc-a962e42fcab3","resolution":{"observed_at":"2026-08-02T05:19:56.317477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.421451Z","title":"Verifying ALLMs as Judges Table 1 reports ALLM performance on audio understanding benchmarks with ground-truth annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.421451Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:b6bbb8dd09ca1b30003982bf4764ef577e8e3f6f1971912cbd122024b20aac34","observation_id":"261244ee-e32a-471f-851a-887ae4373772","resolution":{"observed_at":"2026-08-02T05:19:56.421451Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.578105Z","title":"While recent systems achieve strong percep- tual realism, our study shows that they often overlook fine- grained requirements such as sound event completeness and temporal ordering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.578105Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:d13b9d5ce7489663adcd727db1255e6fa6a4f5a696f69eb8ceee2de07586a258","observation_id":"8d3e11d5-03f1-4d28-bbe9-0b3d50843993","resolution":{"observed_at":"2026-08-02T05:19:56.578105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.685633Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.685633Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:9dd049371a2a2febdda15c56f0dbf15e7c9385cf88942c0b614d8785acb90411","observation_id":"73364c19-88fc-4a25-ab64-3abf510cc4e2","resolution":{"observed_at":"2026-08-02T05:19:56.685633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-02T05:19:56.888125Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.888125Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:7e40e02b072a75bdf11203d3f342ca7d572eb31ad3ab0649ce49dc24612ec64a","observation_id":"83e62017-cf58-492c-8725-d771dc9ac622","resolution":{"observed_at":"2026-08-02T05:19:56.888125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-02T05:19:56.911402Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.911402Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:8bc853592c44feec0d2ecd9f69f041e790186fb64d8af9ebe3818dbf8bbbfd4f","observation_id":"3b8dd948-6f65-466b-a3cc-46a277751328","resolution":{"observed_at":"2026-08-02T05:19:56.911402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:56.963850Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.963850Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:ac5b45d87083edaf3f57b77067422cfa3642b741ca506b8ef588e2c84916b351","observation_id":"cd851abf-2a24-4ff8-b554-cb7618658e91","resolution":{"observed_at":"2026-08-02T05:19:56.963850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-02T05:19:57.089048Z","title":"Text-to- audio generation using instruction tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.089048Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:11180b7db196513033fc245184e950fa563922f751d3a6a0fc3184ba1523f796","observation_id":"cd8dac01-cc08-4c03-b8de-40e5cddd78c1","resolution":{"observed_at":"2026-08-02T05:19:57.089048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.219463Z","title":"Diffsound: Discrete diffusion model for text-to-sound genera- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.219463Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:65cc280f48c977075786220fb60e90c60891235abbda79373ffaa05800dbfcb7","observation_id":"348e50f9-7e8a-4b55-b7c6-6fe9059b08ca","resolution":{"observed_at":"2026-08-02T05:19:57.219463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.281224Z","title":"Towards general-purpose text-instruction-guided voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.281224Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:eee9b2356586268f74bf933b365eef971efbb0f47bb825fbb5701e758c2fe9d3","observation_id":"5c55add6-096b-489f-90d4-2bc60330662f","resolution":{"observed_at":"2026-08-02T05:19:57.281224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.382379Z","title":"Simple and controllable music generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.382379Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:d54780dffbf52606671a2fc6aefd3615ae95f6b7162a5ca61bef36ff3104ca6f","observation_id":"7c05fc79-d7d6-4cb5-999f-5c2659632ce1","resolution":{"observed_at":"2026-08-02T05:19:57.382379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.450207Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.450207Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:fe7d43ce82dcaff110cc3a959f042f821b38efd4c8e88d1442ea349266e01da3","observation_id":"7ad275b0-2ef7-460e-b96a-95909d3f937f","resolution":{"observed_at":"2026-08-02T05:19:57.450207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-02T05:19:57.547298Z","title":"Soundstorm: Efficient parallel audio gen- eration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.547298Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:8bbc2c990f1f48d3cb14985511f0f71896b59894bc9e85a8d5e3fa32282a74ab","observation_id":"c3acb87d-c10d-4f9a-8ab0-17fa3de23416","resolution":{"observed_at":"2026-08-02T05:19:57.547298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-02T05:19:57.626028Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.626028Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0fcd461acc21c1b5c49d22163331622d53b3227c3ead360b4dc2cc67b1209ed5","observation_id":"99729a8c-4d66-420f-867e-6f3bdbb85b88","resolution":{"observed_at":"2026-08-02T05:19:57.626028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.779448Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.779448Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:f1939b4e07918a40c993e72dee9cb2aecbf7571dec9e9f464eaca8bbfe0d870b","observation_id":"f1542adc-c504-493e-b5cc-0d8a9df23b56","resolution":{"observed_at":"2026-08-02T05:19:57.779448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:57.897476Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap- ranked preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.897476Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:e8138082e53f67ff7375ee174e8305e32c035ed59f285a7df81c54e45690b76b","observation_id":"af68f29d-04c2-4789-a505-a562ef0ef7b0","resolution":{"observed_at":"2026-08-02T05:19:57.897476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-07-06T19:16:28.014017Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-08-02T05:19:57.993408Z","title":"Ezaudio: Enhancing text-to-audio generation with efficient dif- fusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:57.993408Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:6561274161c1d151a7156c71b5c5de22cb5006be6c50b8dd28101bd1409b43d4","observation_id":"c7753fe2-0ae1-45b0-a65f-29f274af05eb","resolution":{"observed_at":"2026-08-02T05:19:57.993408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.141475Z","title":"Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.141475Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:5216dfc351fcb57dbc261287822c834820467c8e3824eb350bfaab11355e8fcb","observation_id":"38c0a192-db20-4807-8219-d48127efaa21","resolution":{"observed_at":"2026-08-02T05:19:58.141475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.321242Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.321242Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:1fad68205af7b5c8e012cdfb8b1787a28cdf8c494f0342019748c0fa9958d457","observation_id":"c69f1c51-9f5b-4103-901d-165ab4231797","resolution":{"observed_at":"2026-08-02T05:19:58.321242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.435218Z","title":"Etta: Elucidating the design space of text-to-audio models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.435218Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:b37105d5f15914d46d937ce9c5f71f30d5eb642785172ac29c012f27541ef454","observation_id":"bf2e3ebf-2a9f-4891-995d-e67f26ee13e9","resolution":{"observed_at":"2026-08-02T05:19:58.435218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.585617Z","title":"Impact: Iter- ative mask-based parallel decoding for text-to-audio generation with diffusion modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.585617Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:89cd2b5dcbd07e118a2ed8ec0ec92770cd982b39c046eed0d3876356001b461b","observation_id":"137f8c6c-2bdb-45d0-a2e6-47e2e1cae64a","resolution":{"observed_at":"2026-08-02T05:19:58.585617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.676033Z","title":"Gen- erative audio language modeling with continuous-valued tokens and masked next-token prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.676033Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:52bde737ba83dbba48083156157b83b4de1bc2821d72c22aa09f19786150381f","observation_id":"bf6b0368-4ac5-4de3-9de7-09775fd8cde0","resolution":{"observed_at":"2026-08-02T05:19:58.676033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.829580Z","title":"Fr ´echet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.829580Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:f6dc06988f7b83f4b0ae5f37cefe0d0135386022be55371e0d4e07162f7d7e66","observation_id":"faf29cef-d559-44e2-a290-673d1bece393","resolution":{"observed_at":"2026-08-02T05:19:58.829580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:58.968651Z","title":"Improved techniques for training gans,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:58.968651Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:38a827fa7733692b4eabb7f34110aaa74c0b876ff0d1151335ae81e6f5f38cb3","observation_id":"f28e2bb0-5c2d-47e1-800d-a3f9a2f950b1","resolution":{"observed_at":"2026-08-02T05:19:58.968651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.107979Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.107979Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:bf23dc8a5019aa0c1425f1d30714bf14895045c0e3b136d66b87bd438455ff91","observation_id":"68fafd2c-9de4-478b-8e25-965cce8f216a","resolution":{"observed_at":"2026-08-02T05:19:59.107979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.212491Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.212491Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0ddc690c485104b13d77706d63a6801a623d0cdf93c5f00d283aa1afacee13bc","observation_id":"823b4a65-1815-4089-bea7-f33063c84884","resolution":{"observed_at":"2026-08-02T05:19:59.212491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.335502Z","title":"Ritta: Model- ing event relations in text-to-audio generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.335502Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:21cdb9aba173cdc5121e9ec8c893f482749b281e1baf7e406cc5755e0c6b20e8","observation_id":"cebd6c1b-4a32-480c-92df-1ae59215ff7e","resolution":{"observed_at":"2026-08-02T05:19:59.335502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.441087Z","title":"Aurelius: Relation aware text-to-audio generation at scale,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.441087Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:b592cd00d6adcd2dd061f93785c89daba621643394d91cfd7df1e83b15a0f100","observation_id":"e1032269-da52-42aa-bf86-def53b563435","resolution":{"observed_at":"2026-08-02T05:19:59.441087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.620138Z","title":"Compa: Address- ing the gap in compositional reasoning in audio-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.620138Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:d7681aea730c8fec64b63b09084e5fbeeae88c9018c14645d0803028f7fb165e","observation_id":"902de066-9176-4336-8df2-c8a8c476b0ca","resolution":{"observed_at":"2026-08-02T05:19:59.620138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.789891Z","title":"T2a-feedback: Improving basic capabilities of text-to-audio generation via fine-grained ai feed- back,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.789891Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0e93a9d81646b6c4757ef8bafa44af21b44fa5e198282ae8f5657fcccf063d20","observation_id":"f9f1773e-935e-4788-a6ef-ea24d36f11a5","resolution":{"observed_at":"2026-08-02T05:19:59.789891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:19:59.939522Z","title":"Aqascore: Evaluating semantic alignment in text-to-audio generation via audio question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:59.939522Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:7037fc2bbb128b79ca1722a7f53cf99358a8183c27ac37f2b4d3902bc3ac444c","observation_id":"90a1d0a4-25db-4132-a3a1-62995b35a5b4","resolution":{"observed_at":"2026-08-02T05:19:59.939522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12290","last_updated":"2026-07-14T02:55:00Z","snapshot_observed_at":"2026-08-06T21:30:37.729023Z","submitted_at":"2026-07-14T02:55:00Z","title":"The Sound of Absence: Audio-Language Embedding Models Struggle with Negation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.12290","snapshot_observed_at":"2026-08-02T05:20:00.076142Z","title":"The sound of absence: Audio- language embedding models struggle with negation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.076142Z"},"links":{"cited_paper":"/paper/2607.12290","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:fc75ede0a1f1344063046e6972ec900144b783cfcf346a3989a42bb2b9d6afc4","observation_id":"c044ba76-7e09-45c9-997c-dfaf3b24b02c","resolution":{"observed_at":"2026-08-02T05:20:00.076142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T05:20:00.190570Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.190570Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:50b08912508d2d07ba57913c955e6611e892ac76fa6c31fb10e4eda608f49fd4","observation_id":"ea01226f-cdac-4df2-a716-7a4c648b1874","resolution":{"observed_at":"2026-08-02T05:20:00.190570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:00.385579Z","title":"Joint audio and speech understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.385579Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0e27f8f19b23e50b85ba85f0ede4ed5a9e692346f2ec52386063242ab92d7be1","observation_id":"858fae87-adb7-410e-9d45-36588d562764","resolution":{"observed_at":"2026-08-02T05:20:00.385579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-02T05:20:00.587754Z","title":"Blsp: Bootstrapping language-speech pre-training via behavior alignment of continuation writing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.587754Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:360d1901dee6d491e145d45a6fa42e94dbee779a8d2246a0413fe4e5f33f8bb0","observation_id":"0f35bbe4-350f-4beb-bfd6-a448f097bb72","resolution":{"observed_at":"2026-08-02T05:20:00.587754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:00.724635Z","title":"Audiochatllama: Towards general-purpose speech abilities for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.724635Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:3797e056ff6a579a3c233a95557ef4ec366ae3c68e8d7c2a26ac9ec2b34fd304","observation_id":"eeb694ec-2354-4fac-a910-630a9669a28b","resolution":{"observed_at":"2026-08-02T05:20:00.724635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:00.835510Z","title":"Speech-copilot: Leveraging large language models for speech processing via task decomposition, modularization, and program generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.835510Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:eae3b4088bb6b20f6fa280913375786757962f0e5fff6d855ee60a00784cffad","observation_id":"404f282e-2fdc-4d66-a562-0a1f6a605364","resolution":{"observed_at":"2026-08-02T05:20:00.835510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:00.957127Z","title":"Speechprompt: Prompting speech language models for speech processing tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:00.957127Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:14fecdb7c2bc4730539775e62551d2a91e31335ea4ad9a6654739e69cc98ae90","observation_id":"b6d54ccc-0e7d-4188-864e-5c65a1e75323","resolution":{"observed_at":"2026-08-02T05:20:00.957127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:01.082235Z","title":"Blsp- emo: Towards empathetic large speech-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.082235Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:756380970da396f3d3875177cbd346b60da730f4f1170997f477522afff28129","observation_id":"2b6a02bc-8860-4fbe-b2d4-40658e22f1b0","resolution":{"observed_at":"2026-08-02T05:20:01.082235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:01.281092Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.281092Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:dfead6e27408ecc91694aa055877215242a85ec74905100df3b20436b535a8f2","observation_id":"63214a6e-6535-42e2-aec1-579dd8c11ab5","resolution":{"observed_at":"2026-08-02T05:20:01.281092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-08T09:14:25.899359Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:20:01.370603Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.370603Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0aeb8b222650283a3e93ad5ca52d9f9f5e68b36711091a18e804f757ee43dae1","observation_id":"608bbfa2-db29-48f0-b7a6-465c09ffa510","resolution":{"observed_at":"2026-08-02T05:20:01.370603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-02T05:20:01.448742Z","title":"Qwen2.5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.448742Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:fb550436228bf1d8d1b790d898b21c16c928ffad612992e6e9871f12621f0e7a","observation_id":"24cfd24c-19b1-49d1-98a5-cd9b15b8f084","resolution":{"observed_at":"2026-08-02T05:20:01.448742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:01.542825Z","title":"Teaching audio-aware large language models what does not hear: Mitigating hallucinations through synthesized negative samples,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.542825Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:1286828093756792f1179a6c4f673667d455cad2565158a19146a8454204638e","observation_id":"643cea81-7953-4c92-b12c-91f3407746b5","resolution":{"observed_at":"2026-08-02T05:20:01.542825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:01.637467Z","title":"From alignment to advancement: Bootstrapping audio- language alignment with synthetic data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.637467Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:41277a1dc51ff7228b9c9f216d666ff0b044d1db699521d9df1635a410ec1665","observation_id":"4db4dd76-378d-41cc-9a06-1be24eb3645d","resolution":{"observed_at":"2026-08-02T05:20:01.637467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-02T05:20:01.741673Z","title":"Phi-4-mini technical report: Compact yet powerful multi- modal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.741673Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:21425d1c2eb9a5707f575d24b8eed1b08c713f52d552b314d94d5969bf9220ba","observation_id":"c0c038e6-b470-4114-998a-f34b9a784af4","resolution":{"observed_at":"2026-08-02T05:20:01.741673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T05:20:01.846967Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabil- ities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.846967Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:ea9b1ab33c3ade9271ac5670a79584698d7937f1f91c86a1690a72a9d968fe23","observation_id":"51859531-fef3-4eb6-a497-416d668ceead","resolution":{"observed_at":"2026-08-02T05:20:01.846967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:01.913145Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.913145Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0fc1a07d15e61fd7b875cbb84e303c01466de2cb8bc4675226890f0e8112ce64","observation_id":"82966f7a-01b6-4c22-b376-bebc7cb45090","resolution":{"observed_at":"2026-08-02T05:20:01.913145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.010846Z","title":"Audio flamingo 2: An audio- language model with long-audio understanding and expert reason- ing abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.010846Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:8dd94436f2cd5276e2a11aafb64e42d04c95a446d1d6b133518916d181cda434","observation_id":"1c2430b7-ebd3-4959-89b8-d6be49899dd5","resolution":{"observed_at":"2026-08-02T05:20:02.010846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.115586Z","title":"Understanding sounds, missing the questions: The challenge of object hallucination in large audio-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.115586Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:4adf07591bdde0a6083c2e0464f6cb173e41fe1ed5ff7c152883b98a0ded40da","observation_id":"437b6dca-2413-4b2e-a766-918f3ce965c9","resolution":{"observed_at":"2026-08-02T05:20:02.115586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.190850Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.190850Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:2ccf0c91b8046fbec897988f0c91923db875e0b2e31ed8971e25da0b8ed1574a","observation_id":"d21e50ec-7b39-44ad-bc3d-c16394ff7da3","resolution":{"observed_at":"2026-08-02T05:20:02.190850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.256101Z","title":"Dynamic-superb: Towards a dynamic, col- laborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.256101Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:654528581692909a0be8c15bdf9fbd865e91885132a4808d86cf21b8d5ec0861","observation_id":"22d14206-0d01-4eab-9f4a-3efedc4a53f9","resolution":{"observed_at":"2026-08-02T05:20:02.256101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.393294Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.393294Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:20d71f0a5992f91e3c7e728053a51ed60a8707a2eb939011c0825ab50c71a766","observation_id":"8f6b06dc-021c-424d-b487-6393d494879e","resolution":{"observed_at":"2026-08-02T05:20:02.393294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.526891Z","title":"Mmau: A mas- sive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.526891Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0e47feadbde3e9e116d28b5aebf287ed90abcfd01f3aabd28868b4d7d70d747a","observation_id":"bc7f16a0-4878-48a4-95f3-1e4acbb3d1cb","resolution":{"observed_at":"2026-08-02T05:20:02.526891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13992","last_updated":"2025-08-19T16:33:49Z","snapshot_observed_at":"2026-08-05T18:48:28.371759Z","submitted_at":"2025-08-19T16:33:49Z","title":"MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13992","snapshot_observed_at":"2026-08-02T05:20:02.638568Z","title":"Mmau-pro: A challenging and comprehensive benchmark for holistic evaluation of audio general intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.638568Z"},"links":{"cited_paper":"/paper/2508.13992","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:7afacd8629c5990f952c3c620c35fae6a4cee43923e07c68dd8f51eb1a935ece","observation_id":"6725413c-ccf2-44a3-92cf-440a8c763c73","resolution":{"observed_at":"2026-08-02T05:20:02.638568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-07T15:43:15.821319Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-02T05:20:02.704210Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.704210Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:33131359f677e1ee617dca1084ec4f6e09c508460476a50488bc56d2cbe77627","observation_id":"845f6050-4f64-412b-ab73-8ac9afaa3b9a","resolution":{"observed_at":"2026-08-02T05:20:02.704210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.807832Z","title":"Game-time: Evaluating temporal dynamics in spoken language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.807832Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:771c085d3b676386fd1cec1aad338f063ca9d9ee9dfd06c40dfb008b5794a903","observation_id":"bbe15c22-57ad-49e3-922d-0172e2fe2e30","resolution":{"observed_at":"2026-08-02T05:20:02.807832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:02.895515Z","title":"Aqua-bench: Beyond finding answers to knowing when there are none in audio question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:02.895515Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:bcb70aaf4427988e347c1b93f1dc8490324ae41d805b88e5f445a564910e226a","observation_id":"96f2e11a-f2dc-4ef6-a2ca-3096fb59c02c","resolution":{"observed_at":"2026-08-02T05:20:02.895515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.015060Z","title":"Baton: aligning text-to- audio model using human preference feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.015060Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:7336a9e75935fc55335e9b912a0875d3335dd6cfd9214dc3385678377a37d4ed","observation_id":"4a70f1b7-c7c8-4ec6-ad7f-eb66b453401b","resolution":{"observed_at":"2026-08-02T05:20:03.015060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-05T12:06:36.882921Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25591","snapshot_observed_at":"2026-08-02T05:20:03.080402Z","title":"Walking through un- certainty: An empirical study of uncertainty estimation for audio- aware large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.080402Z"},"links":{"cited_paper":"/paper/2604.25591","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:79de9e1ac170ae937eb8951de90b347ed0dba8323f70ff48ae0b4165a0af5cf5","observation_id":"11e27ef6-1daa-4dc8-89f9-9050d62389a4","resolution":{"observed_at":"2026-08-02T05:20:03.080402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.189659Z","title":"Audio large language models can be descrip- tive speech quality evaluators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.189659Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:7f7a089dc6e7ba18b24a025a01c0fbb134d1d2b9e17b594a0c4b2eb012662856","observation_id":"bf460991-dbb7-491d-aefe-0c7c596b4ab9","resolution":{"observed_at":"2026-08-02T05:20:03.189659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-06T16:38:35.067803Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12705","snapshot_observed_at":"2026-08-02T05:20:03.280286Z","title":"Audiojudge: Un- derstanding what works in large audio model based speech evalu- ation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.280286Z"},"links":{"cited_paper":"/paper/2507.12705","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:a63cb1c49da774839d0f22e0f55a825a2434936ec060f8124eafabf6801accb2","observation_id":"b988b51f-4411-49b7-b030-50c369e351cb","resolution":{"observed_at":"2026-08-02T05:20:03.280286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.382877Z","title":"Audio-aware large language models as judges for speaking styles,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.382877Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:801f1feb18c6cedc71398fb89cefab4ab503307843bbd8e052f5d3a0d0ff5faf","observation_id":"fcfb353f-9297-47b6-a57a-556b13f36469","resolution":{"observed_at":"2026-08-02T05:20:03.382877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16381","last_updated":"2025-06-19T15:08:01Z","snapshot_observed_at":"2026-08-06T23:41:05.433184Z","submitted_at":"2025-06-19T15:08:01Z","title":"InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16381","snapshot_observed_at":"2026-08-02T05:20:03.452297Z","title":"Instructttseval: Benchmarking complex natural-language instruction following in text-to-speech systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.452297Z"},"links":{"cited_paper":"/paper/2506.16381","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:46931ab0860c4b73d45da2fadd9ea97b282fac0b384d3dc37f052eff3a8a6de0","observation_id":"2cc58875-3fa4-4603-9419-b2cabe24bced","resolution":{"observed_at":"2026-08-02T05:20:03.452297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.583905Z","title":"Audioeval: Automatic dual-perspective and multi-dimensional evaluation of text-to-audio-generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.583905Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:c360165940005d1a1fcb5dc0f64f5a3bb545ab6b2aa5226a8e25da9b48416014","observation_id":"ddab289b-5042-4030-a525-02d0dc13abbd","resolution":{"observed_at":"2026-08-02T05:20:03.583905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.689733Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.689733Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:e51ca4d3584dcb01446c39959ea63608cf4e3db85c10628dd377b1d273d7d751","observation_id":"0a5ecb1b-92f2-4fb1-8830-1452c7d0a9d3","resolution":{"observed_at":"2026-08-02T05:20:03.689733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.790811Z","title":"Audiotime: A temporally- aligned audio-text benchmark dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.790811Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:ebbf282c5212c4fdd7408c06fbf7f06c539243db0375d5b0eef4ea1f9687054a","observation_id":"1c71ab8d-13c3-487b-afad-0214601ac569","resolution":{"observed_at":"2026-08-02T05:20:03.790811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:20:03.868153Z","title":"ESC: Dataset for Environmental Sound Classifi- cation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:03.868153Z"},"links":{"citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:ff43cc9fc2410c42c8f678c2e312c57651e3b3057a85dfe43a836cdd0f45878e","observation_id":"fc05b91d-98ce-4a16-b5c4-cc609a2bd884","resolution":{"observed_at":"2026-08-02T05:20:03.868153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-05T04:45:50.000663Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2607.13408."}