{"as_of":"2026-08-07T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6357c33dcf1428180e39111dfbe75d30334f4bfe8404a643d24d0a8d2b85dd4","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:44:10.480282Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:34:51.502690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.290848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:45.214298Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2604.10065"},"observation_digest":"sha256:561403f3ca8354ce550ce0910214c0a7d2dbcca63f38953b54810525ee82206b","observation_id":"8237213e-27e0-40c7-ae58-b44b0174135d","resolution":{"observed_at":"2026-05-11T07:35:58.767529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2605.01766","last_updated":"2026-05-03T07:58:02Z","snapshot_observed_at":"2026-07-31T08:00:39.590873Z","submitted_at":"2026-05-03T07:58:02Z","title":"Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:27:23.591345Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2605.01766"},"observation_digest":"sha256:c709c06f5716d132b4de5548e082d838463cec21d31574d8e9a98d8b6b0d27b6","observation_id":"8aa52196-d75d-46e4-9250-f63e15d51196","resolution":{"observed_at":"2026-05-11T10:31:01.691407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2606.13441","last_updated":"2026-06-11T15:03:48Z","snapshot_observed_at":"2026-08-07T13:54:11.075633Z","submitted_at":"2026-06-11T15:03:48Z","title":"Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:09.694757Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2606.13441"},"observation_digest":"sha256:2c05806a94d653a64b934f40fb724136b561c001e8ce390e2b9637f1b602efb1","observation_id":"a2fc1a32-6337-4012-a4a2-3f9d151564ee","resolution":{"observed_at":"2026-07-03T14:18:23.018846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2606.23052","last_updated":"2026-06-22T09:03:45Z","snapshot_observed_at":"2026-08-06T21:15:13.417668Z","submitted_at":"2026-06-22T09:03:45Z","title":"CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T07:28:54.731659Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2606.23052"},"observation_digest":"sha256:b25facb1de01dd20a3e27d28815999f42c05470b58d0ad845d57c20b9a17ff5e","observation_id":"983188d8-d3a3-4f27-a65d-bbddca97c210","resolution":{"observed_at":"2026-07-04T11:59:50.295932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:f8b2b5ead668b63293e8a067a8243096e6843366d8265f025fe2d920c4eecdd6","observation_id":"ed5100fd-7b10-490a-887b-713eabcd402a","resolution":{"observed_at":"2026-07-02T17:07:12.164987Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-08-04T04:34:51.502690Z","title":"Available: https://arxiv.org/abs/2506.07233","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:51.502690Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:a2062c99f09db7e5a9fa3715d88eaf69228ef7418ee9edf15d5d4fa6d9d12b2e","observation_id":"0bf97c73-03b4-4a5b-b749-61af2cdd2805","resolution":{"observed_at":"2026-08-04T04:34:51.502690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07233/citation-record","integrity":"/paper/2506.07233/integrity","json":"/paper/2506.07233/citation-record.json","paper":"/paper/2506.07233"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:44:04.142125Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.142125Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:bc93b86564abc2bf9760c11cdc42eea441d8c769a6387ff2b940e3509e945af2","observation_id":"c8c6e7f9-d75f-4df7-b1fa-cdae18da419c","resolution":{"observed_at":"2026-08-07T05:44:04.142125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T05:44:04.240396Z","title":"Instruction tuning with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.240396Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:f4af14c50077b2ec6cf0c95c3549d649e61ee2e6c6d145c3225ff80af3885770","observation_id":"e08edad2-7c11-4f0f-9dec-6f9f3b287697","resolution":{"observed_at":"2026-08-07T05:44:04.240396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:44:04.396173Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.396173Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:1d7f820e85e4f21310b54b03981d174e57cd6341f7aae778e5c57215a12009f5","observation_id":"184adbf7-613d-4dc4-bec7-810e569f549c","resolution":{"observed_at":"2026-08-07T05:44:04.396173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:44:04.530317Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.530317Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:db2247704f1509b6ac8aec062f48b04515740a242dee746c6e9df4cca1f7142c","observation_id":"ac81100f-3189-4368-a34d-4d775c209d89","resolution":{"observed_at":"2026-08-07T05:44:04.530317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:44:04.678145Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.678145Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:e8b731e5b3abe5140e433e667b88795ba2308ea241a846609008f1a94088facc","observation_id":"0a48ea81-f1b3-4869-ad69-65d02e2956a7","resolution":{"observed_at":"2026-08-07T05:44:04.678145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:04.819666Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.819666Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:2a8275ba62c328da66f2aabbf13d7fa4f222f31e26c797c06db481a97d9a101a","observation_id":"0b6baaa9-bbf9-4aac-9490-ef1253d8dab1","resolution":{"observed_at":"2026-08-07T05:44:04.819666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.952445Z","title":"The revolution of multimodal large language models: A survey,","venue":null,"work_id":"ea93dfbb-54be-442e-b6f6-2c593f010d8b","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.979142Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:70789e1e8ea98346a85b1067f6bca270d154c613c444700168e1b43a567a6933","observation_id":"d0efa4cd-ef80-48c2-b7e1-331e26453892","resolution":{"observed_at":"2026-08-07T05:44:17.069091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.678635Z","title":"MM-LLMs: Recent advances in MultiModal large language models,","venue":null,"work_id":"002de0f8-3081-49ce-9d99-57c5be6d711a","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.121093Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:70b5cf3e5d02433aa5978a428eba50dee247136f54f73413c325e2b9c86b2ac0","observation_id":"aec49515-d614-4fbc-962b-f675cc95d08c","resolution":{"observed_at":"2026-08-07T05:44:16.797828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.395036Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":"5a5d5cb7-fb82-462b-8f41-fac57554eea7","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.242153Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:a5d1720d403174613b1708224e716d59bb3519537c5b4826f576e7cdd87fb264","observation_id":"7254b5ee-ff5d-4faf-aff2-834ce2265a28","resolution":{"observed_at":"2026-08-07T05:44:16.553431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.113665Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"e7b0ea9a-ccb9-4daa-a577-607a8b0d6c9a","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.393012Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:2bfcaa90b2deaeb734e3f697e21090781fe34edb1aeaaaab5e7c60c35c587ee1","observation_id":"1f2d2bf2-d587-4c56-93ad-6385531df8ce","resolution":{"observed_at":"2026-08-07T05:44:16.254955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.821027Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"cdfa5103-46a0-40a4-8dca-dc28ce40d121","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.493382Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:d09b7d62c14d9985bb79fb1828f6106cfc81d59791ce658133e174e8bd96853f","observation_id":"b171b459-d399-4978-a7c5-70aa1432a23b","resolution":{"observed_at":"2026-08-07T05:44:15.985147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.508698Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":"3722bdbf-0c21-4368-ba0f-982237bab31a","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.645453Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b1376449984096b94796f00c2356bd8d780499870f7b28a2396f0cb939edc9c3","observation_id":"db89d6af-be38-4804-96b6-5c05a4d4f929","resolution":{"observed_at":"2026-08-07T05:44:15.624731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.242697Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities,","venue":null,"work_id":"27cb0815-d566-465d-84a6-90d188dc221f","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.893989Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:7f8309a6edb55f0e1aed946620e97b22f104e5f25eb8878e56c3b42dae2eba81","observation_id":"6d199855-642a-4599-9749-1137bc1b1cd0","resolution":{"observed_at":"2026-08-07T05:44:15.365846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-07T05:44:06.217467Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.217467Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:d0bcbde35dd03aa16bf4ed4e90a037efa1cc91b04e014249614a5d9b3a23bb61","observation_id":"823d1c69-6970-4ba7-b0a1-5ed8a329b4bc","resolution":{"observed_at":"2026-08-07T05:44:06.217467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.900109Z","title":"Dynamic-superb: Towards a dynamic, collaborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"7cf44e96-4478-4c4b-9c59-f50483428c81","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.317775Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:4345b4ef100a0a223973ed112aa952396cd3204012c963dc696d5967a97b1273","observation_id":"b1802c34-c9ff-409e-867a-8add9b25d91a","resolution":{"observed_at":"2026-08-07T05:44:15.056184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.566443Z","title":"Dynamic-superb phase-2: A collabo- ratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"e850511f-54b5-46de-ad62-6c76b91e2692","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.522350Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:461af0691e6589a567f0ab038615cc8109c8939fe51bd7a295edd1d748daf7fa","observation_id":"e7566184-2b90-4bde-a94e-8662c15552ec","resolution":{"observed_at":"2026-08-07T05:44:14.750706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.278717Z","title":"MMAU: A massive multi- task audio understanding and reasoning benchmark,","venue":null,"work_id":"216e4a5f-6650-480b-b060-5e770d36c96f","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.721828Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b4699c5b86b2ee9aae90452ccfff2f752cbcb70d7295c36ee3e1794f5fd35e5e","observation_id":"f5d8ecca-a513-461f-9792-b84d89d54f4a","resolution":{"observed_at":"2026-08-07T05:44:14.472031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13237","last_updated":"2025-08-24T16:09:17Z","snapshot_observed_at":"2026-08-07T15:43:08.088135Z","submitted_at":"2025-05-19T15:20:32Z","title":"SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13237","snapshot_observed_at":"2026-08-07T05:44:06.889837Z","title":"Sakura: On the multi-hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.889837Z"},"links":{"cited_paper":"/paper/2505.13237","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:af4c05f77147c07a56513bb03d24a094bdec904b5c4934a35fa064df0a8be41f","observation_id":"3d7972e2-000d-4c3b-9f50-2eb310168e9e","resolution":{"observed_at":"2026-08-07T05:44:06.889837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.979089Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":"9aa15c41-af59-4c4b-9fe9-c25c9148f371","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.031629Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:6593f011d6b8b2421be98843e7f7d243931aa1cc0b3c31dd27484e191d8b52fd","observation_id":"1ad376c4-3a8e-4981-8ca3-f65ffccfa198","resolution":{"observed_at":"2026-08-07T05:44:14.120800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-07T05:44:07.174236Z","title":"V oicebench: Benchmarking llm-based voice assistants,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.174236Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:de0317957f2f9d4becc1e25c6837cc5b24da050fe4c05099672429daa6a520de","observation_id":"1a60aa09-09cb-4f01-bf86-b41c558d1563","resolution":{"observed_at":"2026-08-07T05:44:07.174236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15957","snapshot_observed_at":"2026-08-07T05:44:07.316429Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.316429Z"},"links":{"cited_paper":"/paper/2505.15957","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:ca1c6943a22b069d85feed48dc357ed7159389538a2ca5bbdcdb429c1615f5cd","observation_id":"52077cfc-9568-4d9a-bf7a-25679a339079","resolution":{"observed_at":"2026-08-07T05:44:07.316429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.668068Z","title":"Understanding sounds, missing the questions: The challenge of object hallucination in large audio-language models,","venue":null,"work_id":"c1e41f9b-821c-4ce6-997e-160d2130245c","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.497114Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:f25d07b1dc72b1eaf278a0a8ddcc617e8c15b7bec5c230b98a4152849d0bd287","observation_id":"0a48afa0-23b6-4359-9da7-08509f48dce4","resolution":{"observed_at":"2026-08-07T05:44:13.802778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.410015Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":"8f3ada1e-c6f6-4611-9a40-3ef83681b259","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.618388Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:cfed049b9b7c60838a75fa8d124e1e12e8422a8ad5f75d70b1b908e0deace22c","observation_id":"6b2894a5-19ad-4c90-9e73-2d80437de48a","resolution":{"observed_at":"2026-08-07T05:44:13.555784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:07.752500Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.752500Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:a55be6595d642ff93eed24d5fba3257a0d3035f4bf134ea7a2c6ec189d61a710","observation_id":"3bd44b3a-78b3-43ed-a2ae-99b561c35359","resolution":{"observed_at":"2026-08-07T05:44:07.752500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-07T05:44:07.897650Z","title":"Siren’s song in the ai ocean: A survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.897650Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:2f38164f2d923733f699e715380d3f0fa70dc401710504e4d3afa6447fbefb8e","observation_id":"17bf85ea-edd6-4bdb-a121-c74c51228da2","resolution":{"observed_at":"2026-08-07T05:44:07.897650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05922","snapshot_observed_at":"2026-08-07T05:44:07.998750Z","title":"A survey of hallucination in large foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.998750Z"},"links":{"cited_paper":"/paper/2309.05922","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:dbafe1eece23e1fa9f564d8b873dc8ccd58ee94f22c3108ca41fb4bb1c02f342","observation_id":"bbb01081-e6b5-4ceb-833a-0f4870c5e6ea","resolution":{"observed_at":"2026-08-07T05:44:07.998750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.082232Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":"45ea2dd4-cfae-4cca-8051-5157515c811f","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.165867Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:144d9e1aaf52ac2bfa215bf27c03fa407c8dce62b32296444ad5d9dabada792d","observation_id":"0752f688-02e4-4722-b11c-67835028a411","resolution":{"observed_at":"2026-08-07T05:44:13.256680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19037","last_updated":"2025-05-25T08:37:55Z","snapshot_observed_at":"2026-08-07T14:19:09.036755Z","submitted_at":"2025-05-25T08:37:55Z","title":"Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19037","snapshot_observed_at":"2026-08-07T05:44:08.447266Z","title":"Speech-ifeval: Evaluating instruction-following and quantifying catastrophic forgetting in speech- aware language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.447266Z"},"links":{"cited_paper":"/paper/2505.19037","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:0d95f045ca4c4dd4481a04b5b81a66b8eb9d47d5ab361c58a3c9b46a683566b8","observation_id":"b1951685-0dca-4ca2-a233-c7ecd738c91f","resolution":{"observed_at":"2026-08-07T05:44:08.447266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.330522Z","title":"Available: http://dx.doi.org/10.1145/3703155","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.330522Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:618854ebfae75e48530f53eb648ac1ca14c9691efa2fc5c9282a9f9c418ea046","observation_id":"d743b7d7-4b1a-47e7-ae83-a56c69dca409","resolution":{"observed_at":"2026-08-07T05:44:08.330522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.748512Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.748512Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b9215e88360c35e409bda7a8b9ba9fc6bff5676497e5f7933471762b46374796","observation_id":"134ae7fa-c790-4b67-994a-2ca2ccc3e0b0","resolution":{"observed_at":"2026-08-07T05:44:08.748512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.799244Z","title":"Trusting your evidence: Hallucinate less with context-aware decoding,","venue":null,"work_id":"1c8c97ed-0dcb-4a13-a55c-83d05bf7a172","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.615390Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:0bca2da1a1ef8a6cad120c9dbc937fdf7983ddb9f26f3204646f4bec341a2005","observation_id":"14eb1a3e-e660-4a27-9f9c-e61542d76ad9","resolution":{"observed_at":"2026-08-07T05:44:12.935278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.530433Z","title":"Contrastive decoding: Open-ended text generation as optimization,","venue":null,"work_id":"3136a483-2083-4f1d-bb44-f687824044c4","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.068216Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:01370c6ab553b25687d4bcf1de5883ada762049ccdac5f2b564cfe4358645dcb","observation_id":"54904445-7f21-4cbd-a2b6-0783433a9b68","resolution":{"observed_at":"2026-08-07T05:44:12.664636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.923088Z","title":"Retrieval-augmented generation for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.923088Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:d0164c2de9d6cd0f080b4569461d4991b06bbd8c1f287e4d002c5cb5357d6530","observation_id":"262bf6ce-c372-422f-81dc-dcea2c5d9779","resolution":{"observed_at":"2026-08-07T05:44:08.923088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.963668Z","title":"Qwen2-audio technical report,","venue":null,"work_id":"0e457ae2-bf3c-4891-a115-0390a27979f2","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.342799Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:a19f386cf61e393f03d70a46d6ca7bc5cd656a750cfcf19635e92a02a6adc8c0","observation_id":"7632c80a-be19-4bd3-a261-7e522a73c7b7","resolution":{"observed_at":"2026-08-07T05:44:12.083649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.195339Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"34a68554-2288-47c0-8492-95e836ed4910","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.199554Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:c842b38714103c0552b1c2fcdc827ff88117e5f201fc9a7921a6e52dd6482e1e","observation_id":"ee45edca-8577-4179-b1b0-ba3931e83d89","resolution":{"observed_at":"2026-08-07T05:44:12.386040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05825","last_updated":"2025-02-09T09:16:42Z","snapshot_observed_at":"2026-08-02T19:48:16.390917Z","submitted_at":"2025-02-09T09:16:42Z","title":"Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.05825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05825","snapshot_observed_at":"2026-08-07T05:44:10.706300Z","title":"Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models","venue":"cs.CL","work_id":"3ada83eb-31a3-413b-9678-8de2c67db7f9","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.718208Z"},"links":{"cited_paper":"/paper/2502.05825","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:35fa2355e9dc4825e398be975741cfd36b88bc0e7e8927f575cf5ee76c041c33","observation_id":"991af41e-6448-4256-ac9f-4dcd6a0e199b","resolution":{"observed_at":"2026-08-07T05:44:10.787886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-07T05:44:09.865978Z","title":"Contrastive decoding: Open- ended text generation as optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.865978Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:ab456945c080318338b8f9f76b239d0ee406208fdc63301ef04d2c47dd7f6033","observation_id":"bb6b8b00-07c7-46d2-bbbb-941342f9d5c1","resolution":{"observed_at":"2026-08-07T05:44:09.865978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.629329Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering,","venue":null,"work_id":"938dd55f-65d9-457e-9b81-90525accba6d","year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.615352Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:efb21eae3094fe308e667b7c42d5815f8bbb19a7b1b53e745a939f8180aee517","observation_id":"629d1fe7-226f-46c4-8825-3020383852ab","resolution":{"observed_at":"2026-08-07T05:44:11.772062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.071160Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":"76090682-c410-4793-8dc0-56bb4c0814ef","year":2019},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.173732Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:6560c41969b3a3abde39babf6137e09a8bbeb76cfaec528efc017e73e1f60228","observation_id":"fe184b44-dd6c-4ace-8173-1840c999fcaa","resolution":{"observed_at":"2026-08-07T05:44:11.206873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09634","last_updated":"2022-06-17T07:35:08Z","snapshot_observed_at":"2026-07-06T13:02:09.425556Z","submitted_at":"2022-04-20T17:28:53Z","title":"Clotho-AQA: A Crowdsourced Dataset for Audio Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09634","snapshot_observed_at":"2026-08-07T05:44:10.346543Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.346543Z"},"links":{"cited_paper":"/paper/2204.09634","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:f4d8be75512fdb1b32ba60c7afeae500be2c5aaafd2527b6f6bd80ae21f064f2","observation_id":"1e7ea3ef-2c95-4110-9f67-0acd3a1aa40b","resolution":{"observed_at":"2026-08-07T05:44:10.346543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.311667Z","title":"Finetuned language models are zero-shot learners,","venue":null,"work_id":"7842c9ca-5131-4871-8852-8212728fa902","year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.965594Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:fd7ba49f9059b35bd8c040792727b851ed0d0a42d1c18358cb7aab2d2b4ba60d","observation_id":"16a51123-4f39-4942-8da8-be53c942bfc7","resolution":{"observed_at":"2026-08-07T05:44:11.497941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-07T01:32:56.463682Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-07T05:44:10.480282Z","title":"On the audio hallucinations in large audio-video language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.480282Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:9a922fb3622d12f9fdd6014a6159fffe85483d5f0102d9fd1606c6f64a9cc7a6","observation_id":"35dd95bc-b865-4e6f-820e-d04d7078e991","resolution":{"observed_at":"2026-08-07T05:44:10.480282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T05:44:09.465678Z","title":"Available: https://arxiv.org/abs/2407.10759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.465678Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:60b64de23443f8ae117f588415cc218c20a846ae2325490065dd7585c2142340","observation_id":"75023eb3-f5b6-4b5b-82a1-df13a24d6c4a","resolution":{"observed_at":"2026-08-07T05:44:09.465678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T05:44:06.028974Z","title":"Available: https://arxiv.org/abs/2503.03983","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.028974Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:fec1f825460b7c17d0c3fc6deded9dc450d9be6bc935f26e8c4aab1508f09871","observation_id":"faaf1430-0060-4ed1-99b9-2e4d8b354f35","resolution":{"observed_at":"2026-08-07T05:44:06.028974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T05:36:29.553874Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 6 inbound Pith citation observations for arXiv:2506.07233."}