{"as_of":"2026-08-06T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1856ff2e5dbc0556260b6c0d41252e16752e289b13bee3be211d4849f6366aab","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:37:34.810212Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18718/citation-record","integrity":"/paper/2607.18718/integrity","json":"/paper/2607.18718/citation-record.json","paper":"/paper/2607.18718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.308928Z","title":"Measuring audio’s impact on correctness: Audio-contribution-aware post-training of large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.308928Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:0e9f4d3fa38209b903632473c4e07536ecd94d2129b189229f1ebc509a5c7ca1","observation_id":"d55b62ab-d7c1-4e1b-87ff-e529d1becfb3","resolution":{"observed_at":"2026-08-01T14:37:31.308928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-01T14:37:31.395557Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.395557Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:55dd66a937aa43e2c7dbda0110130e705d9fbdcfecde79ab140bba92ba73d1ba","observation_id":"6c9b0560-ae65-4a4f-ad63-c1468dd70705","resolution":{"observed_at":"2026-08-01T14:37:31.395557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-04T21:45:55.994640Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-01T14:37:31.517268Z","title":"MMAR: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.517268Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:adf8192b0b128d4bb67e221c8218df2484ee2363760e1cf01cb5d84d87c63cbd","observation_id":"ee5013f1-6efc-402a-b10f-21f3f7de974c","resolution":{"observed_at":"2026-08-01T14:37:31.517268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-01T14:37:31.631868Z","title":"MMSU: A massive multi-task spoken language understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.631868Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:31c062619e89a572604345b5f8e35108ace5bf6417a4e6c5d844f55d0d9e5c4f","observation_id":"86420a57-bfde-4078-acf6-b7c2317dfaba","resolution":{"observed_at":"2026-08-01T14:37:31.631868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.734364Z","title":"Audio-grounded hard-example training with acoustic tagging for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.734364Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:21cd0b3eade3772f2b48bb7b50663044e5c16e8a9cb38276695dba472f07d81e","observation_id":"caa43371-926f-4fe6-86bb-6c9795b76a28","resolution":{"observed_at":"2026-08-01T14:37:31.734364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T14:37:31.859074Z","title":"Qwen3-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.859074Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:8f6dec16dcfdfcf0367664714e2d25fb44a1d44780e5508f6f965ffa08c60a65","observation_id":"9fc619b0-91fc-4d2f-885e-b2ad75ed3cc0","resolution":{"observed_at":"2026-08-01T14:37:31.859074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.950287Z","title":"Fun-Audio-Chat technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.950287Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:4436b1b607d49de1cc56ebae5d42acbbd83d4c0f6e94310e35a63c98c230e3db","observation_id":"475ea974-9a83-4ba5-91a9-a73f8cc0cf54","resolution":{"observed_at":"2026-08-01T14:37:31.950287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T14:37:32.043740Z","title":"Kimi-Audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.043740Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:8f75869c741fba777e3dc5b41c45c0346cf91ce2235e18468d02d0d6ba5126d9","observation_id":"6d8ae40b-9d0f-4b74-b336-ea04cf2fab11","resolution":{"observed_at":"2026-08-01T14:37:32.043740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.130711Z","title":"MiMo-Audio: Audio language models are few-shot learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.130711Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:58c46aea035f10981f6e84ab0b35b635f124c7cfb6576a8de1279407a780db9d","observation_id":"21fa3fce-26cc-4de3-9cf1-592ee6860ae4","resolution":{"observed_at":"2026-08-01T14:37:32.130711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-01T14:37:32.240577Z","title":"Step-Audio 2 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.240577Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:d48daa7b324a8fd139f4f45994063cf9e06b82fd5cd6216063e194074247557c","observation_id":"5442d012-9c64-49a4-a4cb-4496a9f5d386","resolution":{"observed_at":"2026-08-01T14:37:32.240577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T05:21:57.539739Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-01T14:37:32.397890Z","title":"MOSS-Audio technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.397890Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:daa7c05cdd9c4055b590e51cba0e1b8b1565e79a6cfad41d186f5bab932b13f6","observation_id":"40ce1bda-0752-4599-90f8-53709420fa9e","resolution":{"observed_at":"2026-08-01T14:37:32.397890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T14:37:32.540554Z","title":"GDPO: Group reward-decoupled normalization policy optimization for multi-reward RL optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.540554Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:ee4b522a1e18f3cfca78092df1689cc1c9bf9dee61c59203114c8e9e13c37211","observation_id":"b8049c65-21f1-4c5a-878c-252c59991c2f","resolution":{"observed_at":"2026-08-01T14:37:32.540554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T14:37:32.670256Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.670256Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:a246466b16cd557d30a1b0616028d789fca5940135ddd646214bce428503c152","observation_id":"28fd93b0-c23d-4690-8c25-beb0dfe3ec2b","resolution":{"observed_at":"2026-08-01T14:37:32.670256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.758302Z","title":"Learning from audio-dependency errors: Data curation strategies based on model confusion patterns in audio question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.758302Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:adb299f9a66b33e01bb8ad37c11e0fbc222ab37ebf03e0188c6a4dc4e761f4ec","observation_id":"73ec54cb-45a7-48be-9f3c-55397158d751","resolution":{"observed_at":"2026-08-01T14:37:32.758302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-01T14:37:32.880875Z","title":"QLoRA: Efficient finetuning of quantized LLMs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.880875Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:9a271dadc6b93632f1df6b0ad2d7383d588633c9ca2225b56ea97fef264d8e69","observation_id":"f9977f6a-b611-4b2d-9d33-8fccd3de1de3","resolution":{"observed_at":"2026-08-01T14:37:32.880875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.936859Z","title":"Audio-dependent question answering at the DCASE 2026 challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.936859Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:a1907b1a472ef56f764209398ef525a3f2c6602e6b5abff8fdcee96ac9409018","observation_id":"6695a8bf-fbd2-4001-89c7-a69607266ae9","resolution":{"observed_at":"2026-08-01T14:37:32.936859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.041146Z","title":"Training-free inference- time exploration for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.041146Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:406a3b74ed080349d89e0b9fca8f2e2c9e2383e2b6afeb024ba03163a02bcdbf","observation_id":"e2088954-41f8-434d-9c93-eac1a9e8b4a0","resolution":{"observed_at":"2026-08-01T14:37:33.041146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.166227Z","title":"Selective multi-modal RAG for DCASE 2026 task 5: Audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.166227Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:c4f353bc3673e9653289172396552777256bd74320cffe2f70180385301973e0","observation_id":"4413bec2-677c-496d-aa36-42b47f242e36","resolution":{"observed_at":"2026-08-01T14:37:33.166227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.278290Z","title":"Structured audio reasoning and robust multi- sample inference for DCASE 2026 audio-dependent question answering challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.278290Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:a6121038a64311aef4f548c4a7201e38a8d50da4a4d317c9bd8dd074c184aae8","observation_id":"5e911534-9e50-45ef-b28a-6d6f38b5d204","resolution":{"observed_at":"2026-08-01T14:37:33.278290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.382819Z","title":"DCASE 2026 audio-dependent question answering task,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.382819Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:a6539005672513a23748bb99fc2c84ae557758d467c161393c635f6abd49708d","observation_id":"eabcf770-9df5-4772-9cdb-df6340fdbc84","resolution":{"observed_at":"2026-08-01T14:37:33.382819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.485131Z","title":"Curriculum learning for audio-dependent question answering: Technical report for DCASE 2026 task 5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.485131Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:4563fd024ea7eefaa798d7b8a35cf09c476425b2098ceda8484959af859233f3","observation_id":"1b251d6d-8871-47f2-b7f0-47bd67dc40dd","resolution":{"observed_at":"2026-08-01T14:37:33.485131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.598342Z","title":"Task-leaf routed MiMo-Audio for DCASE 2026 task 5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.598342Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b73568530e2f433bcba4bf5aa8f755980239f884108db0e80190a49fb55b358f","observation_id":"e6ad336a-8f52-4c0c-8cb3-d9e11e8d5664","resolution":{"observed_at":"2026-08-01T14:37:33.598342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.710894Z","title":"Qwen2.5-Omni with all-audio audio-TAH for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.710894Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:266ec6bced64150632692c3c5b9d9e76e325d9f4ca842899fad7b802fd4a5666","observation_id":"cdfde793-6402-41e3-9697-a48b5c90664f","resolution":{"observed_at":"2026-08-01T14:37:33.710894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.824043Z","title":"Fun-Audio-Chat-8B with LoRA fine-tuning for audio- dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.824043Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:ba8636acaa2eb020c6e384cf86983703d76236749ff98d56a747f43f12568410","observation_id":"23caed7c-11b2-4595-92c8-6a6f246be5c3","resolution":{"observed_at":"2026-08-01T14:37:33.824043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.941781Z","title":"GISP@HEU’s submission for DCASE 2026 task 5: A LoRA-SFT fine-tuned audio-dependent question answering system,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.941781Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:dbd58b451faba973a318b3172d295fecec14455818721ae5057e8e45c75450cc","observation_id":"9f6be7a9-8dda-4ea3-9f47-a6c6b5e7f25b","resolution":{"observed_at":"2026-08-01T14:37:33.941781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.065392Z","title":"Audio-dependent question answering with attention-anchored reinforcement learning on MiMo-Audio,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.065392Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:3d03e6b00440ea11d036df2a9359b8f5817a6399331c647a48af340130ac96d1","observation_id":"0ca9fe6c-54f5-4acb-baff-f4fd7aeba8ad","resolution":{"observed_at":"2026-08-01T14:37:34.065392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.159486Z","title":"Audio question answering at the DCASE 2026 challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.159486Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:3a91d0f6b32f2250d456fd36aaa610f69b51b74bc9916b663ec496354fe344a7","observation_id":"66acb3a8-4839-473a-9eb4-eeb71579fce5","resolution":{"observed_at":"2026-08-01T14:37:34.159486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-01T14:37:34.287866Z","title":"Qwen2.5-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.287866Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:64e0f3a015dc17fd48e4831bf321be799461969d220169d10b76701a5ff49be8","observation_id":"21031767-ae98-4ceb-8845-d881f7ac07c0","resolution":{"observed_at":"2026-08-01T14:37:34.287866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T14:37:34.321811Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.321811Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:80862b8ecb40283e2560e334891dc30de9d2951492d0f5362583e962fde9ab3a","observation_id":"7a95ceab-2e4b-49a8-9b75-8d0f1f252c81","resolution":{"observed_at":"2026-08-01T14:37:34.321811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-01T14:37:34.402584Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.402584Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:47d07381ff2f160d9ada6d0a8675b8c03658de64366bc883abc4ef02a01f7e11","observation_id":"2f2c02dd-1ce8-475e-a60d-6b00c2d470a6","resolution":{"observed_at":"2026-08-01T14:37:34.402584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.501710Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.501710Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:d4ddd80c90bcc80c2ac11bc6b626eaf41b4eafe11d78d0f847291e52c6983fbd","observation_id":"035a6d33-64f0-4fec-9fe2-35560b7f139b","resolution":{"observed_at":"2026-08-01T14:37:34.501710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-07-06T09:20:26.283047Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-01T14:37:34.578209Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.578209Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:de766e9e6e7e3df32bfcfd26703d4db587893c670f05666ceba8428b27ec6d97","observation_id":"f0492771-8af9-4cb4-816a-8263055a89cb","resolution":{"observed_at":"2026-08-01T14:37:34.578209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-02T19:54:31.470003Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-01T14:37:34.645956Z","title":"Large-scale Contrastive Language-Audio Pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.645956Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:e1ded04bd22ef7a8d5883d68f0895b47418f5df0b19810b9b2fc079e2ad46470","observation_id":"90cf1a08-98f3-41dc-aeaa-252ff6b00606","resolution":{"observed_at":"2026-08-01T14:37:34.645956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.727468Z","title":"librosa: Audio and music signal analysis in Python,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.727468Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:75ec3082cde9342af22de8ec75d41d412ece854c1e667e56233e67c7cb1bece4","observation_id":"8069a673-dd83-4408-9153-a9f70123ca8a","resolution":{"observed_at":"2026-08-01T14:37:34.727468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-01T14:37:34.810212Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.810212Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:412a1dbac61dec35fa97b91890d4e19dd0acbf19783a3dce9bd703c04824a802","observation_id":"21b9f970-9a5d-43b6-932e-bd504a854b9a","resolution":{"observed_at":"2026-08-01T14:37:34.810212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T11:33:36.189948Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.18718."}