{"as_of":"2026-08-05T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1feb349dfc3c2da0f3b14c275c96da1c8629642527cca4969aee00651b3de70","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:23:20.431056Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:23:16.842205Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05478","snapshot_observed_at":"2026-08-04T11:23:16.842205Z","title":"Large Audio Language Models (LALMs) demonstrate strong abilities in understanding and reason- ing across a variety of tasks involving auditory input such as speech, © 2025 IEEE","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.842205Z"},"links":{"cited_paper":"/paper/2510.05478","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:5af1bd4431ce9314b3d443ab7f2e5dbcc4746bcfa486cdb4c6da18bdc3b95577","observation_id":"88954ec1-b658-48c6-96e2-cf676a9b9362","resolution":{"observed_at":"2026-08-04T11:23:16.842205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05478","snapshot_observed_at":"2026-08-01T10:40:25.936762Z","title":"Aqa-ttrl: Self-adaptation in audio question answering with test-time reinforcement learning.arXiv preprint arXiv:2510.05478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-01T17:31:59.984600Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.936762Z"},"links":{"cited_paper":"/paper/2510.05478","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:428f79f4b64c8bda9de331789f80eeb4f3e59da99042db33cc5a1c0ffda4a6c4","observation_id":"6751f093-cfd9-40b0-8119-0ced94544a48","resolution":{"observed_at":"2026-08-01T10:40:25.936762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.05478/citation-record","integrity":"/paper/2510.05478/integrity","json":"/paper/2510.05478/citation-record.json","paper":"/paper/2510.05478"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:16.702602Z","title":"advantage collapse","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.702602Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:c250b26781a5eca41d9d614b9707ae38885fd4b0e3fe27d57f45df59f61c7833","observation_id":"31a6a2d0-840a-457c-b667-49799b97ceba","resolution":{"observed_at":"2026-08-04T11:23:16.702602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05478","snapshot_observed_at":"2026-08-04T11:23:16.842205Z","title":"Large Audio Language Models (LALMs) demonstrate strong abilities in understanding and reason- ing across a variety of tasks involving auditory input such as speech, © 2025 IEEE","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:16.842205Z"},"links":{"cited_paper":"/paper/2510.05478","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:5af1bd4431ce9314b3d443ab7f2e5dbcc4746bcfa486cdb4c6da18bdc3b95577","observation_id":"88954ec1-b658-48c6-96e2-cf676a9b9362","resolution":{"observed_at":"2026-08-04T11:23:16.842205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.003452Z","title":"𝑟#…RewardsAdvantage 𝐴! 𝐴","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.003452Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:1cd98621f174768f91f5c62a5c1e2ef953bbbbabb820e0e1f3012710461dcb0a","observation_id":"4ab987d7-7b65-4965-87a7-698d29b843c9","resolution":{"observed_at":"2026-08-04T11:23:17.003452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.135795Z","title":"{question}Please choose the answer from the follow- ing options:{choice string}. Output the final answer in<answer> </answer>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.135795Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:1a4f5b4a74dc4f49aa09e74bb28c691333829b3064da808c3e3fa8eb151ff6d4","observation_id":"bdf2ce7f-821e-4f41-bc9f-89f130a6d0ab","resolution":{"observed_at":"2026-08-04T11:23:17.135795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.263471Z","title":"Our framework establishes a closed-loop learning process by generating confidence-weighted pseudo-labels from majority voting to guide policy optimization with GRPO","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.263471Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:63b711a08c73c3be4ba7610f32a27d9b45be8501a0da13397b24ef8346062e9a","observation_id":"316b11d5-8a9e-40db-aa51-15869eabe27d","resolution":{"observed_at":"2026-08-04T11:23:17.263471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-05T08:00:03.744899Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T11:23:17.396777Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.396777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:a8c8c8d5f4e5d55e0bd1746d9db2994068b390785fdf3b1dd904a0d8085169e2","observation_id":"589131f7-a8e1-4d51-9804-9259c77714ec","resolution":{"observed_at":"2026-08-04T11:23:17.396777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.559550Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.559550Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:8d209a97de1ee690497c956c633abae59a9a50cdcb4f404a28d9839045749f1a","observation_id":"24c589b2-21f9-4b24-8e9c-b95b9da91b0f","resolution":{"observed_at":"2026-08-04T11:23:17.559550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.704277Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.704277Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:b7d858c343ea97b2dac7addaf04e5fc4af4cc7b95f3c8c1d1f2af729cf93c2eb","observation_id":"b69095e2-c45c-4a89-b52e-57faec7ab2ac","resolution":{"observed_at":"2026-08-04T11:23:17.704277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:17.776171Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.776171Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:c63e77bec77066e3583ede94771a431250e357f2e7777e093481cfa5f5a27776","observation_id":"0fec4e2b-0834-4458-92cd-27227a7beb4b","resolution":{"observed_at":"2026-08-04T11:23:17.776171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-04T11:23:17.876357Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.876357Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:8257eb9bb611b283b52e493d2760878535c4eeb37f4a0d41ddea1be77c9155bf","observation_id":"f0a6f0d2-4a32-4b43-8924-e64f340f3f43","resolution":{"observed_at":"2026-08-04T11:23:17.876357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T11:23:17.996500Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.996500Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:8ccfd6d1d384e3d9ca6f412b972c4c7dde01070bd117b8ea184143f450d71b60","observation_id":"89840c29-ad96-42f3-868b-da8d84e3413b","resolution":{"observed_at":"2026-08-04T11:23:17.996500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-04T11:23:18.145873Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.145873Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:711f2c0032fd1890e022e5b0fa462697b0e982f1a8bc3aab32969f7b46e28c9f","observation_id":"93cfa4e8-ca69-49d3-8e57-caa48c531417","resolution":{"observed_at":"2026-08-04T11:23:18.145873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-07-06T20:52:37.081347Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-04T11:23:18.440292Z","title":"Reinforcement learning outperforms supervised fine-tuning: A case study on audio question answer- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.440292Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:b7c240a5c6566119f0012c85030494dbad20fa93e5324b3b905f9325c0cdc244","observation_id":"513d9acc-d37d-431a-9187-d31604016403","resolution":{"observed_at":"2026-08-04T11:23:18.440292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:18.597964Z","title":"Omni-r1: Do you really need audio to fine-tune your audio llm?,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.597964Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:1e1f1cf3e3d508cbcd387caae17da0fe56088773634d6dde6148fa675102fbb9","observation_id":"a186adcf-1b91-40f4-8702-c0d913298660","resolution":{"observed_at":"2026-08-04T11:23:18.597964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-04T11:23:18.772322Z","title":"Ttrl: Test-time reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.772322Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:bd1fd74e9285bba8ec5985b61029c15d3315de1c6b5d26d4f8da45cbe1d19d38","observation_id":"bcb41631-a86a-47b7-a51d-857cad3553ce","resolution":{"observed_at":"2026-08-04T11:23:18.772322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T11:23:18.925637Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:18.925637Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:827d3e8c110d905ca46c1724a6fa8432299e34b86789d1f8dc8691df56628c9e","observation_id":"2d3bb884-ac91-4cdb-8693-dbc4baaa8db6","resolution":{"observed_at":"2026-08-04T11:23:18.925637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T11:23:19.056503Z","title":"Deepseek-r1: Incentivizing reasoning ca- pability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.056503Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:44b29de9b06fd220ca629ae2bbda09c5545553604e138879405b6220d80a16f2","observation_id":"0110b7e2-d07c-4589-b4cf-4ab7830a3201","resolution":{"observed_at":"2026-08-04T11:23:19.056503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-04T11:23:19.218335Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.218335Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:e4305e0c6216365300679aecc91fb37b9bd75be7545cefd6ccdc020322b679a2","observation_id":"8424f054-81a8-4cd0-8309-8e0bf1930b9c","resolution":{"observed_at":"2026-08-04T11:23:19.218335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-04T21:45:55.994640Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-04T11:23:19.304868Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.304868Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:6ebb9b34fb895b4c10735f27549019691d43533c0bf9a092fd22e41168ea3466","observation_id":"f721397d-e7b9-4569-98c5-5247d43af320","resolution":{"observed_at":"2026-08-04T11:23:19.304868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-04T11:23:19.414877Z","title":"Mmsu: A massive multi-task spoken language understanding and rea- soning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.414877Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:d9fdb31181c34d972c662431c7d817dab2916879569efc85e3f96b445b821f21","observation_id":"b2cef981-2ec9-4d57-ad06-77b058848d37","resolution":{"observed_at":"2026-08-04T11:23:19.414877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.542550Z","title":"Desta: Enhancing speech language models through descrip- tive speech-text alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.542550Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:7f4575910704715e3c0cb99670615d5979b8b83af3258f3a758403d9344c6c02","observation_id":"ef63f2d9-aef0-4e24-8243-9876e2f2ab91","resolution":{"observed_at":"2026-08-04T11:23:19.542550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.717992Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.717992Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:07e8c8ddba2fa1cb4f457aefed2ff4b2faca9a83cfdad9a0307992d7fa152a51","observation_id":"704371f3-759e-4cf2-8beb-2747351e0162","resolution":{"observed_at":"2026-08-04T11:23:19.717992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:23:19.880966Z","title":"Desta2.5- audio: Toward general-purpose large audio language model with self-generated cross-modal alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:19.880966Z"},"links":{"citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:b0dbb2864f1bfd1a25c373d1f4c9b872150d8c30a799da2a5e40ea9ba7fc24ca","observation_id":"513f4a43-d9e6-47ef-96c5-66ec8faf365b","resolution":{"observed_at":"2026-08-04T11:23:19.880966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-07-31T14:59:07.628754Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-04T11:23:20.055373Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty- aware policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.055373Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:73210b0abd21da28a13b3aef441e5bc6d6b5a72bcceb1b7726a2f1bba93cc1d6","observation_id":"fbe99f8e-e2ae-4851-85b9-d275d025b811","resolution":{"observed_at":"2026-08-04T11:23:20.055373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T11:23:20.230179Z","title":"Spurious rewards: Rethink- ing training signals in rlvr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.230179Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:5666e701870e5a0a6ec26d7824b76a6bbf31883d3d0270a6cb6c8809a166c721","observation_id":"c28a2971-a4d6-4140-b04f-4f1f68ed129d","resolution":{"observed_at":"2026-08-04T11:23:20.230179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T11:23:20.346056Z","title":"Self-consistency improves chain of thought reasoning in lan- guage models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.346056Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:731b260ec03f7bab5047ba068fe6379dae0f3683c8f13a3cbc0230cb24d52581","observation_id":"62b33e03-d5e7-46f3-a8d3-77a9e3b3abb4","resolution":{"observed_at":"2026-08-04T11:23:20.346056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T11:23:20.431056Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.431056Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:1c1454c6d79e19ed9fca1ebbbe2d6ef395f8a6df4d14201f9c9506719aba26a0","observation_id":"9ada16e7-107a-49cb-adf2-49ca8fd00ad0","resolution":{"observed_at":"2026-08-04T11:23:20.431056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 2 inbound Pith citation observations for arXiv:2510.05478."}