{"as_of":"2026-08-22T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82d208a2a932e4c46f32d968a7150d544e55e00d64fa023eecaebfe3f5e7aa84","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:40:25.940622Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20166/citation-record","integrity":"/paper/2607.20166/integrity","json":"/paper/2607.20166/citation-record.json","paper":"/paper/2607.20166"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13115","last_updated":"2025-05-19T13:46:35Z","snapshot_observed_at":"2026-08-18T09:45:48.135690Z","submitted_at":"2025-05-19T13:46:35Z","title":"Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13115","snapshot_observed_at":"2026-08-01T10:40:25.870899Z","title":"Benchmarking and confidence evaluation of lalms for temporal reasoning.arXiv preprint arXiv:2505.13115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.870899Z"},"links":{"cited_paper":"/paper/2505.13115","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:711abd7343703451437ddbe6312593e3cfb04a36b4b62cf67bb9cbfc274a8c01","observation_id":"592cc0c8-1bcf-43e5-bbb7-9ba80a2972ea","resolution":{"observed_at":"2026-08-01T10:40:25.870899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-08-11T08:01:37.262348Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-01T10:40:25.881784Z","title":"Minicpm-o 4.5: Towards real-time full-duplex omni-modal interaction.arXiv preprint arXiv:2604.27393,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.881784Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:cb2f2ece9a7ce4598174965abe39f6ad81d30a60d9f9de815678793fe4843359","observation_id":"370586df-40cc-4efa-b777-f9a491e488a4","resolution":{"observed_at":"2026-08-01T10:40:25.881784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.887648Z","title":"Visplay: Self-evolving vision-language models from images.arXiv preprint arXiv:2511.15661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.887648Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:299d14830de1615dde72a576ef1fcccf639c2e6684c97d9a215ab6c53d95786e","observation_id":"6c96c274-9eb9-4085-849a-a5c4f52338d5","resolution":{"observed_at":"2026-08-01T10:40:25.887648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-01T10:40:25.890871Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.890871Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:efe7bb5df103824918bf36815f79d6685ac5855d3c0eac8b04d5efe4c68f2f0e","observation_id":"fc197c8c-d538-4e0f-b32b-15e76bae5ea2","resolution":{"observed_at":"2026-08-01T10:40:25.890871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13992","last_updated":"2025-08-19T16:33:49Z","snapshot_observed_at":"2026-08-19T07:19:53.763108Z","submitted_at":"2025-08-19T16:33:49Z","title":"MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13992","snapshot_observed_at":"2026-08-01T10:40:25.893951Z","title":"Mmau-pro: A chal- lenging and comprehensive benchmark for holistic evaluation of audio general intelligence.arXiv preprint arXiv:2508.13992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.893951Z"},"links":{"cited_paper":"/paper/2508.13992","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:39073f04422bfac56a3efe2cb0336eb5458c6ea8e0fb2750f13da0db24508136","observation_id":"db2dece3-a474-4384-933b-90fc9997a4e1","resolution":{"observed_at":"2026-08-01T10:40:25.893951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-16T12:50:05.916488Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-01T10:40:25.897788Z","title":"Reinforcement learning outperforms supervised fine-tuning: A case study on audio question answering.arXiv preprint arXiv:2503.11197,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.897788Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:42be3d6b032f832d82d7f96949679e514271fd60a6f0cf6d6fff1c565f0020ee","observation_id":"5924d362-6311-4e55-906c-f7e5c3a8e008","resolution":{"observed_at":"2026-08-01T10:40:25.897788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.901360Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning.arXiv preprint arXiv:2506.24119, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.901360Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:84e85b6a8e405ae0b6f63cbca82d5e21a4e7e7229e047a86c1cfbbf8a8fc7762","observation_id":"181d56f9-4e1d-42aa-bf9b-f1cf57ac083f","resolution":{"observed_at":"2026-08-01T10:40:25.901360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-01T10:40:25.903803Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark.arXiv preprint arXiv:2410.19168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.903803Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:aad1b012f977a75ecfd61ce6ebeb1bbe04087c169db5d5cfedc8413526aabbfe","observation_id":"8135aef0-bdd2-4814-9e97-2451bffa676e","resolution":{"observed_at":"2026-08-01T10:40:25.903803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T10:40:25.906733Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.906733Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:1adcdea920dcf0c2d59396abc8cfbb23d50197c5301cfa29abcd65803a534c7a","observation_id":"2a201464-23cb-4b0c-a63f-bc6bc9e4ed20","resolution":{"observed_at":"2026-08-01T10:40:25.906733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.909339Z","title":"Can speech llms think while listening?arXiv preprint arXiv:2510.07497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.909339Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:7495c60526b0ba1958a2bab5016eeb8fc0ec26bb19e6fe4122a99033988484cc","observation_id":"d7c1d744-ed98-43e1-b926-9227f81be223","resolution":{"observed_at":"2026-08-01T10:40:25.909339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.912584Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.912584Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:9d8f054dfee33e20ac0d1c924301f2f08487160db947fec088ae5a243d7aab08","observation_id":"7c5a4885-3cc0-4171-99a7-266986784d2a","resolution":{"observed_at":"2026-08-01T10:40:25.912584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-01T10:40:25.915711Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.915711Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:5bc35de254335bf96049ee1c7b01e8dfe03728d01c768601cb78a3b9fd6b2141","observation_id":"e88fcc04-f999-4af0-baa1-b380b00b4370","resolution":{"observed_at":"2026-08-01T10:40:25.915711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.920896Z","title":"Emotion- thinker: Prosody-aware reinforcement learning for explainable speech emotion reasoning.arXiv preprint arXiv:2601.15668,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.920896Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:513881ee0cdac3f10206a4e0054a3d3477e30d41f9b8165329e25a1b6e7847ad","observation_id":"6f0549ba-ab6f-4375-8d8a-1f07ed819873","resolution":{"observed_at":"2026-08-01T10:40:25.920896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.923609Z","title":"Vision-zero: Scalable vlm self-improvement via strategic gamified self-play.arXiv preprint arXiv:2509.25541, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.923609Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:d84318828d5505e8c10b8f1d9b6e5ead0ace271a58cd378efc67c0bf8822b26c","observation_id":"d83a353f-3aaf-4cc8-b0c2-97dc00bd9bec","resolution":{"observed_at":"2026-08-01T10:40:25.923609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T10:40:25.926154Z","title":"Genius: A generalizable and purely unsupervised self-training framework for advanced reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.926154Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:c070d224691d4392497c81dc8e47a7a8bbbfae0b62b2544ace9e799cc38c71ad","observation_id":"a84d212c-93e7-43a9-bf2a-459438127293","resolution":{"observed_at":"2026-08-01T10:40:25.926154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.929340Z","title":"Spell: Self-play reinforcement learning for evolving long-context language models.arXiv preprint arXiv:2509.23863, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.929340Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:123a704437fa77bb56f92588d660a5a79721708c4aedb7b23dffda34ed9363cc","observation_id":"57dbc71f-bea7-413d-ad3c-41516d32857d","resolution":{"observed_at":"2026-08-01T10:40:25.929340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-17T22:31:14.618678Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05478","snapshot_observed_at":"2026-08-01T10:40:25.936762Z","title":"Aqa-ttrl: Self-adaptation in audio question answering with test-time reinforcement learning.arXiv preprint arXiv:2510.05478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.936762Z"},"links":{"cited_paper":"/paper/2510.05478","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:1591ff904fb3231deb876d345eaf8d9394b775bd5323c3d7b529e641e981ae86","observation_id":"6751f093-cfd9-40b0-8119-0ced94544a48","resolution":{"observed_at":"2026-08-01T10:40:25.936762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.940622Z","title":"We treat the chosen and rejected audios as an audio contrast pair (aref , avar)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.940622Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:10a68b4057bbf427e5dd431f697ac8224d6b380dc4cf3dc71711279f119a5536","observation_id":"8c4bc8d0-ba15-4f49-8267-24d31f53ef37","resolution":{"observed_at":"2026-08-01T10:40:25.940622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-01T10:40:25.933165Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot.arXiv preprint arXiv:2412.02612,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.933165Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:83ce675e5be336d92988ac6f8918944874d53cbd1a71c649426cb409bda6353f","observation_id":"ebb9399c-db7c-4ad2-a17d-9402744aee6b","resolution":{"observed_at":"2026-08-01T10:40:25.933165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.884823Z","title":"Incentivizing consistent, effective and scalable reasoning capability in audio llms via reasoning process rewards.arXiv preprint arXiv:2510.20867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.884823Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:9af4fa2939892fc2891567ad0fa586a954de435c85d89addd4c71f2dd588f682","observation_id":"9a3897d3-6906-4378-925d-6e2ecde66d6b","resolution":{"observed_at":"2026-08-01T10:40:25.884823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-01T10:40:25.877689Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.877689Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:b166748ae6f70dd182b3df1ada2bb4e3be110025dd3b183bc4c03b68d81c4ee2","observation_id":"3125e7d7-0f57-4742-88d6-3ef66a0012b2","resolution":{"observed_at":"2026-08-01T10:40:25.877689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-19T08:48:56.371619Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-01T10:40:25.874679Z","title":"Self-play fine-tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.874679Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:5da1e3f07fe31e35ab1ef015c410d639cc92f5310be77f0d5c9abbe0df86f786","observation_id":"8200c25c-853e-43bf-bc2e-27fd8bdcd96a","resolution":{"observed_at":"2026-08-01T10:40:25.874679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:40:25.918429Z","title":"Game-rl: Synthesizing multimodal verifiable game data to boost vlms’ general reasoning.arXiv preprint arXiv:2505.13886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.918429Z"},"links":{"citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:497f3867722259c4a094f747c481e8b129bae322a6a8951a5207e0d35889cbe5","observation_id":"d9c5e5d8-0658-4001-9652-35f4f55975a1","resolution":{"observed_at":"2026-08-01T10:40:25.918429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T07:58:44.884937Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.20166."}