{"as_of":"2026-08-16T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab5d4daa828f295cd51901a941e7da5cf1861abe55987c9b70aa939a1a9d2628","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:58.258118Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T00:48:56.892634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:18:58.373323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"cited_work":{"arxiv_id":"2509.25148","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25148","snapshot_observed_at":"2026-07-03T21:18:58.373323Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","venue":"cs.AI","work_id":"6c0eead3-3aa2-4b5d-ad89-12c8f3faace0","year":2025},"citing_paper":{"arxiv_id":"2606.17735","last_updated":"2026-06-16T09:55:45Z","snapshot_observed_at":"2026-08-06T04:38:28.462018Z","submitted_at":"2026-06-16T09:55:45Z","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T00:48:56.892634Z"},"links":{"cited_paper":"/paper/2509.25148","citing_paper":"/paper/2606.17735"},"observation_digest":"sha256:55586fafdc0133346666f2b2bdfeddf018b82562b83ccce278ab95049399b833","observation_id":"82e3a9ec-f72b-42da-b747-44ef9f62ab08","resolution":{"observed_at":"2026-07-03T21:18:58.374761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.25148/citation-record","integrity":"/paper/2509.25148/integrity","json":"/paper/2509.25148/citation-record.json","paper":"/paper/2509.25148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.790023Z","title":"Harnessing the power of llms in practice: A survey on chatgpt and beyond","venue":null,"work_id":"9323f8db-073a-4070-8b4d-88bf627ffb51","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.061817Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:77ca58230709a74b4a3e00a2aad3cdc43407e6e48f81a7fe92978cfe26e884e8","observation_id":"f85890b8-4fab-4908-b811-2d4220c38e01","resolution":{"observed_at":"2026-08-15T15:49:58.792700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-15T15:49:58.065373Z","title":"Sparks of artificial general intelligence: early experiments with gpt-4 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.065373Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:292c682c92b42d7faca68a19dd95b5495162744d4ed8e1c179122fad2b12c259","observation_id":"7e4e84ab-65ee-43a4-9e33-dee86a050071","resolution":{"observed_at":"2026-08-15T15:49:58.065373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06786","last_updated":"2025-09-08T15:13:23Z","snapshot_observed_at":"2026-08-13T23:31:37.672703Z","submitted_at":"2025-09-08T15:13:23Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","version":1},"cited_work":{"arxiv_id":"2509.06786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06786","snapshot_observed_at":"2026-08-15T15:49:58.602175Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","venue":"cs.LG","work_id":"1e656889-54bf-47b3-bdea-f195965e561d","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.068948Z"},"links":{"cited_paper":"/paper/2509.06786","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ca82220ac1721fa223ca3ea3309aaa6eecd1809ba319608fdf5c8b4dc2b6643f","observation_id":"d9048366-9d1e-4557-b7db-57d92e51a4dc","resolution":{"observed_at":"2026-08-15T15:49:58.605246Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.781951Z","title":"A survey on post-training of large language models.arXiv e-prints, pages arXiv–2503, 2025","venue":null,"work_id":"e67bb970-17a8-4d09-8745-2dde226998bf","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.072181Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:07ac8db218e031ac328a3516fbd549b11fed23d334e3d23384e6f8d7e9d033cd","observation_id":"3e67ee99-bf16-4aeb-b499-937ff5aa3806","resolution":{"observed_at":"2026-08-15T15:49:58.785712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.075991Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.075991Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:1bbd74f609cd0914a7236d743a702feb50e357c6a3e261a75c5513825a26aeff","observation_id":"4fdda5c9-fb6f-4973-82ea-31fa4c32784f","resolution":{"observed_at":"2026-08-15T15:49:58.075991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.078529Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.078529Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:927d023ddd2bbca5bc557377b77df81ea24dce4384e63f6aeebf2880d06a0e57","observation_id":"4f8a0d64-a97c-4051-83e3-f8f4f95bf819","resolution":{"observed_at":"2026-08-15T15:49:58.078529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.081745Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.081745Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:9904f1cdda91e2876a22f4644397c586c93c207a46709f3655549af522c24035","observation_id":"d98b61c7-d0b4-4444-8999-b0f0948a7d50","resolution":{"observed_at":"2026-08-15T15:49:58.081745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:49:58.084732Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.084732Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:3b2fd1af28784bd59ba7973f6193d5dcaee7ad1434a831e6fe472cf46412d233","observation_id":"c8aec489-bfc7-4e0d-9795-013e3887e282","resolution":{"observed_at":"2026-08-15T15:49:58.084732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.765490Z","title":"Curriculum offline imitating learning","venue":null,"work_id":"8d2021e2-35c7-4076-9de0-da03b7c735f4","year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.088393Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c9e628c9b2c6518e1e68dfa96994443020355214da0f8f95e38057c977ce1c47","observation_id":"56686d20-3a5d-490d-bb73-6df25066f822","resolution":{"observed_at":"2026-08-15T15:49:58.768174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.758867Z","title":"Offline imitation learning with suboptimal demonstrations via relaxed distribution matching","venue":null,"work_id":"63916dbe-56cc-457b-989f-7268571f56ce","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.091500Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:fce5efed65c5d78edac2d7afb3fb7311139e37e3a1d5d16c15134a6bba0727d4","observation_id":"11144b59-b2cf-4452-a379-532cd0493a36","resolution":{"observed_at":"2026-08-15T15:49:58.761477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-08-16T05:16:58.162785Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-15T15:49:58.094264Z","title":"Offline reinforcement learning for llm multi-step reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.094264Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2289c0f041f4b9c4a97bb7ba1cb96a2c1e40686215191a2123f266358c739040","observation_id":"e38fa1cb-b58c-4008-acaa-fc7a3123f3b3","resolution":{"observed_at":"2026-08-15T15:49:58.094264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.097622Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.097622Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:11a76567aaef96c1a826e0beb4fc60f24c5e8a614f70194f62c46972e36a792c","observation_id":"1cd45998-58e6-4d1a-b03b-681575012957","resolution":{"observed_at":"2026-08-15T15:49:58.097622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.748317Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":"1e965436-7938-4608-aaa0-304f61b98609","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.100869Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ada62b8da8bfa6f71a1a0b623351e33dd2f950ba8f670a061508180cda8341d4","observation_id":"a34bb80f-a6e5-47ef-b26c-5de71dbef4dc","resolution":{"observed_at":"2026-08-15T15:49:58.751138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16673","last_updated":"2025-04-05T08:56:18Z","snapshot_observed_at":"2026-08-16T13:22:52.224350Z","submitted_at":"2024-08-29T16:21:00Z","title":"Preserving Diversity in Supervised Fine-Tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16673","snapshot_observed_at":"2026-08-15T15:49:58.103306Z","title":"Entropic distribution matching in supervised fine-tuning of llms: Less overfitting and better diversity.(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.103306Z"},"links":{"cited_paper":"/paper/2408.16673","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:e1ecd99c32adfaf9115bd7b95d78f6fe63f2e639cfc7984212be602d4343167a","observation_id":"12dcd533-12d3-4efd-8ae2-85c5e8b1fe88","resolution":{"observed_at":"2026-08-15T15:49:58.103306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06548","last_updated":"2017-01-23T18:35:28Z","snapshot_observed_at":"2026-08-14T21:19:55.038511Z","submitted_at":"2017-01-23T18:35:28Z","title":"Regularizing Neural Networks by Penalizing Confident Output Distributions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06548","snapshot_observed_at":"2026-08-15T15:49:58.106522Z","title":"Regularizing neural networks by penalizing confident output distributions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.106522Z"},"links":{"cited_paper":"/paper/1701.06548","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:525ea2ca800d389c4fb42416b4ad370e7a0b9ec3527354bdee4c88b79b2d5367","observation_id":"070ec0c1-259d-4d4b-8a41-30d2908456ab","resolution":{"observed_at":"2026-08-15T15:49:58.106522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.740342Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":"789d59b6-89af-4f29-8fa1-c35b33f4d345","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.109290Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:29c5ac2f150e16dd1755bcd673157e75229e4d3199ab96349b443e4a4d2c7399","observation_id":"b801e931-70b3-47d3-9822-e7b9710433c2","resolution":{"observed_at":"2026-08-15T15:49:58.743340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-15T15:49:58.111627Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.111627Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:6e408cc46d765bdbf8005b10dfe9c63dd4b6162902a4ad6b023064b3f95d557e","observation_id":"2b49f18d-da45-43a6-b2be-234497283dd4","resolution":{"observed_at":"2026-08-15T15:49:58.111627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.733571Z","title":"On the diversity of synthetic data and its impact on training large language models,","venue":null,"work_id":"7a723305-dbbf-4b33-b2ed-ed8f9c5ba55b","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.114383Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:24d21c6b394b1ab491ce773a5be0c93b0ebe41a586eb4de295dc0a701f00c8bd","observation_id":"2316bf61-624d-421a-83bc-f0cf68cc97f7","resolution":{"observed_at":"2026-08-15T15:49:58.736182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.725576Z","title":"Condor: Enhance llm alignment with knowledge-driven data synthesis and refinement","venue":null,"work_id":"ba43f6c4-585b-4357-bf97-9f83699ace51","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.119357Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:97cacce958286c6dbdf02b9a8822f2e835cd7402f5686197017e3104f966ba73","observation_id":"b8b1e8c8-d5b7-413e-9e0c-7d90f7b60170","resolution":{"observed_at":"2026-08-15T15:49:58.728110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.718583Z","title":"Idgen: Item discrimination induced prompt generation for llm evaluation","venue":null,"work_id":"2fde3ca4-178a-41e8-b719-c013adf3d72b","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.123053Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:6c8aabb988ce5bc6f0a177dac3f219ed2fad3cc150ed0eb5cac121fdea039d15","observation_id":"938e0ef4-961e-4a9c-9218-bd996afa1a9b","resolution":{"observed_at":"2026-08-15T15:49:58.721234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T15:49:58.126327Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.126327Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:1d8ab0862a0022eb43c155c88cda53917d357552be0d5c2599b2ef63bdaa1053","observation_id":"d27af825-ab83-4627-be9a-6228d708508d","resolution":{"observed_at":"2026-08-15T15:49:58.126327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T15:49:58.129064Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.129064Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:eacda120b93a234f6d89eb4e0da6cff0a649a10fd9e9f34ec71b4dca8c9a87d9","observation_id":"08e3b7df-4394-48c2-85f5-199226c1483e","resolution":{"observed_at":"2026-08-15T15:49:58.129064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T15:49:58.132125Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.132125Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:96850bf204eebf90bce1f32a6be5c1d27ecb41dfeb06a5627e614720769ef52d","observation_id":"4fcddce0-5c59-4725-bca2-b15566824e6e","resolution":{"observed_at":"2026-08-15T15:49:58.132125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T15:49:58.136271Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.136271Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:79e0b7aefe40bbbd5782ec9f3a1438f7ac327b59719633615b4f34fff446d8ac","observation_id":"98c886ce-718d-4454-8c6e-ccafe91ea064","resolution":{"observed_at":"2026-08-15T15:49:58.136271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08045","last_updated":"2024-06-03T11:34:05Z","snapshot_observed_at":"2026-08-16T14:43:29.644593Z","submitted_at":"2023-11-14T10:10:31Z","title":"Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08045","snapshot_observed_at":"2026-08-15T15:49:58.138798Z","title":"Adversarial preference optimization: Enhancing your alignment via rm-llm game","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.138798Z"},"links":{"cited_paper":"/paper/2311.08045","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d9a3e92bbb49c8736882f02f99f55a0dde40f06159d95499d5254f98c3ff4efc","observation_id":"23866afd-1047-4d4b-b9ec-a3a32e138b27","resolution":{"observed_at":"2026-08-15T15:49:58.138798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T15:49:58.142255Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.142255Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:98ce43fa785197c7b105d20b2d050e6570de7eb15b16bdf490c42b51db3c5744","observation_id":"d439eeeb-0b36-4daa-8288-a0f1779a44bd","resolution":{"observed_at":"2026-08-15T15:49:58.142255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:49:58.146538Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.146538Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:648918a725e93774e059dc60d2873967756d236eea581299a0d71b40997fb451","observation_id":"df333a4f-9aea-4408-801c-1d20fc8e213d","resolution":{"observed_at":"2026-08-15T15:49:58.146538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.150276Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.150276Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:a8e933ee96d6df8e8083ef171562bfcc323756f0b19e7194f7f60dba555c3776","observation_id":"7c7ec438-faeb-4e0b-ba3b-1a95d3c8c691","resolution":{"observed_at":"2026-08-15T15:49:58.150276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00820","last_updated":"2024-10-28T17:05:10Z","snapshot_observed_at":"2026-08-16T13:05:17.961166Z","submitted_at":"2024-10-28T17:05:10Z","title":"AutoGLM: Autonomous Foundation Agents for GUIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00820","snapshot_observed_at":"2026-08-15T15:49:58.152922Z","title":"Autoglm: Autonomous foundation agents for guis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.152922Z"},"links":{"cited_paper":"/paper/2411.00820","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:4722f94fd619b800c56018508a324494ebe9d7e4a34b88daa9f23354562f907b","observation_id":"028c0ad8-5942-4d92-9c1f-aaa47d435aab","resolution":{"observed_at":"2026-08-15T15:49:58.152922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T15:49:58.155753Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.155753Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:05bd12c10e543f3dbc2cc2cff98305bbd9691e540582da67daf8d407b13c003f","observation_id":"7ebdcc37-7fe3-49c2-b0a6-2d60a82ad4c6","resolution":{"observed_at":"2026-08-15T15:49:58.155753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-15T15:49:58.158558Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.158558Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:594b14bd26b707feacf9a823c39e5d70d7089793e96df466007aef1dd2d06516","observation_id":"a7faba00-97d3-403c-a438-df0d71050587","resolution":{"observed_at":"2026-08-15T15:49:58.158558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05193","last_updated":"2024-11-27T00:05:44Z","snapshot_observed_at":"2026-08-16T13:01:55.976106Z","submitted_at":"2024-11-07T21:36:52Z","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05193","snapshot_observed_at":"2026-08-15T15:49:58.162168Z","title":"Q-sft: Q-learning for language models via supervised fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.162168Z"},"links":{"cited_paper":"/paper/2411.05193","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:5f66b3999e1eaa2bc93d83018b49e9529a534abc7f363247f1a88645f0027c5f","observation_id":"04c91798-d270-49d5-8e48-98e58360054b","resolution":{"observed_at":"2026-08-15T15:49:58.162168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.165261Z","title":"On-policy rl meets off-policy experts: Harmonizing supervised fine- tuning and reinforcement learning via dynamic weighting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.165261Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ca4eb999072c46141ea1bac3d0654acc37a79f8b3fd4eedd9a7ff9a1f0cf0668","observation_id":"98ef0e3a-b85d-4bb8-9e5d-8a6ec1c0af87","resolution":{"observed_at":"2026-08-15T15:49:58.165261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-15T15:49:58.169948Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.169948Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:7048261c9d4767170cddde205bcccdaa52fb86313c23d384cddf7a920ee5dcc1","observation_id":"b3ecce42-6552-4fbe-b36c-1906c1d830e9","resolution":{"observed_at":"2026-08-15T15:49:58.169948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-15T19:07:25.253087Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-15T15:49:58.173572Z","title":"Bread: Branched rollouts from expert anchors bridge sft & rl for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.173572Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ca407f27ef5a53f283bd314b6c1efab5f2f0786aabf624926c706af3e4d7ad97","observation_id":"8858a5b0-372f-42e1-a199-4c9d910cbcb6","resolution":{"observed_at":"2026-08-15T15:49:58.173572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-15T18:22:52.402786Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-15T15:49:58.176602Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.176602Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:20341a8f0c54d566f6412842ef023bdef54e186b003651768c94536cc688c38e","observation_id":"a5c519e1-9d20-4eb9-af14-6b057420aa87","resolution":{"observed_at":"2026-08-15T15:49:58.176602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-16T13:41:27.031886Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-15T15:49:58.179658Z","title":"Self-play with execution feedback: Improving instruction-following capabilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.179658Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:177033f03875d82f66294e90c68c879464023448d68ecb636dc1c115cb748832","observation_id":"875a2f1d-728a-487a-90bc-606c0c1d27da","resolution":{"observed_at":"2026-08-15T15:49:58.179658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.183190Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.183190Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:9c1c19a213f54c97b14a96cc68aef2da87c1288c92eaca3359e8ebf9f4684a57","observation_id":"a198c5bc-aa3d-440b-bb9a-8d46304380f5","resolution":{"observed_at":"2026-08-15T15:49:58.183190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.185865Z","title":"Generalizing verifiable instruction following, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.185865Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0bf4693e474187eb958d3ff2e7d4d7d0654382850cec8f60c21873fc35b0d4b8","observation_id":"54df15d6-af5d-4049-993c-1bde54bbe74c","resolution":{"observed_at":"2026-08-15T15:49:58.185865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T15:49:58.188396Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.188396Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0db450e3db7009f1124192d178abceac04f866adf19252e264055fe6b04943cd","observation_id":"a762c342-dd82-4265-8ff4-5eedfda017f5","resolution":{"observed_at":"2026-08-15T15:49:58.188396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-08-16T13:07:36.430674Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-15T15:49:58.190607Z","title":"Multi-if: Benchmarking llms on multi-turn and multilingual instructions following","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.190607Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:08bbadf49f8cc0a46f1b21fe5c3b076b9cc219303ff1d1bfb98b406281b0b070","observation_id":"92da0776-98c2-4f65-8985-74d5e47917c4","resolution":{"observed_at":"2026-08-15T15:49:58.190607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T15:49:58.193411Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.193411Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:48b0255bdf586a7bf055f5c07782fec08d150b79f2956733e7a25ac3c7d1222c","observation_id":"f85c6f8f-bac3-47e1-b658-f4e938b68f5b","resolution":{"observed_at":"2026-08-15T15:49:58.193411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.196925Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.196925Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ddee603f1f16046d8ef7974804f5dd7da627feef8e842770e93c91ae3b7594b9","observation_id":"9ee6b06f-52d5-4c6c-b909-a4c1087c866c","resolution":{"observed_at":"2026-08-15T15:49:58.196925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.199271Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.199271Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:51b9176f20324253ed49e0a1d934645660c0d57af2d654e4eac9e6965638d5f9","observation_id":"804d1d4c-4045-4555-a32d-91e48d1258b3","resolution":{"observed_at":"2026-08-15T15:49:58.199271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T15:49:58.201429Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.201429Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:4a5235a6a63bebd669c8b7c2bff90640689bc1f934efccd00a16b21f9eb5b506","observation_id":"b947f471-b0f1-400f-af49-1deb956d0934","resolution":{"observed_at":"2026-08-15T15:49:58.201429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T15:49:58.205422Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.205422Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:b9cb46c55447bdcfdba6b852a206c3f609207515c099157f9fa9e0a5d8496b95","observation_id":"0979e746-9fab-4609-beee-71afeb3e1c52","resolution":{"observed_at":"2026-08-15T15:49:58.205422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:49:58.209138Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.209138Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:b6448a64ba84fcefe243aa2774fa353954df85e70ba2ea9218f5956667d92603","observation_id":"6005055c-4816-4fd3-97ff-ab9624d64ae7","resolution":{"observed_at":"2026-08-15T15:49:58.209138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.212019Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.212019Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:fd9638f438ccdead2b86685d20c381b4534d4312406dc9fe18ec29c8b721c50b","observation_id":"b7ace46a-de22-4611-9396-116de9b0e6f1","resolution":{"observed_at":"2026-08-15T15:49:58.212019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.696521Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"4feb9d76-af29-45d1-8f28-393bdced611b","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.214895Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0e5d9ec4782c8a9432565343b926e67d361f32a45110a101dfb3522ed7b7edd8","observation_id":"82d5c9da-f8f5-4afa-8ba3-be80aee45ae7","resolution":{"observed_at":"2026-08-15T15:49:58.699052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.217412Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.217412Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2f28a65fb5f58855b50eb3d9bef857c0b666f5f44ee86c7042aa675a5a852ac0","observation_id":"62e6de16-ca27-4c2d-9a22-65beb8e7d1d8","resolution":{"observed_at":"2026-08-15T15:49:58.217412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.685609Z","title":"C-eval: 12 A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"cade92b3-31a4-4ef0-97e3-f42c27ee546f","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.219886Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f69cf09589c81a44682b4c885f1e3a03cf33151160c8dc600f7cd14635b8b618","observation_id":"e8fcaa28-bd44-49ef-b07e-4760195a12b7","resolution":{"observed_at":"2026-08-15T15:49:58.688924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.222765Z","title":"Pre-trained policy discriminators are general reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.222765Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c6fb3a38ef6baf8da87a2c86e2591397faaf144e1e2e9b9d104e82dc5a22d2df","observation_id":"ebb3d37d-99fb-4248-8f04-9148819eb483","resolution":{"observed_at":"2026-08-15T15:49:58.222765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.679172Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning, 2025","venue":null,"work_id":"a303a938-3cfb-44aa-9656-9061decc2936","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.225967Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:53ebe1af2d001b399140ac6717edb4608bf9b668ba23f8c2fed01a90ea47376a","observation_id":"324a8893-47d2-4c6a-a407-5dbb8abfa522","resolution":{"observed_at":"2026-08-15T15:49:58.681698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.228336Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.228336Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:450b28a7b82c03e1128b788f22e60d26f8ea182761c1d4d94085fac63d09f206","observation_id":"ac153536-d7aa-48c5-9f68-870b934ff8ad","resolution":{"observed_at":"2026-08-15T15:49:58.228336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.668227Z","title":"preference","venue":null,"work_id":"c4967d81-1b8f-4601-8ee8-7a4bca25ff78","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.230938Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:b4198a9b38b64fcbd8558c274a97307dcc4383da467c67a065cda3391b9fc62e","observation_id":"f6522c83-15cd-4dc4-8a16-7f7d405c00b9","resolution":{"observed_at":"2026-08-15T15:49:58.671519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.660899Z","title":null,"venue":null,"work_id":"bdb99f39-8ea3-4712-8f15-660882e6ea75","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.234960Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2e0bd56cb5d8ea8f20ba65dcce15cd49f42aa313aefb2f947fbbe4cc11f267d0","observation_id":"5c6a21b2-369d-4393-95a4-8a8e50d8b392","resolution":{"observed_at":"2026-08-15T15:49:58.663350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.652613Z","title":null,"venue":null,"work_id":"21e72ba5-c2a0-41f9-a079-b58aafaa87f8","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.238143Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:5f58868dfa7bce57d2ee7f35db0ff4a5e38dd2916efff187fe1cace9db6572de","observation_id":"b4ef34fe-e198-4a5d-950e-33621b0407d7","resolution":{"observed_at":"2026-08-15T15:49:58.655942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.642769Z","title":"Due to the properties of the Dirac delta function, the integral is non-zero only at the single point y=y ∗","venue":null,"work_id":"6512b917-0b28-4c1b-8b14-5b22bb7bf2d7","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.240961Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:536b254c1ddb7c96a2c559bbe3c730d597663031a06892eb7af35b28974ad90e","observation_id":"35491afa-7d8e-49b3-b244-848509f433bb","resolution":{"observed_at":"2026-08-15T15:49:58.646748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.636353Z","title":null,"venue":null,"work_id":"487d243d-cafa-4d48-962b-3d33e3d6e47a","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.244479Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:3213d88d6a45dbb5d6d720bd23ee7dcbfb020040058f84ca53d6145342d486d3","observation_id":"a999e21e-f008-46c7-bd41-fb96a7093c29","resolution":{"observed_at":"2026-08-15T15:49:58.638677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.629599Z","title":null,"venue":null,"work_id":"afa3f1cf-53f0-4cb5-a645-0cc52eae3b8e","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.247254Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:8a573ccb425d38dcd89175013e2cc6943c3e0f267cc2570ca0a48f51895c05bb","observation_id":"64913ba6-5505-4e22-8bbf-9bb3998ba328","resolution":{"observed_at":"2026-08-15T15:49:58.632107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.622744Z","title":null,"venue":null,"work_id":"eb5f5d46-0582-434a-b4df-d33bcaa07c0a","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.250724Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:abad7c8957da9bec6bd5c0da79ce9e3b0b185e0c37c90b5bebdf6fd4402017cb","observation_id":"9bd36c44-6590-42cb-863f-e34b69f0c504","resolution":{"observed_at":"2026-08-15T15:49:58.625194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.615796Z","title":"This provides a cohesive narrative for the entire post-training pipeline, viewing it not as a sequence of disparate steps but as a unified process","venue":null,"work_id":"2e11545d-5a21-4849-b8ba-cbf6f592d9f1","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.254776Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d8b9c766f7e782f45036b069601f5dc8573ce07b15cec267fce6db89d6e6ee00","observation_id":"a35edc2e-255f-43c8-a8bc-2e8c9c63e1c1","resolution":{"observed_at":"2026-08-15T15:49:58.618467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5743.9152","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.324979Z","title":"winner\" (preferred) response andyl is the","venue":null,"work_id":"65aba26a-7f81-4a8b-9865-abb35102c27d","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.258118Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c9d4704b8aeab2b07c5a3c411d9c2094ea094abed51920d5379ce74e5b6c264a","observation_id":"d01692d6-8b7b-4e18-935f-1834b976261b","resolution":{"observed_at":"2026-08-15T15:49:58.330875Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-15T15:49:58.116911Z","title":"org/abs/2410.15226, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.116911Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:9d43f3c975d66792670de32f63d513da7cb41208bc5815fd9707eb8b9335560a","observation_id":"829c96dc-3465-4610-bb3e-b7248a0a1296","resolution":{"observed_at":"2026-08-15T15:49:58.116911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T15:40:57.491604Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2509.25148."}