{"as_of":"2026-08-19T15:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e0dd35604ba811cf303ce9e02bdcd89d6a7f853a19fba3c04e7abcedbcf241e","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:00:34.711691Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14177/citation-record","integrity":"/paper/2504.14177/integrity","json":"/paper/2504.14177/citation-record.json","paper":"/paper/2504.14177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:35.940532Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":"bab852aa-c76d-4da7-94e7-76be7ca04912","year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.204464Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:b802db67448eb9cd35e6fc9a904d102c995a53974873527bd53d0f2c003e83a7","observation_id":"f67c0f3a-d532-48a4-a3dc-e0644bbc088d","resolution":{"observed_at":"2026-08-16T12:00:35.951192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-18T18:51:43.695932Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-16T12:00:34.211481Z","title":"G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.211481Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:f457c999be5f2094332a678db0289ac9a553079ee306cf136d13b4920d00e542","observation_id":"78f90cf9-0683-4843-9857-75deac2d3d4d","resolution":{"observed_at":"2026-08-16T12:00:34.211481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T12:00:34.217863Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.217863Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:7b2f62c3db9acf95e53d0bf6cb03f6a7e2ec2b5149812ae3e99de8386905c2cf","observation_id":"146d267f-f2b3-4cd1-b680-36f4a59acfc3","resolution":{"observed_at":"2026-08-16T12:00:34.217863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T12:00:34.223434Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.223434Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:8a28f724f75fa8eebd51cac6193dc0f55945172096edca26cae8c3348bd187f2","observation_id":"f0cc1340-df53-43f0-b848-1762fafa1f8f","resolution":{"observed_at":"2026-08-16T12:00:34.223434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T12:00:34.229919Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.229919Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:e17ee29558f4fecc10c804f9e9777c64b6bbff1f934c9db46a44227024e5059c","observation_id":"b3641164-07a0-4499-ac7b-ed9b8202db4a","resolution":{"observed_at":"2026-08-16T12:00:34.229919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-16T12:00:34.236127Z","title":"T., Li, Y., Lundberg, S., Nori, H., Palangi, H., Ribeiro, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.236127Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:2c68c5b14c38a347c8f4509cfe6a58d68ccc61b83f2d05e5a9eb909955d9306a","observation_id":"64188103-c8e8-4033-ac65-247f4f919641","resolution":{"observed_at":"2026-08-16T12:00:34.236127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-16T14:34:35.228009Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-16T12:00:34.245263Z","title":"H., Baker, B., Gao, L., Aschenbrenner, L., Chen, Y., Ecoffet, A., Joglekar, M., Leike, J., Sutskever, I., and Wu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.245263Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:f0fdf1a787110a020d5d83d4ad9e7b279882b422edd362f466fea48d683b5c22","observation_id":"3c207f77-5e88-462b-9a07-a23162186ff2","resolution":{"observed_at":"2026-08-16T12:00:34.245263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09760","last_updated":"2025-03-07T15:26:03Z","snapshot_observed_at":"2026-08-19T08:49:36.766385Z","submitted_at":"2024-06-14T06:57:18Z","title":"Bootstrapping Language Models with DPO Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09760","snapshot_observed_at":"2026-08-16T12:00:34.252305Z","title":"Bootstrapping language models with dpo implicit rewards, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.252305Z"},"links":{"cited_paper":"/paper/2406.09760","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:6d4c0ada7d7b072bb3221420fd7d3597f5b79a6e8075c4845b27891bffc69b46","observation_id":"62a67080-c3a3-4199-9a4a-e2c24cd6fc9a","resolution":{"observed_at":"2026-08-16T12:00:34.252305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07657","last_updated":"2024-06-11T18:55:04Z","snapshot_observed_at":"2026-08-16T13:44:01.309407Z","submitted_at":"2024-06-11T18:55:04Z","title":"OPTune: Efficient Online Preference Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07657","snapshot_observed_at":"2026-08-16T12:00:34.259371Z","title":"Optune: Efficient online preference tuning, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.259371Z"},"links":{"cited_paper":"/paper/2406.07657","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:c5f550de49fd6c70ceb7fe9d166cf1a4c69581190b5f296c04c36dd8104e1770","observation_id":"1ee19758-c12f-4241-8e2c-22849ea4afd8","resolution":{"observed_at":"2026-08-16T12:00:34.259371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12292","last_updated":"2024-01-31T06:44:42Z","snapshot_observed_at":"2026-08-16T14:25:26.370955Z","submitted_at":"2024-01-22T19:00:08Z","title":"GRATH: Gradual Self-Truthifying for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12292","snapshot_observed_at":"2026-08-16T12:00:34.274134Z","title":"Grath: Gradual self-truthifying for large language models, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.274134Z"},"links":{"cited_paper":"/paper/2401.12292","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:7e107ff9f5cc1c64e0387b12a4ae12a82ffb865171633e62523e37341092995c","observation_id":"b1a6ddfb-930d-43be-9f07-d598e35b906a","resolution":{"observed_at":"2026-08-16T12:00:34.274134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02119","last_updated":"2024-07-09T08:24:06Z","snapshot_observed_at":"2026-08-16T13:37:48.794371Z","submitted_at":"2024-07-02T10:09:19Z","title":"Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02119","snapshot_observed_at":"2026-08-16T12:00:34.281660Z","title":"S., and Shen, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.281660Z"},"links":{"cited_paper":"/paper/2407.02119","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:0253cc22be52cca413b422127291aff3573a38e7d289afff3ff743cfa3b9ebd6","observation_id":"79bee758-fb04-48c2-b7e9-39f29f96472d","resolution":{"observed_at":"2026-08-16T12:00:34.281660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-16T12:00:34.290438Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.290438Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:4d2660cb37ad14ea2b6d8e416859238f51e1fa3e7ae060bb36c9ae3db8c5f613","observation_id":"47a838fc-ef96-4b8e-b869-677ec81c36e4","resolution":{"observed_at":"2026-08-16T12:00:34.290438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-16T12:00:34.296889Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.296889Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:6d0e624ecab33bc3c96d6f1c701a97682dd3dcfb0ab6ae86b2e64f393b2ef407","observation_id":"88d9a818-1973-4e64-9c2c-5823feadb2e0","resolution":{"observed_at":"2026-08-16T12:00:34.296889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:00:34.303916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.303916Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:2a02872c26d5957ed171b7d259f3999951d7953f83b3adf983e0fc30b507e0bc","observation_id":"ab6b6760-305f-4e42-bc1e-e73676c10f70","resolution":{"observed_at":"2026-08-16T12:00:34.303916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.309446Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.309446Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:3209db723fc211c30b970f25d9dea0a675f0fa37d78372e1239849ec9cab41c1","observation_id":"b14e1d8f-a538-42e8-bc4e-bb8f264f61b7","resolution":{"observed_at":"2026-08-16T12:00:34.309446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-16T14:20:38.839188Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-16T12:00:34.315247Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.315247Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:5d1d9673496bfd7041a47d00164fe1d2d3226a67b7a42d356a889e5164349498","observation_id":"ca4695f6-5b45-4b13-ba43-bf7e576d529a","resolution":{"observed_at":"2026-08-16T12:00:34.315247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-16T12:00:34.320360Z","title":"S., Hou, L., Wu, Y., Wang, X., Yu, H., and Han, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.320360Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:26681b56ab9299329afa94e62b374a2b821d993aedc59db5b4167df7534ccf1b","observation_id":"b53c1a16-f0ec-4732-9240-220720a77ba0","resolution":{"observed_at":"2026-08-16T12:00:34.320360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T12:00:34.327473Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.327473Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:ea8c7850683f5969002bb85ee21b6bc1e5cf8b11d16f2a9b9103ad560432b946","observation_id":"5bb3867a-9e85-4ccd-9a0b-dd040d95acce","resolution":{"observed_at":"2026-08-16T12:00:34.327473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06839","last_updated":"2024-08-12T03:53:35Z","snapshot_observed_at":"2026-08-16T14:53:21.033889Z","submitted_at":"2023-10-10T17:59:58Z","title":"LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06839","snapshot_observed_at":"2026-08-16T12:00:34.332928Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.332928Z"},"links":{"cited_paper":"/paper/2310.06839","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:4d6b35bc6c347e4dae3274eabebf9b0e1b9eb86281c53dc941f5a2f995632f64","observation_id":"fb1df4bc-5fd6-47c1-9bbb-0fdf51c42bb1","resolution":{"observed_at":"2026-08-16T12:00:34.332928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:35.905245Z","title":"Buy 4 REINFORCE samples, get a baseline for free!, 2019","venue":null,"work_id":"74001497-c61b-42c5-bba2-55d69b39acf9","year":2019},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.340463Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:715488d61ae82c5dab48ddd025f0c3b75cd131993bad40fe800e3db4c5e857c7","observation_id":"49d30676-1d5e-4e45-9221-f88207877ce6","resolution":{"observed_at":"2026-08-16T12:00:35.911831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.347155Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.347155Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:0daebc2e2f3ccad267befe9caf118dee8dbf480e0e9fe5d0da35f5ee0ac92b9f","observation_id":"7db09f20-10ba-4ae2-95c2-932de7832e3b","resolution":{"observed_at":"2026-08-16T12:00:34.347155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-16T12:00:34.355051Z","title":"Rlaif vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.355051Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:929242501033ed21908bda81e790fe25c22d50d0f381c3efffd7af353c68aa97","observation_id":"5713cc60-a032-40f9-9ee1-9c7fb09b7853","resolution":{"observed_at":"2026-08-16T12:00:34.355051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-08-18T10:06:55.154937Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-16T12:00:34.363013Z","title":"D., Yue, X., and Chen, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.363013Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:dcbf6eddbecb4982d89912adeec1488590cef8f26e8ded0672dc85846bf13d41","observation_id":"119025eb-6581-4f30-876e-c57e1f9bbfa5","resolution":{"observed_at":"2026-08-16T12:00:34.363013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-08-16T15:09:03.366337Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-16T12:00:34.370186Z","title":"Self-alignment with instruction backtranslation, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.370186Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:45140c7f099d0f038ce77d9fbbd03e0c0a6933a6fdbc53938eee20c424cbe0de","observation_id":"0260710d-1281-41b8-94ff-f9cfb170da8d","resolution":{"observed_at":"2026-08-16T12:00:34.370186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:00:34.376535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.376535Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:28d95e8046ffa8f94f6696d19384bbe027342cda97a46ae8382808de494d1a7e","observation_id":"655e60ba-9d44-4f89-93ce-da6d3994aeb9","resolution":{"observed_at":"2026-08-16T12:00:34.376535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T12:00:34.383490Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.383490Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:20faf8f97261b94371598384d8716b9314d1507b34aa19dabff40a95f7afb0e1","observation_id":"2823e698-7e03-4f77-ab70-9a1cd46d21df","resolution":{"observed_at":"2026-08-16T12:00:34.383490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-16T13:56:31.553308Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-16T12:00:34.388848Z","title":"Y., Yuan, W., Cho, K., He, H., Sukhbaatar, S., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.388848Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:85c3602cc83d5ec7258dc2fe07f97a0a0b9859f9c362f69d5261b78e72d79b12","observation_id":"beaa816a-bc9f-4c5b-9e67-e5969ca58a1c","resolution":{"observed_at":"2026-08-16T12:00:34.388848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-16T12:00:34.396199Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.396199Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:bd69b745ee158d79a29196311be740d98685d055a7e3b2dcab70a013da2297f7","observation_id":"567618af-c880-49f7-8ed0-53554abed509","resolution":{"observed_at":"2026-08-16T12:00:34.396199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.401828Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.401828Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:313e8dc3bfad54a8e5435451e60e93f382df14bb45b348304b3f5787294d0602","observation_id":"566be659-2760-4af5-aca0-72c8a17bb822","resolution":{"observed_at":"2026-08-16T12:00:34.401828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-08-16T13:44:54.018719Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-16T12:00:34.407637Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.407637Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:67b6174776889ab9e351b91a3db3314d0487e1da84cff6a91d87630e3a4dbecd","observation_id":"7d34b619-f8f7-451f-83af-f53ae90e55a7","resolution":{"observed_at":"2026-08-16T12:00:34.407637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.417554Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.417554Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:cf4b2e6f7d380dce63b9a665254b5c079948895fb3200b61cf5c54b2630d1bf2","observation_id":"2dbdcd2e-4fe1-4134-8f3a-a9a247fe76f6","resolution":{"observed_at":"2026-08-16T12:00:34.417554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-16T12:00:34.423837Z","title":"D., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.423837Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:91fdb84a210db9eacf1660c08c7ac93718762c93adda3ce8730d56fc2a8eeaa4","observation_id":"2451e565-9a03-44d8-a62f-5a9877d51b31","resolution":{"observed_at":"2026-08-16T12:00:34.423837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.430223Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.430223Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:09cdf698adc2d17bd570ae63a958fa490a7d86a310d16a6131948f465d1dd9f3","observation_id":"bd5f79f4-7d37-4d7b-a39b-23b9227ab623","resolution":{"observed_at":"2026-08-16T12:00:34.430223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-16T12:00:34.437502Z","title":"I., and Abbeel, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.437502Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:1bb974b5e04daeb13c24ec91cb0cd6eea1d618166c70aba0f097f38aa2feb3b7","observation_id":"80c2df79-a520-471c-99a7-e48dcffd2c15","resolution":{"observed_at":"2026-08-16T12:00:34.437502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T12:00:34.444215Z","title":"Proximal policy optimization algorithms, 2017 b","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.444215Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:7efc67a56de790a99f3875176569b694f408a194c6ee3fcb4150691b2741489f","observation_id":"187f42c2-3341-4438-8a03-2b8e6a2d0b79","resolution":{"observed_at":"2026-08-16T12:00:34.444215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04235","last_updated":"2018-04-11T21:42:32Z","snapshot_observed_at":"2026-08-14T19:26:52.205576Z","submitted_at":"2018-04-11T21:42:32Z","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04235","snapshot_observed_at":"2026-08-16T12:00:34.449369Z","title":"and Stern, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.449369Z"},"links":{"cited_paper":"/paper/1804.04235","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:b448851244fd657e34a7a38e596cd357c4b78c8630c073d43dde31d45991c79d","observation_id":"d9c77d75-1e90-4a04-9c62-155cf302ce07","resolution":{"observed_at":"2026-08-16T12:00:34.449369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-17T15:45:31.564132Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-16T12:00:34.459183Z","title":"M., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.459183Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:12bdd59f44c6d8c8ade14b068fb050935021ba641284c9e33087d75a2bdde404","observation_id":"e3f413ea-612b-4baa-b9c8-235f2c723be3","resolution":{"observed_at":"2026-08-16T12:00:34.459183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:35.828744Z","title":"S., Barto, A","venue":null,"work_id":"29437ec0-2462-4ced-96ad-5fd4b09be2e7","year":1998},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.466885Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:4b5667643f6b7893fb55d76b6fbc376a8f5e869688d38821b9c356cddb8b0615","observation_id":"54d68c2b-3113-4974-83dc-45c6416b9e11","resolution":{"observed_at":"2026-08-16T12:00:35.834940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-16T12:00:34.471981Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahriari, B., Ramé, A., Ferret, J., Liu, P., Tafti, P., Friesen, A., Casbon, M., Ramos, S., Kumar, R., Lan, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.471981Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:19084276d66499fd2e3ccb565f811e7154994f88c521902a1bdb268c7c580ccc","observation_id":"3bfda666-2dd3-41a5-b7b1-ab9c1a87c596","resolution":{"observed_at":"2026-08-16T12:00:34.471981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T12:00:34.479259Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.479259Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:d1399433e9c6d70023a0c0e4c67774a518a95a80c2ba845cd328479645640348","observation_id":"cff0372b-2ae2-445b-91d2-58f041f27ecf","resolution":{"observed_at":"2026-08-16T12:00:34.479259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.487071Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.487071Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:7a13b6e03779b18c8af822ec72a9317497fbfc1390bdd8c29d019494bbe88c7e","observation_id":"c903f103-4cda-4f66-967b-b0d7a5ae870d","resolution":{"observed_at":"2026-08-16T12:00:34.487071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02244","last_updated":"2024-05-29T13:38:25Z","snapshot_observed_at":"2026-08-17T22:45:13.605406Z","submitted_at":"2024-02-03T19:20:02Z","title":"Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02244","snapshot_observed_at":"2026-08-16T12:00:34.644366Z","title":"Beyond the limits: A survey of techniques to extend the context length in large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.644366Z"},"links":{"cited_paper":"/paper/2402.02244","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:fe657eb36b4af3a60afa3e6984b4273bb1a2cdb0fb802d3c1cd7826d64e2255c","observation_id":"b9a77a3b-2132-4a58-8abc-c065d1b2e5c2","resolution":{"observed_at":"2026-08-16T12:00:34.644366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-17T06:16:40.579073Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-16T12:00:34.649935Z","title":"A., Khashabi, D., and Hajishirzi, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.649935Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:48d93aa29670a9fb31f1a47ddf6b7b8615784b6664f3d2bfbb743a21fd291c01","observation_id":"cca40d48-4670-4b1e-bf65-19fca80100bb","resolution":{"observed_at":"2026-08-16T12:00:34.649935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15134","last_updated":"2021-09-22T20:12:55Z","snapshot_observed_at":"2026-08-12T08:24:18.569918Z","submitted_at":"2020-06-26T17:50:26Z","title":"Critic Regularized Regression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15134","snapshot_observed_at":"2026-08-16T12:00:34.655432Z","title":"T., Reed, S., Shahriari, B., Siegel, N., Merel, J., Gulcehre, C., Heess, N., and de Freitas, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.655432Z"},"links":{"cited_paper":"/paper/2006.15134","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:03eac3a60798975dafa3daf913432aba55f3db5fd8b87d089f9d69d9da6e4577","observation_id":"ea32d943-8abb-4c55-b81a-45742f6594ab","resolution":{"observed_at":"2026-08-16T12:00:34.655432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-08-18T05:01:06.444745Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-16T12:00:34.661542Z","title":"Helpsteer2-preference: Complementing ratings with preferences, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.661542Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:a1f361bd65ef68e4255332882934c70cb6c09a28bc009bd9575deffc9de96cb3","observation_id":"851b486b-a22a-46a7-a95b-1d03bfab8819","resolution":{"observed_at":"2026-08-16T12:00:34.661542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-17T14:40:56.015819Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-16T12:00:34.666679Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.666679Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:934da77ea721f9a8b1b77a541ef63ba63c1c077105701cca49ea2b26bff2ab7e","observation_id":"08cb2999-9b56-480d-a747-9b1a019abc15","resolution":{"observed_at":"2026-08-16T12:00:34.666679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-18T11:11:58.049967Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-16T12:00:34.671758Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.671758Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:c929a40ee333d5ab3bdc7a57e68ff53c013b2e15fa565fd9512deca6c128f004","observation_id":"e83acff7-a118-4e3e-a419-bded8c159674","resolution":{"observed_at":"2026-08-16T12:00:34.671758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:35.791869Z","title":"Qwen2 technical report, 2024 a","venue":null,"work_id":"0eeff791-0b1e-493f-8d8f-74fa3562ebe2","year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.677912Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:2ca79efdfa15a0ddd761c129247f9cdcd201eb0854b650ee7871ca8c5bf7a157","observation_id":"0ac64dd9-830b-43d8-9486-62a9a033e002","resolution":{"observed_at":"2026-08-16T12:00:35.799127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-18T10:24:09.877512Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-16T12:00:34.683581Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.683581Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:aa740903970d24828631e1630b791d863571d48d4fd05f817b5fa8e86e6871d4","observation_id":"f89034d2-5489-42bd-b99b-6761bad044ed","resolution":{"observed_at":"2026-08-16T12:00:34.683581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-16T12:00:34.690216Z","title":"Y., Cho, K., Li, X., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.690216Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:a72b490c22c9af50e3cd157e232553516f73e2bcc32f9d88940b005f34e763ea","observation_id":"86d7ba9b-d3bb-4c55-9b34-b70436a2615a","resolution":{"observed_at":"2026-08-16T12:00:34.690216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-18T20:14:23.882982Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-16T12:00:34.695729Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.695729Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:68c418e431bf0639c149d10b6cfeec112cff5b2c3e3cecdf4ea9ab6859bb3e6e","observation_id":"e9883153-07d2-4036-bb4c-bde0e9152d9f","resolution":{"observed_at":"2026-08-16T12:00:34.695729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T12:00:34.701059Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.701059Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:facfdabaa253b0cb64a0a87a86652458df760491bd8e1dee4c0f855f87903ebf","observation_id":"a9e70935-7f50-4f1e-8e40-9fc46f99f64c","resolution":{"observed_at":"2026-08-16T12:00:34.701059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T12:00:34.706600Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.706600Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:f21e1eda5183d0192d218823c115cfacc94c9d72d15dec5b4d085f89502aeb9f","observation_id":"b71ae924-5248-4a6e-8a29-e29532d92614","resolution":{"observed_at":"2026-08-16T12:00:34.706600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:00:34.711691Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T12:00:34.711691Z"},"links":{"citing_paper":"/paper/2504.14177"},"observation_digest":"sha256:bf51d554524b9a7c7a70d9975b2070c407625d08f7e2a5dda80f5e50e7bc615d","observation_id":"8711beae-a82d-419a-a3f5-a8e0c68b3288","resolution":{"observed_at":"2026-08-16T12:00:34.711691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.14177","last_updated":"2025-04-19T04:44:32Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T02:58:44.733475Z","submitted_at":"2025-04-19T04:44:32Z","title":"Direct Advantage Regression: Aligning LLMs with Online AI Reward"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2504.14177."}