{"as_of":"2026-08-15T13:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e7da634eb6f8137e16ee833ac289e11db973f54705605f3935c50fe66d8c49a","coverage":[{"denominator":112,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:04:07.168303Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:46.427272Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-04T16:07:46.427272Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-14T21:41:31.710262Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:46.427272Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a8c9eb02421e0f0b5290c96fba92811d5fefb95798586afaaff74aa7a88d8a92","observation_id":"b69cfabc-835e-44b2-8e20-58f323790bed","resolution":{"observed_at":"2026-08-04T16:07:46.427272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2509.21319","last_updated":"2026-05-17T00:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-25T16:19:06Z","title":"RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-21T22:09:47.649346Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2509.21319"},"observation_digest":"sha256:eb5ed54d02580cd210ebabb4675f38c65e34b954068327eb65c26e8645fc6d34","observation_id":"f72b0cf3-5632-41cc-82c9-10b554b62a62","resolution":{"observed_at":"2026-05-21T22:10:42.036446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2604.16335","last_updated":"2026-03-13T02:23:49Z","snapshot_observed_at":"2026-08-04T04:51:19.798134Z","submitted_at":"2026-03-13T02:23:49Z","title":"Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T12:22:13.551709Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2604.16335"},"observation_digest":"sha256:62736b89e818d4d4eaf6f94e3c5aae5406ab57ebd3b99c7125eeec62890af0df","observation_id":"4dbe7bcd-ddd2-4f60-b0a1-8deb8beb1af6","resolution":{"observed_at":"2026-05-15T12:25:35.741067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2604.17188","last_updated":"2026-04-28T11:56:12Z","snapshot_observed_at":"2026-08-13T10:16:45.904205Z","submitted_at":"2026-04-19T01:27:41Z","title":"Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T06:47:34.623340Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2604.17188"},"observation_digest":"sha256:d92f77c6c1fe320794d990dd330d37c3c3b4061edb1e5afb6653d129f683e85e","observation_id":"2db5892d-8c19-45ac-9fec-1ef606dfc1dc","resolution":{"observed_at":"2026-05-10T06:51:45.655359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2605.04458","last_updated":"2026-06-19T16:01:53Z","snapshot_observed_at":"2026-08-11T00:03:31.814378Z","submitted_at":"2026-05-06T03:34:46Z","title":"DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:29:22.089174Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2605.04458"},"observation_digest":"sha256:91cb63c97d54c7eb753da28488ead5b096ca4e4e25433becd793a98ec633c750","observation_id":"3c8adfd8-f24e-475f-b765-777ab48bdc7f","resolution":{"observed_at":"2026-05-11T17:31:07.401146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2605.04458","last_updated":"2026-06-19T16:01:53Z","snapshot_observed_at":"2026-08-11T00:03:31.814378Z","submitted_at":"2026-05-06T03:34:46Z","title":"DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T00:05:28.004125Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2605.04458"},"observation_digest":"sha256:cf1c466784d30d805f7866313c118f5bc11b37bce93a543eb5f4f4111c7f7fe9","observation_id":"6aac035e-19a1-41be-b03e-d3bcaed68a42","resolution":{"observed_at":"2026-07-01T00:15:09.597128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2606.03980","last_updated":"2026-06-02T17:56:57Z","snapshot_observed_at":"2026-08-11T16:40:09.145892Z","submitted_at":"2026-06-02T17:56:57Z","title":"Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:53:22.633115Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2606.03980"},"observation_digest":"sha256:22f3e31f00c9d967792475df5cb0a58f75a76c61654977821bf589a5c21dd7e1","observation_id":"47d74668-400a-4c4f-97b1-af72d8570a03","resolution":{"observed_at":"2026-06-28T11:02:01.384983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"cited_work":{"arxiv_id":"2506.03637","doi":"10.48550/arxiv.2506.03637","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03637","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewardanything: Generalizable principle-following reward models","venue":"ArXiv.org","work_id":"ef48bfa7-3bc5-4374-b37b-9bf6403d18ac","year":2025},"citing_paper":{"arxiv_id":"2606.08077","last_updated":"2026-06-06T09:55:22Z","snapshot_observed_at":"2026-08-15T06:06:37.160805Z","submitted_at":"2026-06-06T09:55:22Z","title":"Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T20:06:12.523067Z"},"links":{"cited_paper":"/paper/2506.03637","citing_paper":"/paper/2606.08077"},"observation_digest":"sha256:7e7f89259b34e20b0496752df351e74d30cb29a42fe7913930e7234d2def6f18","observation_id":"4d9bc8bb-3426-4345-92d4-2e42081b3aeb","resolution":{"observed_at":"2026-07-02T20:47:23.335587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03637/citation-record","integrity":"/paper/2506.03637/integrity","json":"/paper/2506.03637/citation-record.json","paper":"/paper/2506.03637"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T11:04:06.668341Z","title":"Fine-tuning language models from human preferences,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.668341Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:235c134f0830d00b5df416f20666c35dd6fea6da826cf52872eec014f4b81170","observation_id":"9b279bdf-f850-4297-90fd-6741b5310583","resolution":{"observed_at":"2026-08-07T11:04:06.668341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.674152Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.674152Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a025f498ccd6c2f5a4595db6fc9be4dd415b4aa030e4ed07bebbc4e35b090e19","observation_id":"56102ffb-be24-4cca-8208-538f0502a5a6","resolution":{"observed_at":"2026-08-07T11:04:06.674152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.679780Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.679780Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:409241ff74c584045853d03a01ca059b7411a771ab49bdc9ede5f5506ba56d79","observation_id":"f72af75e-4930-41bf-851a-696ec6e5388e","resolution":{"observed_at":"2026-08-07T11:04:06.679780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.684775Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.684775Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ff8d0dc797b86995939865c964c93fbc01090c3fc59409320f472138c2a1f82e","observation_id":"85a9511f-355b-47bb-aee9-2d38ad65ee30","resolution":{"observed_at":"2026-08-07T11:04:06.684775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T11:04:06.689596Z","title":"A general language assistant as a laboratory for alignment,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.689596Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:46999d0ee862677dac46603b933e97aac3880f3f3c74bd11ba5a54c772fba48a","observation_id":"9312a7b4-5134-49da-aaa8-dd7b93a8885d","resolution":{"observed_at":"2026-08-07T11:04:06.689596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:04:06.694852Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.694852Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:8c65642b4f379eecb36f29f471666aa332872a6038dc7c163dba941f280c9874","observation_id":"882b93d0-697f-4cf3-b839-d141d3bdef4e","resolution":{"observed_at":"2026-08-07T11:04:06.694852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16184","last_updated":"2024-10-21T16:48:26Z","snapshot_observed_at":"2026-08-12T22:18:21.764852Z","submitted_at":"2024-10-21T16:48:26Z","title":"RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16184","snapshot_observed_at":"2026-08-07T11:04:06.700804Z","title":"Rm-bench: Benchmarking reward models of language models with subtlety and style,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.700804Z"},"links":{"cited_paper":"/paper/2410.16184","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b649284f67811c91678e3e652e588e208be695e6ab5bcf02d1317a1e1bbd76bb","observation_id":"6f079aa2-70ae-4aeb-8524-49e57e6fd4b7","resolution":{"observed_at":"2026-08-07T11:04:06.700804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.705995Z","title":"A survey of reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.705995Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:f7c456388daf66de30ad79bcb37a3ecdb32a2188e0c16a768922cab0849a9d89","observation_id":"4eab97cf-aac4-410b-a980-cb5daf48fca0","resolution":{"observed_at":"2026-08-07T11:04:06.705995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T11:04:06.710698Z","title":"Skywork- reward: Bag of tricks for reward modeling in llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.710698Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:7b4c7bc86893f09570e248daec2c8e6789db1e31a0f06aec3894acdbbc257a0e","observation_id":"ba520f4b-043f-456e-a640-7cc474ca65e9","resolution":{"observed_at":"2026-08-07T11:04:06.710698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.715361Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.715361Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a34e58f89d3c7aa7f0beff602c1ebced1fb95ecf92a0cbbe88d51b3ea65fef0e","observation_id":"ddcae839-bad5-4a40-90aa-3b24b2270704","resolution":{"observed_at":"2026-08-07T11:04:06.715361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07641","last_updated":"2024-04-16T04:50:08Z","snapshot_observed_at":"2026-08-13T05:52:00.323833Z","submitted_at":"2023-10-11T16:38:11Z","title":"Evaluating Large Language Models at Evaluating Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07641","snapshot_observed_at":"2026-08-07T11:04:06.720772Z","title":"Evaluating large language models at evaluating instruction following,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.720772Z"},"links":{"cited_paper":"/paper/2310.07641","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:8af8aa28a4983d9c788fe65a12c5e0f52a0894c4a3b4db4251ba36194c5e0f7b","observation_id":"9e02376c-6f72-43ad-90fd-b9cf08e846b3","resolution":{"observed_at":"2026-08-07T11:04:06.720772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15043","last_updated":"2024-06-03T06:02:39Z","snapshot_observed_at":"2026-08-13T04:12:26.591793Z","submitted_at":"2024-02-23T01:30:39Z","title":"KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15043","snapshot_observed_at":"2026-08-07T11:04:06.725726Z","title":"Kieval: A knowledge-grounded interactive evaluation framework for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.725726Z"},"links":{"cited_paper":"/paper/2402.15043","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:c875f27190f7c27b284d28b92354138496e4355c09f5fe36e39e8c2aa8976671","observation_id":"647a9c0a-a442-4d10-ba1b-77b7e8c222b5","resolution":{"observed_at":"2026-08-07T11:04:06.725726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.731714Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.731714Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:9b79e14c7869ac7593b66984df2e9f506cfeda0872d2f306b0bc2f3c393ce608","observation_id":"5e54f08c-bccc-4bfa-94f7-a66e374e2086","resolution":{"observed_at":"2026-08-07T11:04:06.731714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.736332Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.736332Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:7557b7270b876515bf8c11795fe459864c735558c4bef813320e779bfec82c06","observation_id":"31155be0-5e2c-4c8f-baf2-db78c69e4cb1","resolution":{"observed_at":"2026-08-07T11:04:06.736332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.741111Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.741111Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:e9a1116631a12387089dcea00c11aed21e39d60954abe295046e24b1ef6e4e00","observation_id":"95a650e7-7f8c-4641-ae0c-28e9bd3de960","resolution":{"observed_at":"2026-08-07T11:04:06.741111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.745739Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.745739Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b0bffebd8c845794e5a63ae58a9ee9dbc06d811c348911efecacd41ad6f7f8e2","observation_id":"a61d097b-10a7-4888-b9bb-c5df544d0818","resolution":{"observed_at":"2026-08-07T11:04:06.745739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-14T14:28:34.295560Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-07T11:04:06.750627Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.750627Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ce61d4aca5281c489d8901a792852e096dd4eda5db1dae1cb294f125e5eca744","observation_id":"897d129d-c17a-4482-b52e-b6f713c33977","resolution":{"observed_at":"2026-08-07T11:04:06.750627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.755519Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.755519Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:15562cf42731b7d6d8fb47c6888d57b407e16358881385239ef280c700d7ce4c","observation_id":"7b388b80-12ab-40f5-bf29-edf188dc48eb","resolution":{"observed_at":"2026-08-07T11:04:06.755519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.760307Z","title":"Understanding dataset difficulty with v-usable information,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.760307Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:7c92b0c5ec9d02e998db269b454c85aa9167375c799a872f8eb2746ebf2e6007","observation_id":"35da3c3b-5ae6-42f6-ae7e-6063175a4487","resolution":{"observed_at":"2026-08-07T11:04:06.760307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T11:04:06.764837Z","title":"Rewardbench: Evaluating reward models for language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.764837Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:53de3e597e25227e0727bc8215f01e3000942ce3d2f5f54fac5de3b7a91f136d","observation_id":"f3b495a0-ac32-4338-a9eb-9404eed09896","resolution":{"observed_at":"2026-08-07T11:04:06.764837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14872","last_updated":"2024-10-22T22:18:14Z","snapshot_observed_at":"2026-08-12T22:19:45.338749Z","submitted_at":"2024-10-18T21:38:21Z","title":"How to Evaluate Reward Models for RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14872","snapshot_observed_at":"2026-08-07T11:04:06.769759Z","title":"How to evaluate reward models for rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.769759Z"},"links":{"cited_paper":"/paper/2410.14872","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:5bfce806b436c0be6cf84732e7e1060d2afd2b7d720b8e82803ae889e49b3a00","observation_id":"284e87a8-4613-42db-9312-a2f323338b5d","resolution":{"observed_at":"2026-08-07T11:04:06.769759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18699","last_updated":"2025-07-22T05:25:08Z","snapshot_observed_at":"2026-08-15T02:10:49.906369Z","submitted_at":"2025-02-25T23:22:12Z","title":"MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18699","snapshot_observed_at":"2026-08-07T11:04:06.774840Z","title":"Mpo: An efficient post-processing framework for mixing diverse preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.774840Z"},"links":{"cited_paper":"/paper/2502.18699","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:fe77c5d4a1bab66fe0391d208c4c2390bd020596538f4a007a6a9e2b373857b0","observation_id":"e30463e9-60e3-492e-8b33-8d61471e0f3a","resolution":{"observed_at":"2026-08-07T11:04:06.774840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05910","last_updated":"2024-04-09T23:21:45Z","snapshot_observed_at":"2026-08-13T05:53:40.344780Z","submitted_at":"2023-10-09T17:56:53Z","title":"SALMON: Self-Alignment with Instructable Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05910","snapshot_observed_at":"2026-08-07T11:04:06.780144Z","title":"Salmon: Self-alignment with instructable reward models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.780144Z"},"links":{"cited_paper":"/paper/2310.05910","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ba8999fe7f15ff651ed16fed7704812d8ba455a1af834e01e19b7eb6a567f0c1","observation_id":"1cbe3cfc-5f4c-4f0c-b08c-fceb2f81098c","resolution":{"observed_at":"2026-08-07T11:04:06.780144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.785130Z","title":"Inference-time scaling for generalist reward modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.785130Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:3e4426d3c101a6e132fb08f152924f8b9116ae8d94c3616040e96fe10573d52d","observation_id":"06bf0455-4fe3-404f-9c02-5543eb4f7fd5","resolution":{"observed_at":"2026-08-07T11:04:06.785130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.789757Z","title":"Rm-r1: Reward modeling as reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.789757Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:408f9dbb158f3b5d47752bda73e5266d15a5a746ef709ec34580f80c2cc387d5","observation_id":"6846a318-8e26-4a35-a5f3-c3e54524ba47","resolution":{"observed_at":"2026-08-07T11:04:06.789757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19328","last_updated":"2025-02-26T17:19:12Z","snapshot_observed_at":"2026-08-11T21:32:15.599177Z","submitted_at":"2025-02-26T17:19:12Z","title":"Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19328","snapshot_observed_at":"2026-08-07T11:04:06.794352Z","title":"Agentic reward modeling: Integrating human preferences with verifiable correctness signals for reliable reward systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.794352Z"},"links":{"cited_paper":"/paper/2502.19328","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:76eb7b4759d1cd4a59fe9fda8c7ee169f99c6b475ec7d17047cf50986b4b0a42","observation_id":"385a7958-a8a7-4e24-8094-3a29b2cc48a5","resolution":{"observed_at":"2026-08-07T11:04:06.794352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:04:06.799281Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.799281Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ed12e105b7cc11f8e0f59ac1c321f2cd64b09a160a7a13c7ae79eab7bb7209a5","observation_id":"7c913abf-9885-4020-8c26-9ea29f1c011b","resolution":{"observed_at":"2026-08-07T11:04:06.799281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:04:06.804029Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.804029Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:3df589408fc14080c7d403a0e7a8ee5449ce640bf60aef0ae35111919cce3edb","observation_id":"585bd097-d7a4-4279-a548-f10e14c4d904","resolution":{"observed_at":"2026-08-07T11:04:06.804029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.808458Z","title":"What makes a reward model a good teacher? an optimization perspective,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.808458Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b78aabed59126b9cd6203d133d1551218f39f45a226e21d22fb524599e1e90a2","observation_id":"5e9c6673-1a60-41f9-af83-2bb8bfbdd2bc","resolution":{"observed_at":"2026-08-07T11:04:06.808458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12763","last_updated":"2025-05-19T06:43:08Z","snapshot_observed_at":"2026-08-07T15:43:26.304881Z","submitted_at":"2025-05-19T06:43:08Z","title":"Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization","version":1},"cited_work":{"arxiv_id":"2505.12763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12763","snapshot_observed_at":"2026-08-07T11:04:08.237530Z","title":"Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization","venue":"cs.LG","work_id":"1f7c0f24-ba34-41a6-9c23-1ca4a84493ae","year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.813430Z"},"links":{"cited_paper":"/paper/2505.12763","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ffd32d7c0cf982cfcca678d3a2075bdd0859dea9aef46b373c1ce23949f2725e","observation_id":"4de5ecbc-5476-40f2-ae93-403b085cc640","resolution":{"observed_at":"2026-08-07T11:04:08.243595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-12T23:26:11.186586Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T11:04:06.819184Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.819184Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:dd994ac6e030d626e34268ce2b593dc3da189b3aa13b29651e3599084dbac292","observation_id":"a27bbd21-8242-4092-b6a8-dd026c14e7e7","resolution":{"observed_at":"2026-08-07T11:04:06.819184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-12T23:38:02.782103Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T11:04:06.823967Z","title":"Pku- saferlhf: Towards multi-level safety alignment for llms with human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.823967Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:63bb62db5afed999f71cdf389d624eb37e0b3ddac058b1366ec0b6ee6865bf19","observation_id":"eed00d0e-6f1d-4820-a85f-fc1adb3eada8","resolution":{"observed_at":"2026-08-07T11:04:06.823967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-14T04:19:38.572552Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-07T11:04:06.829011Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.829011Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:377896e704be5b7f1668cb0b2983e9a850af6196fa3834c5e3c434693621d3e9","observation_id":"ff7853db-ca4b-4728-a698-24b306bfa837","resolution":{"observed_at":"2026-08-07T11:04:06.829011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-13T05:02:09.847989Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T11:04:06.833906Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.833906Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:6dd3249190f7481b554f2039ad06ae5235aea2bf8a8d10e7268fa70eb321388d","observation_id":"3caeb390-76d5-4292-abbc-7d1102c841bb","resolution":{"observed_at":"2026-08-07T11:04:06.833906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00742","last_updated":"2024-07-19T05:12:15Z","snapshot_observed_at":"2026-08-13T04:29:06.312155Z","submitted_at":"2024-02-01T16:39:28Z","title":"Transforming and Combining Rewards for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00742","snapshot_observed_at":"2026-08-07T11:04:06.839256Z","title":"Transforming and combining rewards for aligning large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.839256Z"},"links":{"cited_paper":"/paper/2402.00742","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:e4eb4539c465d5933463f7629c255cfd4aaad66c5747d94ac257cc07d73146db","observation_id":"c7c2a000-22cd-47a4-8c5e-76e767e818af","resolution":{"observed_at":"2026-08-07T11:04:06.839256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10337","last_updated":"2025-04-16T14:58:26Z","snapshot_observed_at":"2026-08-07T16:05:50.114818Z","submitted_at":"2025-04-14T15:46:33Z","title":"Heimdall: test-time scaling on the generative verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10337","snapshot_observed_at":"2026-08-07T11:04:06.844166Z","title":"Heimdall: test-time scaling on the generative verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.844166Z"},"links":{"cited_paper":"/paper/2504.10337","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:385201e80007cb13086aa7e3a9b5acff4840497c9f8471408aee6164475bdf6e","observation_id":"1f4e3b2f-1766-4840-8825-57e7aacc2330","resolution":{"observed_at":"2026-08-07T11:04:06.844166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.849638Z","title":"When to solve, when to verify: Compute-optimal problem solving and generative verification for llm reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.849638Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:233cdbd0f2199623bb615ebfbcab6418912a3c060830e8d9e2635304efc7ecef","observation_id":"a9c81cf0-383d-47b2-8810-b36116b58808","resolution":{"observed_at":"2026-08-07T11:04:06.849638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09561","last_updated":"2023-10-19T12:24:42Z","snapshot_observed_at":"2026-08-13T13:18:57.686604Z","submitted_at":"2022-12-19T15:51:52Z","title":"Large Language Models are Better Reasoners with Self-Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09561","snapshot_observed_at":"2026-08-07T11:04:06.854412Z","title":"Large language models are better reasoners with self-verification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.854412Z"},"links":{"cited_paper":"/paper/2212.09561","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:d090d06218efc053fc989fddea65b0c9dd38aa58ceec2aad29c28d62546c2f3a","observation_id":"d4655333-ac14-4745-9507-ef5406937add","resolution":{"observed_at":"2026-08-07T11:04:06.854412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00891","last_updated":"2025-04-05T03:04:37Z","snapshot_observed_at":"2026-08-13T05:58:50.073773Z","submitted_at":"2025-04-01T15:21:05Z","title":"GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00891","snapshot_observed_at":"2026-08-07T11:04:06.860706Z","title":"Genprm: Scaling test-time compute of process reward models via generative reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.860706Z"},"links":{"cited_paper":"/paper/2504.00891","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ab43528ca25deccfa21bc8253cc7024fc47d5f4384745d59c8872ab4ff224877","observation_id":"20a05919-d3b7-4492-afd8-954af94a293b","resolution":{"observed_at":"2026-08-07T11:04:06.860706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14146","last_updated":"2024-10-29T11:13:14Z","snapshot_observed_at":"2026-08-14T10:15:59.451826Z","submitted_at":"2024-02-21T22:02:37Z","title":"Dynamic Multi-Reward Weighting for Multi-Style Controllable Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14146","snapshot_observed_at":"2026-08-07T11:04:06.866772Z","title":"Dynamic multi-reward weighting for multi-style controllable generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.866772Z"},"links":{"cited_paper":"/paper/2402.14146","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:48ecf138fdf44059f839242812dda509e950c5f4cb873f3f2435b1775e4edd46","observation_id":"67a8321e-6415-4aa3-bdc3-7eefe6eaae70","resolution":{"observed_at":"2026-08-07T11:04:06.866772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21878","last_updated":"2025-04-07T17:44:38Z","snapshot_observed_at":"2026-08-07T16:31:54.737337Z","submitted_at":"2025-03-27T18:00:08Z","title":"Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21878","snapshot_observed_at":"2026-08-07T11:04:06.872561Z","title":"Is best-of-n the best of them? coverage, scaling, and optimality in inference-time alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.872561Z"},"links":{"cited_paper":"/paper/2503.21878","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:0d2982d2a5cd61ef014acabf4d290b3400fd16997ce323c28544842cdd8182f2","observation_id":"036900c6-a90b-497d-a489-085704e09552","resolution":{"observed_at":"2026-08-07T11:04:06.872561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.878071Z","title":"Meta-reward-net: Implicitly differentiable reward learning for preference-based reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.878071Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:6dead68c644882e444d790da4e9859ff76c9990376192bc4c105570a52aabb7b","observation_id":"3838075c-3529-4139-a0c1-84cdfd69ff06","resolution":{"observed_at":"2026-08-07T11:04:06.878071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-13T12:39:00.588330Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-07T11:04:06.882676Z","title":"Outcome-refining process supervision for code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.882676Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:c0e724d4bb6702152ffbc2bb649c16fef157ecdd5d748082566b70ffaeb95eb0","observation_id":"d1464911-8e0c-4a5c-9e45-9069c5ea5cba","resolution":{"observed_at":"2026-08-07T11:04:06.882676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10709","last_updated":"2025-03-02T04:37:08Z","snapshot_observed_at":"2026-08-12T03:56:09.980703Z","submitted_at":"2025-02-15T07:45:20Z","title":"An Empirical Analysis of Uncertainty in Large Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10709","snapshot_observed_at":"2026-08-07T11:04:06.887470Z","title":"An empirical analysis of uncertainty in large language model evaluations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.887470Z"},"links":{"cited_paper":"/paper/2502.10709","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:525e1005cd98ded3995b77669a6a49eeb1d2399f6682ba8a8b35ef449bd9429a","observation_id":"85489b8f-af8a-4d90-a8ff-eac910f95769","resolution":{"observed_at":"2026-08-07T11:04:06.887470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-08-14T13:26:32.548079Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-07T11:04:06.892322Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.892322Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:fe48bb1bf728c055738a724208a76860f46b730cc40455ca7dad710231350d47","observation_id":"9a17a9eb-7e34-45b2-871d-73a3db0b36cf","resolution":{"observed_at":"2026-08-07T11:04:06.892322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-13T18:34:28.304602Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T11:04:06.897214Z","title":"Reward shaping to mitigate reward hacking in rlhf,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.897214Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a601878aeef613f1f8cae2e8324e56d00077730faad9a707ae39f2606727db0a","observation_id":"5c3df9b4-277a-4135-b4c4-75ffb9785030","resolution":{"observed_at":"2026-08-07T11:04:06.897214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-13T05:57:41.785838Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-07T11:04:06.902238Z","title":"Reward model ensembles help mitigate overoptimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.902238Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:91f24dc6adb602770d0da2172180188b98bd5262f61e7225924ba594a851f15e","observation_id":"726b7ead-80f1-4df5-a9f2-480b78a979cd","resolution":{"observed_at":"2026-08-07T11:04:06.902238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.906934Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.906934Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:11a94650e4966a923c043c5e84d4986bd73a4c820577a2dfe46119ce6d3a1e2b","observation_id":"8b1f6274-a680-4173-82d8-64c2de1361b1","resolution":{"observed_at":"2026-08-07T11:04:06.906934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T11:04:06.911443Z","title":"Palm 2 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.911443Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:d94aaaaffbc227fce9234bffb9b66268ce0645b322ded6e7cd512608f2a7ce63","observation_id":"fda1a968-0a31-4e89-a696-40536e1fd5b8","resolution":{"observed_at":"2026-08-07T11:04:06.911443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.916486Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.916486Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:dc61f247b23231033b414f90798a6bcdbfc493fd479874648a174cbef16d5ffb","observation_id":"789a1e01-ae63-467d-9284-3fd6be070583","resolution":{"observed_at":"2026-08-07T11:04:06.916486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-07T11:04:06.921103Z","title":"A multitask, multilingual, multimodal evaluation of chatgpt on reasoning, hallucination, and interactivity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.921103Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:0a632260034904b3d022dc75de4a1c450c89f8f7953722777576c7e99072e77f","observation_id":"4d096eb2-2766-4bb7-8d6f-d29ce7e81c16","resolution":{"observed_at":"2026-08-07T11:04:06.921103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.925730Z","title":"A fast learning algorithm for deep belief nets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.925730Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b9a46821763fa2021cd5be21b86479e65a545fba5a4fee3123951b6b2e51fb53","observation_id":"85a8a507-cc31-4994-bf67-281478cd8ce0","resolution":{"observed_at":"2026-08-07T11:04:06.925730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.930247Z","title":"Goodfellow, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.930247Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:2935bfe73552d03005525dec009822902cf4377122a4fc35c1da0a3ca3ecb710","observation_id":"29c94fe2-a672-4bff-8d4d-b1458d710815","resolution":{"observed_at":"2026-08-07T11:04:06.930247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-13T22:45:34.795769Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T11:04:06.934924Z","title":"Self-instruct: Aligning language model with self generated instructions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.934924Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:7f4160f18fdd8033a5b4edfc514ed175bf63b6577ec75078199209472deed609","observation_id":"979e9e92-d7d7-4316-88ec-3ec571473c55","resolution":{"observed_at":"2026-08-07T11:04:06.934924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-12T00:45:25.809655Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T11:04:06.940032Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.940032Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:d84319c8a9f5bf4a2e8a792831b7e7546bc3844113de97072858b105d3951d83","observation_id":"79f2caed-bde8-4a7a-88e4-8b78accb4f8e","resolution":{"observed_at":"2026-08-07T11:04:06.940032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.944747Z","title":"How to fine-tune bert for text classification?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.944747Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:bbc16aca003484d286507bbcaaad0e50145e13877eb30e1bc817289f4a8b6b6b","observation_id":"1337053c-cbc1-4d73-99c8-b887f3c611c2","resolution":{"observed_at":"2026-08-07T11:04:06.944747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.949212Z","title":"Natural language question answering: the view from here,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.949212Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:3cd00cc9a544ca2f88bdcede161a11adaba6529cba8ee2526af73c617e9e2c54","observation_id":"f68efd9f-1b6f-4349-9070-c4fa21b6fbbc","resolution":{"observed_at":"2026-08-07T11:04:06.949212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.953766Z","title":"Natural questions: a benchmark for question answering research,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.953766Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:04e68021871407c445e08da0a03e2079ac04cb438f9ade831f5d470e6075f1ec","observation_id":"16119788-8a5d-4f1a-a803-8ea0c2bdd1f5","resolution":{"observed_at":"2026-08-07T11:04:06.953766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.959425Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.959425Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:9bfb0d1f970e04a2c604aa495d3f0343e7a50e4c7fcf015053c50b5aacacd2d5","observation_id":"a8d7d9a4-f9c8-494e-afb9-e36450842e50","resolution":{"observed_at":"2026-08-07T11:04:06.959425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-13T11:00:48.285825Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-08-07T11:04:06.964744Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.964744Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:163382e3a6aded7aeb5abea6b16059edadbcfec8e7a76077b3a99825e95d8d60","observation_id":"23240761-a0d3-47f9-8aaa-2ffa09540afd","resolution":{"observed_at":"2026-08-07T11:04:06.964744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.969461Z","title":"O’Reilly Media, Inc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.969461Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:7cce5fdf1317e0e0eefe27243fb173b15cf56b3d571ecf5563548d840d260433","observation_id":"e48dfae5-2c14-485d-910a-44cfe1603345","resolution":{"observed_at":"2026-08-07T11:04:06.969461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.974250Z","title":"Deep learning tuning playbook,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.974250Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b575a4f903d1c5883828f9c1657349b512c7449a4597945dac51745188ffeffd","observation_id":"4bb07342-09f8-4b42-b70f-ebacad01aa41","resolution":{"observed_at":"2026-08-07T11:04:06.974250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.979209Z","title":"Glue: A multi-task bench- mark and analysis platform for natural language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.979209Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:e94083151111515c6f8a40150a3e10ea98e6f063a4d7ae56f55c3f9e24b53a56","observation_id":"34600fe8-cbf0-4e47-bebe-81c353a602b5","resolution":{"observed_at":"2026-08-07T11:04:06.979209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08073","last_updated":"2023-05-22T11:55:52Z","snapshot_observed_at":"2026-08-13T13:42:39.023583Z","submitted_at":"2022-11-15T11:53:55Z","title":"GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08073","snapshot_observed_at":"2026-08-07T11:04:06.983862Z","title":"Glue-x: Evaluating natural language understanding models from an out-of-distribution generalization perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.983862Z"},"links":{"cited_paper":"/paper/2211.08073","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ba4b0b0d3275b4d17ed0925be023e9b2cbe403ffe1758c14f7e8fb2e2384249e","observation_id":"10379657-7d58-4459-81fd-de8febfd5de2","resolution":{"observed_at":"2026-08-07T11:04:06.983862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:04:06.988674Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.988674Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a3a867ac9c0a0e2e9486183d69f853656ba3bc7675b183a10e7858a61eb448c8","observation_id":"8d338659-03da-4d26-88a0-ba50fec7d0f2","resolution":{"observed_at":"2026-08-07T11:04:06.988674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.993399Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.993399Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:134b013798b2e6f360a0c5cf1fd02b086362dfe2837acc476316c88132c88ab8","observation_id":"2afbe2cd-240a-4140-a316-0e57d8408983","resolution":{"observed_at":"2026-08-07T11:04:06.993399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:04:06.997891Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.997891Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:35f81f1c3dc78e6f503c79386f4dc7b376eee2206bcfba8ae7c78e197a60c6da","observation_id":"91c101b8-0f39-427b-a6c4-5a9c707b8781","resolution":{"observed_at":"2026-08-07T11:04:06.997891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18018","last_updated":"2023-10-27T09:48:29Z","snapshot_observed_at":"2026-08-13T05:39:13.608012Z","submitted_at":"2023-10-27T09:48:29Z","title":"NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18018","snapshot_observed_at":"2026-08-07T11:04:07.003448Z","title":"Nlp evaluation in trouble: On the need to measure llm data contamination for each benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.003448Z"},"links":{"cited_paper":"/paper/2310.18018","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:c262c8ebf0a5e481b0325eca709ab1fcc03b596f31c2c50a9aaa891e7c122feb","observation_id":"9171a74f-991e-4ff4-b18d-8ed9ca0db66c","resolution":{"observed_at":"2026-08-07T11:04:07.003448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.008038Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.008038Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:120e465dbe36b42f6ec352cc0c1d2038db68d44125fd3e4ed4f8807155ababb4","observation_id":"b62b8a95-8eb5-48b6-a927-22fa4dd3188b","resolution":{"observed_at":"2026-08-07T11:04:07.008038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.012476Z","title":"Zero-infinity: Breaking the gpu memory wall for extreme scale deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.012476Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b24bf613d8e3dd02eb5b2d05e4d8bf12a12a3dec9d2c5f70a02a779952773056","observation_id":"a201190d-f322-4fac-8904-48bca019f5e7","resolution":{"observed_at":"2026-08-07T11:04:07.012476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15918","last_updated":"2024-04-11T06:41:15Z","snapshot_observed_at":"2026-08-14T05:14:32.092863Z","submitted_at":"2023-12-26T07:24:46Z","title":"Supervised Knowledge Makes Large Language Models Better In-context Learners","version":2},"cited_work":{"arxiv_id":"2312.15918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.15918","snapshot_observed_at":"2026-08-07T11:04:07.753293Z","title":"Supervised Knowledge Makes Large Language Models Better In-context Learners","venue":"cs.CL","work_id":"f821bd32-a606-43a8-9103-b85d32762a52","year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.017382Z"},"links":{"cited_paper":"/paper/2312.15918","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a2b8220f9a088315b30d4110d563576010723c483000815c0a7b6a8a3e43067a","observation_id":"18585e90-09fc-4b26-8905-2e866c416456","resolution":{"observed_at":"2026-08-07T11:04:07.758392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07521","last_updated":"2023-12-16T12:47:19Z","snapshot_observed_at":"2026-08-13T05:52:08.305156Z","submitted_at":"2023-10-11T14:18:03Z","title":"Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07521","snapshot_observed_at":"2026-08-07T11:04:07.022136Z","title":"Survey on factuality in large language models: Knowledge, retrieval and domain-specificity,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.022136Z"},"links":{"cited_paper":"/paper/2310.07521","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:0864ef3943e2b4d1e46187479a8a10d392f1731c4d248dfe28a16e10f94f1af9","observation_id":"8225683a-db5b-4222-a75b-5c71558b5fc6","resolution":{"observed_at":"2026-08-07T11:04:07.022136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.027152Z","title":"Large language models are zero- shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.027152Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:967bfc57187bd0a4acee74e70391547802de198ea19abe6a963eaae46d51d5aa","observation_id":"404cbede-a3c2-48d9-a35f-4fe3734b43e8","resolution":{"observed_at":"2026-08-07T11:04:07.027152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-13T11:24:39.612149Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-07T11:04:07.031741Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.031741Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ce9b7e1bafb8b600bad211b25c830dae9c059807cc64f5f896e9c469deece341","observation_id":"83ab8c1a-22ac-4a8f-9eac-3cb3de3b8b80","resolution":{"observed_at":"2026-08-07T11:04:07.031741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-12T23:47:01.174840Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-07T11:04:07.036636Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.036636Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:1cd1a37f425e5f0a2f970cceb7abb1ed4c5fb1a110bfc174416555f9abbae09d","observation_id":"9bcc8e31-95e2-4215-9e50-b123a60c7ee0","resolution":{"observed_at":"2026-08-07T11:04:07.036636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T11:04:07.042216Z","title":"Ultrafeed- back: Boosting language models with scaled ai feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.042216Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:1fec8b5b8860cadb7fab289c479cacd5819948ab465bbc7bafb0b13a098e8fc0","observation_id":"f446cdd1-8045-4f10-97d8-1fdee4fe94fa","resolution":{"observed_at":"2026-08-07T11:04:07.042216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T11:04:07.051915Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.051915Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:13f2d78cee1dd4f3e36cfd4d2f9ad490ba9f4c1c33709142e3c7739cf8537bfb","observation_id":"1afc5850-2586-4b53-af6a-4fe07349a318","resolution":{"observed_at":"2026-08-07T11:04:07.051915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.056870Z","title":"Team, “Qwen3,” April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.056870Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:92328b313b987d1f0a842a7cb167bdb7fa2c19b1fbf78b7841fef35c83a5ec17","observation_id":"32811580-272d-4435-afb6-65154165c245","resolution":{"observed_at":"2026-08-07T11:04:07.056870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:04:07.061627Z","title":"Hybridflow: A flexible and efficient rlhf framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.061627Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:9fc95e8f952154ba2b37ae5c965fddc87cb4bda4f0679b437e05573119f8f025","observation_id":"7f7d287e-2326-4723-9c4c-36296bc5f83c","resolution":{"observed_at":"2026-08-07T11:04:07.061627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.066384Z","title":"A framework for training large language models for code generation via proximal policy optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.066384Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:287fcb87768a165e8b6901a379001711af8670deefcf25c65511670fe76b4c40","observation_id":"2ed5251c-e61f-408c-89ff-b365ffdb9234","resolution":{"observed_at":"2026-08-07T11:04:07.066384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:04:07.075157Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.075157Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:2f35d0a78baffb0361a9982899ab378d4cba182e2cde2a03d34966d3fe3a93e6","observation_id":"08592c85-be79-4986-bd43-1d4168896b0e","resolution":{"observed_at":"2026-08-07T11:04:07.075157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-12T22:32:17.121578Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T11:04:07.079919Z","title":"Generative reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.079919Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:193549358151df328a86e50b82ce237aca715edef336973fc8c053e93600dd25","observation_id":"6c5e91f6-313d-488d-af17-339cb0313ca2","resolution":{"observed_at":"2026-08-07T11:04:07.079919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.084937Z","title":"Improving context-aware preference modeling for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.084937Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:bd5277a8e43a2e0585fc77e5f61b528769e349ed3363a38a61530902f4c0bfa0","observation_id":"db7ccc68-7dbe-4d98-b54a-14efed3aedd2","resolution":{"observed_at":"2026-08-07T11:04:07.084937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07935","last_updated":"2024-06-12T06:59:31Z","snapshot_observed_at":"2026-08-12T23:44:53.185822Z","submitted_at":"2024-06-12T06:59:31Z","title":"Defining and Detecting Vulnerability in Human Evaluation Guidelines: A Preliminary Study Towards Reliable NLG Evaluation","version":1},"cited_work":{"arxiv_id":"2406.07935","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07935","snapshot_observed_at":"2026-08-07T11:04:07.573766Z","title":"Defining and Detecting Vulnerability in Human Evaluation Guidelines: A Preliminary Study Towards Reliable NLG Evaluation","venue":"cs.CL","work_id":"950f6047-965e-46ec-b889-11aae8bea03e","year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.089789Z"},"links":{"cited_paper":"/paper/2406.07935","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b33a8f23865ff38197fb3df490d9202040da23d594d67aa676ea07b07973d7b8","observation_id":"8a617fe4-8e3b-498f-b90c-1866807daa7d","resolution":{"observed_at":"2026-08-07T11:04:07.578996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.094686Z","title":"Best practices for the human evaluation of automatically generated text,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.094686Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ea8f2a832820adafeda13acc3ea71d391c8efa6426d01864216a14e183ff08e1","observation_id":"87488f2b-c604-425b-8a52-626fdfa5666f","resolution":{"observed_at":"2026-08-07T11:04:07.094686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:04:07.099307Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.099307Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:203f99e53cbbbd5423bc7a3c382405d10689fe706ef769fdfa55902c9c000a33","observation_id":"fa1a059a-bdf8-4893-9288-213356b36821","resolution":{"observed_at":"2026-08-07T11:04:07.099307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07103","last_updated":"2024-06-12T08:31:58Z","snapshot_observed_at":"2026-08-13T04:43:25.965181Z","submitted_at":"2024-01-13T15:59:09Z","title":"Leveraging Large Language Models for NLG Evaluation: Advances and Challenges","version":2},"cited_work":{"arxiv_id":"2401.07103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07103","snapshot_observed_at":"2026-08-07T11:04:07.534092Z","title":"Leveraging Large Language Models for NLG Evaluation: Advances and Challenges","venue":"cs.CL","work_id":"752c2d4f-4952-4c97-963a-8e1cc7511685","year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.104919Z"},"links":{"cited_paper":"/paper/2401.07103","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:f010788d9992e650211cfbc7f87e1e137843ab4b4c6b75146b13b266d579dd0c","observation_id":"4be1c353-9fea-41a9-b0d1-faf73251904c","resolution":{"observed_at":"2026-08-07T11:04:07.539350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06003","last_updated":"2024-04-09T04:17:51Z","snapshot_observed_at":"2026-08-13T00:34:31.498630Z","submitted_at":"2024-04-09T04:17:51Z","title":"FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06003","snapshot_observed_at":"2026-08-07T11:04:07.109652Z","title":"Freeeval: A modular framework for trustworthy and efficient evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.109652Z"},"links":{"cited_paper":"/paper/2404.06003","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:5ae5bea91d993e3057538141184d5d3c31deb2e1460f8949883d8b0ae28e463d","observation_id":"aac12416-9c89-4f07-a085-38a7e4404567","resolution":{"observed_at":"2026-08-07T11:04:07.109652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.114445Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.114445Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a81c39de88021965f6e39d86421481dc0e93296fd6d6d93dc6f2f7f1330b9535","observation_id":"27f6e241-7a3b-4db7-86b9-4d656f555e4c","resolution":{"observed_at":"2026-08-07T11:04:07.114445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11894","last_updated":"2024-06-06T12:49:44Z","snapshot_observed_at":"2026-08-14T13:25:56.144966Z","submitted_at":"2024-02-19T07:15:59Z","title":"Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11894","snapshot_observed_at":"2026-08-07T11:04:07.119152Z","title":"Automating dataset updates towards reliable and timely evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.119152Z"},"links":{"cited_paper":"/paper/2402.11894","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:c38a424a529a7854494d7977f94acb88e2af5a7b86c97f6c8ff506ed3319156d","observation_id":"77f5f3d2-ef74-4f68-a451-c39f90ca04b3","resolution":{"observed_at":"2026-08-07T11:04:07.119152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00699","last_updated":"2025-07-09T19:56:02Z","snapshot_observed_at":"2026-08-13T00:40:34.368813Z","submitted_at":"2024-03-31T14:32:02Z","title":"A Comprehensive Survey of Contamination Detection Methods in Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00699","snapshot_observed_at":"2026-08-07T11:04:07.124211Z","title":"How much are large language models contaminated? a comprehensive survey and the llmsanitize library,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.124211Z"},"links":{"cited_paper":"/paper/2404.00699","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:d7418ccd2e3ff61901e8a18ba76f42ec00505e3a1a2f32992dcb4246b881ee99","observation_id":"3787a9e0-2fa5-4f7c-a854-d2cd1140ca1d","resolution":{"observed_at":"2026-08-07T11:04:07.124211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14855","last_updated":"2025-03-10T06:44:48Z","snapshot_observed_at":"2026-08-11T04:39:13.288766Z","submitted_at":"2025-02-20T18:58:07Z","title":"Prompt-to-Leaderboard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14855","snapshot_observed_at":"2026-08-07T11:04:07.129328Z","title":"Prompt-to-leaderboard,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.129328Z"},"links":{"cited_paper":"/paper/2502.14855","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:aca28c4ff9784ae15fe00115454d93675147f1cbccd8fad0c31c2a18524413f5","observation_id":"1a4e773d-0972-41b0-b0c5-f77d719df2f4","resolution":{"observed_at":"2026-08-07T11:04:07.129328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.135219Z","title":"Scaling laws for reward model overoptimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.135219Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:9580a8747cee1108f3ee3762d0b908ae871593bba71ded1398daf43dff10a7f0","observation_id":"16fb42d0-8d71-4213-994e-65da12dda5f6","resolution":{"observed_at":"2026-08-07T11:04:07.135219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-13T05:48:57.895519Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-07T11:04:07.139918Z","title":"Self-generated critiques boost reward modeling for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.139918Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:afd7dac9692ddc3a6cebc99fc9f34f064b32443a5b2c04bf71fa9caca5994165","observation_id":"a978274c-3e04-4b41-9561-e696d770c2d0","resolution":{"observed_at":"2026-08-07T11:04:07.139918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-15T00:08:59.773203Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T11:04:07.144776Z","title":"Critique-out-loud reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.144776Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:3f9964ea30de8efcc41a2a4f2820fb06c4fb32444c35006b9a8b9b9a3e0401a5","observation_id":"e2782c99-9211-4367-ad11-4a63a5f59a4f","resolution":{"observed_at":"2026-08-07T11:04:07.144776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T11:04:07.149524Z","title":"Constitutional ai: Harmlessness from ai feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.149524Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:e9d8ac51d65c9b8a475ff315cdc5c59d1d7ea0bcc85701c1b50426550f01b516","observation_id":"7f3f9ad9-0e3f-4bcf-b043-4f51188e8a69","resolution":{"observed_at":"2026-08-07T11:04:07.149524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10985","last_updated":"2025-02-16T04:07:33Z","snapshot_observed_at":"2026-08-12T06:13:42.324185Z","submitted_at":"2025-02-16T04:07:33Z","title":"Is Elo Rating Reliable? A Study Under Model Misspecification","version":1},"cited_work":{"arxiv_id":"2502.10985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10985","snapshot_observed_at":"2026-08-07T11:04:07.271374Z","title":"Is Elo Rating Reliable? A Study Under Model Misspecification","venue":"cs.LG","work_id":"030afde2-78ed-42f6-9ded-9498afa3258b","year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.154095Z"},"links":{"cited_paper":"/paper/2502.10985","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:79e04a8eabd22caed2988c7c1f7b987d215d25afa70b64662745143710413389","observation_id":"bedcc321-eb0c-4115-b9dd-2143ccb00f25","resolution":{"observed_at":"2026-08-07T11:04:07.278235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.159228Z","title":"On the biology of a large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.159228Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:af3e58748a9717e37d3b43f9f523dd2bc3d7c9ff9d4ddc5cd6bf862c5f1e52b3","observation_id":"d3eb81df-c2b1-4ff0-bf88-6ac5df644d5b","resolution":{"observed_at":"2026-08-07T11:04:07.159228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.972986Z","title":"Gpt-4.1 and gpt-4.1 nano overview,","venue":null,"work_id":"b0a0d992-c449-43e3-a1a1-04ff8ee8d880","year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.163892Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:ea4cd01035500258ba7613a1f57248586bd8a9a71642058eb529d5a2c78a833a","observation_id":"2ea09ea2-b1c6-4bdd-a03b-49a91e102ab8","resolution":{"observed_at":"2026-08-07T11:04:08.978013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.957869Z","title":"Gemini 2.5: Our most intelligent ai model,","venue":null,"work_id":"242678ef-323d-46b3-ab2e-26df7b3eaad0","year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.168303Z"},"links":{"citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:4b95a4472acff7b10eb76e7fd9d482cf4a1955015e80c2eb42736ea240ab758a","observation_id":"3ec7d72a-c526-44ee-a919-72b4c4096480","resolution":{"observed_at":"2026-08-07T11:04:08.962777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":5,"verified_fuzzy":2},"total_outbound_references":112},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 112 outbound references and 8 inbound Pith citation observations for arXiv:2506.03637."}