{"as_of":"2026-08-16T16:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fee2a1bebf47890a5d42dea0f954d8d4b4bfa826393d4c42fff485066178a32c","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:19:41.527363Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:32:38.883019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T08:32:51.695159Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"cited_work":{"arxiv_id":"2505.10597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InForty-second International Conference on Ma- chine Learning, ICML 2025, Vancouver, BC, Canada, July 13-19","venue":null,"work_id":"1023f79b-a6ee-4c76-b3b6-c5f597fcd037","year":2025},"citing_paper":{"arxiv_id":"2604.16004","last_updated":"2026-04-17T12:27:36Z","snapshot_observed_at":"2026-08-11T06:26:26.358193Z","submitted_at":"2026-04-17T12:27:36Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:32:38.883019Z"},"links":{"cited_paper":"/paper/2505.10597","citing_paper":"/paper/2604.16004"},"observation_digest":"sha256:c85ed3de315e921d958b25cc8d314e9d147844ed25053199a00e0a6cea3c204c","observation_id":"b431773f-cf7b-4d93-9727-f0dfce4a409b","resolution":{"observed_at":"2026-05-10T08:32:51.696658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10597/citation-record","integrity":"/paper/2505.10597/integrity","json":"/paper/2505.10597/citation-record.json","paper":"/paper/2505.10597"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T21:19:41.263687Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.263687Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:49d9ca356b149ab692662d63a8b90bc4fe5505695666f393fb8a09ff16bee793","observation_id":"3030dd8e-2d36-4d2c-8741-5ed4fca3c232","resolution":{"observed_at":"2026-08-15T21:19:41.263687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.268318Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.268318Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:c82c48dadabac81edef05ebd2bd42a7cdc336d4231c44acde4698630b2491070","observation_id":"7ca5174f-0ea4-406a-a676-b463e0ca9104","resolution":{"observed_at":"2026-08-15T21:19:41.268318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-08-16T12:41:46.263954Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-08-15T21:19:41.271849Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.271849Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:46c44c62b1d34b27fc93fde4fcc43feefe1788c04a9d5857bba0fe8d9dbb28b6","observation_id":"fa577b07-d0a0-418e-97dd-183650ecf221","resolution":{"observed_at":"2026-08-15T21:19:41.271849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04950","last_updated":"2025-04-07T11:34:48Z","snapshot_observed_at":"2026-08-16T12:43:24.730122Z","submitted_at":"2025-04-07T11:34:48Z","title":"A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04950","snapshot_observed_at":"2026-08-15T21:19:41.275259Z","title":"A unified pairwise framework for rlhf: Bridging generative reward modeling and policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.275259Z"},"links":{"cited_paper":"/paper/2504.04950","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:593cb95c02e98c8b1c54f2eb7b8ece1e54dbbdbdb606c32c75fe35b4febbc440","observation_id":"00e2721e-cb01-40d5-ae25-630bdfb76a8c","resolution":{"observed_at":"2026-08-15T21:19:41.275259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04618","last_updated":"2025-03-06T17:03:17Z","snapshot_observed_at":"2026-08-16T12:52:26.037162Z","submitted_at":"2025-03-06T17:03:17Z","title":"Better Process Supervision with Bi-directional Rewarding Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04618","snapshot_observed_at":"2026-08-15T21:19:41.278716Z","title":"Better process supervision with bi-directional rewarding signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.278716Z"},"links":{"cited_paper":"/paper/2503.04618","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:442b75ad0673986166923b8ab6292aa36c981587f1085946511eb67a2372f557","observation_id":"92402796-48dc-41fc-9aea-a29af5247491","resolution":{"observed_at":"2026-08-15T21:19:41.278716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.245667Z","title":"Reward Function Design in Reinforcement Learning, pages 25–33","venue":null,"work_id":"fbb3bd23-a0cc-4543-8aca-93921d28ee51","year":2021},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.282169Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:93aaae220c7d8a822f85038f75bbba30ce4c87be5b3c04cd279e9d34aea6e883","observation_id":"4d239447-3e69-4824-bafa-4fad15c5596c","resolution":{"observed_at":"2026-08-15T21:19:42.248402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-16T03:45:29.671274Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-15T21:19:41.285668Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.285668Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f6f07c49f5f8df48a2a829a014976b9c64eeb996b1e66ee5dd7ed4a976a83de5","observation_id":"be8753fc-b9cb-4731-9515-b7a1cb6c1dab","resolution":{"observed_at":"2026-08-15T21:19:41.285668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.288969Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.288969Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:8e6af15953fae5f0953f28f1cbccdf7a21829cef0b30918b9e06f55820f98e74","observation_id":"3289ef25-83b8-40ca-baa2-b91abff2fa82","resolution":{"observed_at":"2026-08-15T21:19:41.288969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-15T21:19:41.292618Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.292618Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4bf3ae1f49af05555100293a95caee299e0368e40959050e408327277fee06e3","observation_id":"21ad8af1-130a-4f9f-bb6f-4d01402cdb91","resolution":{"observed_at":"2026-08-15T21:19:41.292618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.232552Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms, October 2024","venue":null,"work_id":"e8da249f-911e-4780-b090-40c4c0921275","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.296080Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:9ca2a3d1b694672576e1cab027e00a2241b15562d36fdb78da36f581c232bcbd","observation_id":"1c8d58a6-9201-4524-b469-2666a30a531d","resolution":{"observed_at":"2026-08-15T21:19:42.235122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.224821Z","title":"RMB: Comprehensively benchmarking reward models in LLM alignment","venue":null,"work_id":"4232582f-fcf6-4a2c-b12d-bc6878a6c5fc","year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.300521Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:707380d83fb3f898a084dfcaf4ad9fbc7135cba94a9bae2b61f29c29cabc781b","observation_id":"ba77e19c-df9a-46d0-81a4-eeb13a0ea201","resolution":{"observed_at":"2026-08-15T21:19:42.227695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.216964Z","title":"Helpsteer 2: Open-source dataset for training top-performing reward models","venue":null,"work_id":"77742b9c-7c3b-4ef8-a258-66c840b7e031","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.304537Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:32d067ca8bafe61884d1f506328d6e24f989492490d4f6e88952999fc8eca636","observation_id":"082da1a0-2646-43a7-a0a0-e67ca2f656d6","resolution":{"observed_at":"2026-08-15T21:19:42.219817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.208986Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"ee73d2a1-8955-4597-8476-e6d78d601d23","year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.307570Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:92cdad3cbde3f06cddb56ac3ff0271b454a7a07c4b24241b5fb99fbbed5a809b","observation_id":"60ff893e-87d5-4441-bd2e-aab7d1ffb549","resolution":{"observed_at":"2026-08-15T21:19:42.211777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.200793Z","title":"Impact of preference noise on the alignment performance of generative language models","venue":null,"work_id":"940e6212-b808-4ed4-abd7-b2ae38f0d1e9","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.310840Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:8c43f36f14d689927fbc13cd127dc7c097de3586d50ff267081e4969b68ef4ee","observation_id":"38fba78c-52a5-4611-8f9d-0db0dae359b5","resolution":{"observed_at":"2026-08-15T21:19:42.203441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.192225Z","title":"Improving reinforcement learning from human feedback using contrastive rewards, March 2024","venue":null,"work_id":"15a2e95b-aeea-426b-8807-e7b5ee118252","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.313689Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f7ec1464684518750280085909f7192ee61dae2fff9767014d82f469559e949e","observation_id":"53221f72-75e5-41ce-849e-7ecbc4f10ae5","resolution":{"observed_at":"2026-08-15T21:19:42.195356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.184083Z","title":"Goal misgeneralization in deep reinforcement learning","venue":null,"work_id":"5f59af38-66fe-4d84-ac37-8fe36500414f","year":2022},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.316987Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:093ba8132d19dd5f7c6f565d2a9220280313a0cde55895a82884acc9c3b2a26f","observation_id":"988419a2-f71a-4481-8f66-eeacda53a897","resolution":{"observed_at":"2026-08-15T21:19:42.186985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.175876Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"6c2cbb8e-264d-4f30-986b-ee8ed51a5f19","year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.320021Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:7ee4c00c750e58c9aa9360eb3a00445bf1270361cbf064bb8de03a260b839079","observation_id":"fde9f6c0-a8b0-4a72-8da0-9a1a444cf8ee","resolution":{"observed_at":"2026-08-15T21:19:42.178575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.167622Z","title":"Improving discriminative capability of reward models in rlhf using contrastive learning","venue":null,"work_id":"048e4c47-066e-4d0f-a6ad-3afbf0d6bfe2","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.323132Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:24794d5a150eb6877589914b5345182b87f7fe12db5378b45e7182bd6d5e97e5","observation_id":"f48b4cb1-5d4a-40ed-9ea3-02446c1a41dc","resolution":{"observed_at":"2026-08-15T21:19:42.170632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10184","last_updated":"2025-05-28T11:59:41Z","snapshot_observed_at":"2026-08-16T14:18:12.275285Z","submitted_at":"2024-02-15T18:39:24Z","title":"Reward Generalization in RLHF: A Topological Perspective","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10184","snapshot_observed_at":"2026-08-15T21:19:41.326063Z","title":"Reward generalization in rlhf: A topological perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.326063Z"},"links":{"cited_paper":"/paper/2402.10184","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:fcfdc35199ae949ed09ac5d2e9f37e053a4734b2354d6babf48c0f8814f737ae","observation_id":"d58fa8a7-78b0-417d-8794-d3fe9ad0c387","resolution":{"observed_at":"2026-08-15T21:19:41.326063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.329460Z","title":"A note on dpo with noisy preferences & relationship to ipo, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.329460Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4bff43e2b439dda25b8196c23c47e9759dd171c6a690beb727489c6bc556a678","observation_id":"2a2abe0b-2f93-4fdb-9f83-54a3fb57ff3b","resolution":{"observed_at":"2026-08-15T21:19:41.329460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.153306Z","title":"Provably robust dpo: aligning language models with noisy feedback","venue":null,"work_id":"db80c2bb-5820-4ff3-bfa7-8216c15c618b","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.332351Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:b9861d286a9a322f237a97f6640c32a32295f8a0e31d7fe0621a660e0b4b2d42","observation_id":"16d62cf5-fd55-4a94-83e5-bc4e82b705ba","resolution":{"observed_at":"2026-08-15T21:19:42.156044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07880","last_updated":"2025-04-18T08:05:53Z","snapshot_observed_at":"2026-08-16T13:35:20.223215Z","submitted_at":"2024-07-10T17:48:25Z","title":"Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07880","snapshot_observed_at":"2026-08-15T21:19:41.335604Z","title":"Towards robust alignment of language models: Distributionally robustifying direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.335604Z"},"links":{"cited_paper":"/paper/2407.07880","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:19123c4b528079b59942dbad646b947052b4e5a6e8c3ab5ee5d863b5368a1908","observation_id":"18218c88-4406-4f6b-8e3e-56db5d47e382","resolution":{"observed_at":"2026-08-15T21:19:41.335604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04102","last_updated":"2024-05-28T17:11:53Z","snapshot_observed_at":"2026-08-16T14:03:20.802168Z","submitted_at":"2024-04-05T13:58:51Z","title":"ROPO: Robust Preference Optimization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04102","snapshot_observed_at":"2026-08-15T21:19:41.338848Z","title":"Ropo: Robust preference optimization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.338848Z"},"links":{"cited_paper":"/paper/2404.04102","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:cb85b50ea0b012a21fa5a363525542deef8e0ff12a11eaef4c04d95fea7fcfb7","observation_id":"4157e457-ac76-4f1e-8d66-a8849691436d","resolution":{"observed_at":"2026-08-15T21:19:41.338848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.342349Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.342349Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:9062ef9be1b4bddbb42a89bf03348b94e35ca59fe440c96e9b31d5f6accbfa66","observation_id":"96fc20ea-3b02-4aca-b22f-12ad442ef022","resolution":{"observed_at":"2026-08-15T21:19:41.342349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.345277Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.345277Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:76252a332c41deb94886da5592c91d26b9e767082a98101c07da6b63ab702c2e","observation_id":"9ff9cb68-246c-472b-a123-41e13de42a5b","resolution":{"observed_at":"2026-08-15T21:19:41.345277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.134632Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"ea7e8d8b-0303-4a47-9a3c-2299d548d7bd","year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.348463Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:123796ff0fc873e01674b7187bb12f078ad7f4f00995acb6836fc88711bf421e","observation_id":"b8ccced3-09c5-4b76-b69f-9e5cb79926c2","resolution":{"observed_at":"2026-08-15T21:19:42.137207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.125630Z","title":"Confirma- tion bias in human reinforcement learning: Evidence from counterfactual feedback processing","venue":null,"work_id":"2ece3433-ae8e-4355-982b-aa3124da04ac","year":2017},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.351616Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ed30ad9d24dcfe1a144fda372b12cd08cc8222994835d0a128a3b379d75c4d1c","observation_id":"8ef22d1c-5541-41d8-a330-f0e54ccc63c1","resolution":{"observed_at":"2026-08-15T21:19:42.128912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.115870Z","title":"Pseudo- labeling and confirmation bias in deep semi-supervised learning","venue":null,"work_id":"7b2af33e-7e9c-4269-9338-3b86528144cd","year":2020},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.354598Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:28079d75cdc96ceb3d5ade2c49fab354e683d3d4bf7e090c41bdeb209fccd281","observation_id":"ba666142-e16b-42e1-9f92-c3b045e2efdb","resolution":{"observed_at":"2026-08-15T21:19:42.119261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.106977Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":"2eb1eca3-7a89-479e-b9c1-6839189d625b","year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.357680Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:c606450528a1ae92e5eb3b053beb2310d07c77dbcb6a5baad57f324c1f70fe97","observation_id":"cabc74fc-328b-4ccb-9ac2-c5c7083b72f4","resolution":{"observed_at":"2026-08-15T21:19:42.109684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.361790Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.361790Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:509e879955319b18d92eb687cc604cb810f921554e3c791ed1ec97778471f433","observation_id":"cf523574-1ae8-40ac-9f1a-f61880f0780e","resolution":{"observed_at":"2026-08-15T21:19:41.361790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.365456Z","title":"Rlhf workflow: From reward modeling to online rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.365456Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:75a98325865ddcc791ad0f6fc2d110ed3d3937b3191be3262b7023e92e9fd941","observation_id":"b15471eb-e204-4329-b44c-4f008bcf0341","resolution":{"observed_at":"2026-08-15T21:19:41.365456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.368380Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.368380Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4bce5e9eeb017ff354f0902ab33772f450aabfe98d60252e095b8d2b0f1e56bb","observation_id":"f2e51a55-b2c5-4d1c-9d37-1647e826b773","resolution":{"observed_at":"2026-08-15T21:19:41.368380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-15T21:19:41.371363Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.371363Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4b08ac9a8fa8351640fca4d1d4cd46d4fe493138f2233fdabdcc351a6d208ca9","observation_id":"d782e6c3-2cd6-47a9-abcb-73ed3b3fe353","resolution":{"observed_at":"2026-08-15T21:19:41.371363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-16T10:37:13.463130Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-15T21:19:41.374445Z","title":"Secrets of rlhf in large language models part i: Ppo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.374445Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:253285232f72886919add47a9402e9a91aa9415a09111ca25a135e8326af4991","observation_id":"54fb0898-f685-49e7-ab98-c4c3a1911a67","resolution":{"observed_at":"2026-08-15T21:19:41.374445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.378271Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.378271Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:1389dbac6143e370aefac66dc8ba7eed1645af23194b19022440f9f590939ef5","observation_id":"b550525c-d12b-4d96-b34b-92ca68151aa5","resolution":{"observed_at":"2026-08-15T21:19:41.378271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-15T21:19:41.381195Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.381195Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:763894a95ff3091451cbc20ed24c8f417a5300dd64fe60e339b371a6e9c04aa3","observation_id":"8ff587ba-c6d5-4423-8122-eff6a4e55f94","resolution":{"observed_at":"2026-08-15T21:19:41.381195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.078146Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":"0acc2500-06a7-4791-9fa2-8432c2bd28fc","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.384743Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f324747c9467c33bc496e851906d79af43063e6f4345e8923aadbc241ed80284","observation_id":"5003dbc6-318f-4334-a41e-5cfc9bc965f0","resolution":{"observed_at":"2026-08-15T21:19:42.080708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.070566Z","title":"Weak-to-strong prefer- ence optimization: Stealing reward from weak aligned model","venue":null,"work_id":"7ed32707-e5b4-42c5-89b8-e0cd2010bf43","year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.387657Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:a0652b9afb551e0fea1b0b5f57ef6277334144d3f9ca2dfc46aaa4c38a79c50d","observation_id":"8a0e4840-f774-4ab0-9b3e-0d7ffa901a37","resolution":{"observed_at":"2026-08-15T21:19:42.073280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06141","last_updated":"2025-04-11T18:28:40Z","snapshot_observed_at":"2026-08-16T12:42:58.006856Z","submitted_at":"2025-04-08T15:38:25Z","title":"Adversarial Training of Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06141","snapshot_observed_at":"2026-08-15T21:19:41.390489Z","title":"Adversarial training of reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.390489Z"},"links":{"cited_paper":"/paper/2504.06141","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:48aff87b5b59225e96fc17e796ae5b6932aa36ed17c9223e971eca84b94f97e8","observation_id":"eca98603-0169-41fa-8fa7-63551354f620","resolution":{"observed_at":"2026-08-15T21:19:41.390489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.062403Z","title":"Defining and charac- terizing reward gaming","venue":null,"work_id":"d2c038a0-b6c1-4c24-b93a-5af0fa719c26","year":2022},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.393496Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:06417eb4d2079b49fefe37ca7b71f4c10aa2b29a6a420fbd5d7882e7038a246b","observation_id":"c3ad53a6-8e84-4009-8174-79ef207ada62","resolution":{"observed_at":"2026-08-15T21:19:42.065101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-13T18:34:28.304602Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-15T21:19:41.396471Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.396471Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:bd7faf66d9ec208f977ff9a5059df28fca88fa91b255e623bd00dcc7ed501360","observation_id":"b4d11414-6125-41d7-a0b6-b2b415bb0752","resolution":{"observed_at":"2026-08-15T21:19:41.396471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.055075Z","title":"Odin: disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"31fbcfe2-278b-4a1d-a685-e802e329400e","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.399094Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:3199acc7c1148503ec4d356459afd0b7390ebf1fdd0222ca21e7506bfca27260","observation_id":"bff2a27b-8fc5-41b3-b048-998c8d611d2c","resolution":{"observed_at":"2026-08-15T21:19:42.057629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09724","last_updated":"2025-02-28T23:36:40Z","snapshot_observed_at":"2026-08-16T13:09:57.865178Z","submitted_at":"2024-10-13T04:48:40Z","title":"Taming Overconfidence in LLMs: Reward Calibration in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09724","snapshot_observed_at":"2026-08-15T21:19:41.402572Z","title":"Taming overconfidence in llms: Reward calibration in rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.402572Z"},"links":{"cited_paper":"/paper/2410.09724","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4515059300fe502562ec23286a73d76c27f760db5a5f840c45faf95faac6b044","observation_id":"a467c576-3136-40ee-849e-12726229087b","resolution":{"observed_at":"2026-08-15T21:19:41.402572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.046701Z","title":"Overcom- ing reward overoptimization via adversarial policy optimization with lightweight uncertainty estimation, July 2024","venue":null,"work_id":"edc367a2-ee1f-4197-8eab-76c7a466fe23","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.406480Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f3dfa345ddb6e66930981a321d58f8006e0c24b69f8fd319fd2f85fee8f88bff","observation_id":"6c73bc40-df62-4342-a705-47d6cbc6fc6c","resolution":{"observed_at":"2026-08-15T21:19:42.049800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.039043Z","title":"The energy loss phenomenon in rlhf: A new perspective on mitigating reward hacking, February 2025","venue":null,"work_id":"543d3621-8f04-4388-8a79-7c030b243f0e","year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.409426Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ccaca464134bc27dda4ea064589f1b0d13824467eb4d0fb67e520e11c71e17e3","observation_id":"eb3802f2-ce7b-42ab-a53c-98f3a8f4f09c","resolution":{"observed_at":"2026-08-15T21:19:42.041660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.031685Z","title":"Reward model ensembles help mitigate overoptimizatio","venue":null,"work_id":"ee2a2387-d326-4d0d-8bcc-e5040c7179f6","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.412385Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:8339e69388b1c951728342adc9663b3f015c785545a07180a230f31e70351a9f","observation_id":"1c655f76-79e9-47ad-b6d7-7eb3abed0f85","resolution":{"observed_at":"2026-08-15T21:19:42.034242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.024017Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":"b841a801-5263-4025-a5b3-7ca0f176129c","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.416160Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:808624476036ca1ab1e912bdd62ecc35259fdd2b5a9fb3b0f033d5a10c21b8b2","observation_id":"52e9f12e-fc13-45a0-885e-f9273de244d7","resolution":{"observed_at":"2026-08-15T21:19:42.026701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.016424Z","title":"Reward-robust rlhf in llms, October 2024","venue":null,"work_id":"8a5ab24b-1a56-4219-bf10-60dcaaddc551","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.419845Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f8c9c7c417aac59347aacf901b645814c05d01d92a29c63c779ac9d7154de440","observation_id":"100c5a23-f993-43dc-8f28-a38a16053b51","resolution":{"observed_at":"2026-08-15T21:19:42.019019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:42.008496Z","title":"Uncertainty-penalized reinforcement learning from human feedback with diverse reward lora ensembles, December 2023","venue":null,"work_id":"a7fb4167-4410-4e30-9223-43fcf3c6ca38","year":2023},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.422374Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:d09e1dad57e59391c552a8822125893c8942e3b0faf963379619041d305cc9e7","observation_id":"6b50f217-957a-487a-96e1-3f8ebff88faf","resolution":{"observed_at":"2026-08-15T21:19:42.011300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.425267Z","title":"Interpretable prefer- ences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.425267Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:0048387be3d025959dfab6e03e5bee9b80b709867c1fcfbba0ddd965f12fa705","observation_id":"6b62b461-8298-4123-b4e8-66c177a4693e","resolution":{"observed_at":"2026-08-15T21:19:41.425267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-08-16T13:17:01.360159Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-15T21:19:41.428176Z","title":"Rrm: Robust reward model training mitigates reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.428176Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ea4723e5ca9692594413e9a8e5631669decc4edb6ff9711054027affa6dc0b84","observation_id":"57244e02-3310-442d-959f-f0d6e96fe115","resolution":{"observed_at":"2026-08-15T21:19:41.428176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.430957Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.430957Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:27bd599390a7e38591a629a7ea82fdf225cf674c121baed6ea14d6740d71fc5a","observation_id":"f8052a73-4469-45a1-af82-b118f48354af","resolution":{"observed_at":"2026-08-15T21:19:41.430957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T21:19:41.434016Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.434016Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:892fa98c58dd7fda4207c2a54bea91fa7ec29f684edce30f5d3b948d9b45cbf7","observation_id":"94c0d798-619d-468d-a22b-5d7c26826fb4","resolution":{"observed_at":"2026-08-15T21:19:41.434016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.989689Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":"0de21254-b37d-4351-8fe0-c093c1e9e867","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.437862Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:277e1c4b6c98a75e258e3d9c19bfd98ae3f92254a82d2e95dfd06258a03b37b4","observation_id":"951e9b08-4d2f-40db-9183-2f049dbd036b","resolution":{"observed_at":"2026-08-15T21:19:41.993237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.440975Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.440975Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:7f2e0aca15d6ec7eb3682b36ac7371b709f60bbd0ce179baef078cf26169c366","observation_id":"5be45d8c-f341-4446-a2aa-549e0898254b","resolution":{"observed_at":"2026-08-15T21:19:41.440975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.974696Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":"ac813300-debe-4857-a581-0d80f6b84383","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.443647Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:89d48f010f3c27e8c29b870473790fdd604d785db2d311e7c5fb104017fc8994","observation_id":"0020e4f9-2fa6-4555-a8a1-c7af9ab23f5b","resolution":{"observed_at":"2026-08-15T21:19:41.978016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.965382Z","title":"Smith, Yejin Choi, and Hannaneh Hajishirzi","venue":null,"work_id":"99563ff6-eaf2-4065-bc73-a27aa028f86f","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.448068Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:5c334fce978c694b38ac5cfe9bbb2fc4381ddbf1ec8d39aad740dccedf125937","observation_id":"3b7cb61e-1722-40ea-97b9-284057dc51b6","resolution":{"observed_at":"2026-08-15T21:19:41.968885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-16T14:20:38.839188Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-15T21:19:41.451174Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.451174Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:cf3f3cc41e0169e1f0f1f9820d292d35b3d1c22cfa59af2f3ce9cfc394e5e1a7","observation_id":"c9c7c98f-214b-4e3c-9397-7cc677826137","resolution":{"observed_at":"2026-08-15T21:19:41.451174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-16T01:46:33.823368Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07599","snapshot_observed_at":"2026-08-15T21:19:41.454892Z","title":"Dpo-shift: Shifting the distribution of direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.454892Z"},"links":{"cited_paper":"/paper/2502.07599","citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:5e83c48edfe39b381a2bb6717459eceb009b6b3279a36557cd558e390ba620c7","observation_id":"5d220a40-9759-4e58-a761-1d70cbc63392","resolution":{"observed_at":"2026-08-15T21:19:41.454892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.955876Z","title":"Understanding generalization of preference optimization under noisy feedback","venue":null,"work_id":"94e67184-8155-42f3-98fb-eb39fc0134ad","year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.458038Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:f00d3bf842c3810031bf8a2ece4d778113286bb4a9ef14c69273fe3a64c953ce","observation_id":"9557c46c-3769-4070-9a87-bd0f00de5dd9","resolution":{"observed_at":"2026-08-15T21:19:41.959084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.946982Z","title":"Robust reinforcement learning from corrupted human feedback","venue":null,"work_id":"d3c33f35-ed99-47f1-9487-30ba5fc4cc5a","year":2024},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.461332Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4d2474cb97f18e215b5cef61473f953af43fd17f885f2dae93476d75b9f8e6b5","observation_id":"90ca6071-d427-4f0c-a23d-4cdaa5e807cb","resolution":{"observed_at":"2026-08-15T21:19:41.949483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.937599Z","title":"Theory of games and economic behavior, 60th- anniversary, 2007","venue":null,"work_id":"157c4cef-9c32-49aa-8252-23d3a823b5d8","year":2007},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.465070Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ade441be8556083d5035bda65cae125706b48ff49213b60d90e66df32b7688a0","observation_id":"19fd781e-d323-47f1-9ff3-051373fba9cc","resolution":{"observed_at":"2026-08-15T21:19:41.941040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.468046Z","title":"Multiagent systems: Algorithmic, game-theoretic, and logical foundations","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.468046Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:fadaf916dbbf3e3b12826b199e8c686488e48d1ea2cc80824ba72520c15a33aa","observation_id":"24cdd193-71e1-4a6d-aec3-67c2dbc7e614","resolution":{"observed_at":"2026-08-15T21:19:41.468046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.923503Z","title":"[Yes] \" is generally preferable to","venue":null,"work_id":"aea29a02-f645-4d0a-b217-95e69e3de057","year":2017},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.472095Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ba06aa7d1cfa5f05eae3b09dbdf0fde6824a91afcf6830bde1ba5744bd4057a5","observation_id":"f30cc94a-75ce-452a-a767-917d0e9a53e8","resolution":{"observed_at":"2026-08-15T21:19:41.926924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.915500Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"57e66645-ff55-4614-b90e-01afbe81d2ad","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.475861Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:07feabeef05c7f5b8e949bb9ac96940d5a3badcea82a13223c1b06038549e4c4","observation_id":"587f0f17-064a-44f2-adff-90fc31e59d3d","resolution":{"observed_at":"2026-08-15T21:19:41.918496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.908633Z","title":"Limitations","venue":null,"work_id":"a5078358-2867-4939-bd8e-f63491dc149c","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.479196Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:92ce4a96c7d433e4ef19b4da4a09c65c6a4bb644e554fe582aa33cb8a09b864f","observation_id":"2587aa68-18fb-45d6-b3f9-7186901ca14d","resolution":{"observed_at":"2026-08-15T21:19:41.910990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.900117Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"ae88c88a-a087-408e-97bf-0e30124420c0","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.483442Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:9c1b15fbf2a8b27feb84b4ac2990c0764f71b8576befbf915e7c9c9c07123749","observation_id":"0ae68a1d-93c7-4ca9-bf0f-efb0910d40e3","resolution":{"observed_at":"2026-08-15T21:19:41.902892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.891129Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"6041b2d0-983d-4dce-968a-9d07ed948172","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.486539Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:b909febcb6fc79427b40e8f870f685590e8556f5d4feb08f8e531e3577921120","observation_id":"45575863-75fc-491c-b97b-d3828cd3544c","resolution":{"observed_at":"2026-08-15T21:19:41.894349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.881636Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"59e6cefd-7ec0-4c24-b0e8-9d7f50f1b3e9","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.490836Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:45fcf42872952612745fb4066db229b205908beea94d35f8468f4f0508646c51","observation_id":"28b3ac97-92c3-44fd-808d-72b200a62c21","resolution":{"observed_at":"2026-08-15T21:19:41.884914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.872541Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"06bc2b71-871a-4872-9621-03de20bcbf5b","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.494510Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:d969251037dd92f495a7f80b8825b72d85caa3fd9895f594955ff38ad1f82586","observation_id":"ca42c146-6f32-41b1-a962-51a0703b86ee","resolution":{"observed_at":"2026-08-15T21:19:41.876158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.861514Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"cc8b0f6d-74da-4bd7-a82d-0dd2a3f846a1","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.497449Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:16abbf271a324de26cc51cb258bb2d177d8f5c98db31889d5edb06ce2f68242e","observation_id":"6e4a06e4-3921-4646-909d-6cfebcadef07","resolution":{"observed_at":"2026-08-15T21:19:41.866146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.850656Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"b955e98c-138c-48c6-800b-e9f1cb01078c","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.500484Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:ebf1a1d3ac169e642ea06a0e25aad607cb89193f7450d4d8994fad5f7dc2808d","observation_id":"e0aa576d-be3d-41bc-a356-eb2cdc6abde9","resolution":{"observed_at":"2026-08-15T21:19:41.855662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.838788Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"3b795a6b-dc08-4864-b8e9-4097e36ecc0b","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.505139Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:e7de2f9ce5eeebf7917774759da6964f0c27e10ea007afd04986bde2a814a46b","observation_id":"c43dba8f-bd3f-4f05-ad03-59ed9980f531","resolution":{"observed_at":"2026-08-15T21:19:41.843927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.820675Z","title":null,"venue":null,"work_id":"91273797-06bc-4077-bba4-91ec6ca20bd6","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.508480Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:4b5fa967f11b6c80fd4596ecd7f945f5065422d7d9a86d3a6fbce9a1c45872c8","observation_id":"76be5127-3bb9-4fb1-bdfe-168239b3e32c","resolution":{"observed_at":"2026-08-15T21:19:41.828840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.803081Z","title":null,"venue":null,"work_id":"d7551663-bca6-4e0a-986f-7b3e7fb84db9","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.512195Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:e0ee6e06fe442dee21da1a8a291f3cb56bad7c6f8789d6c6d5536232706e3252","observation_id":"187b16d1-8534-48d7-ba67-1575806c6f2b","resolution":{"observed_at":"2026-08-15T21:19:41.811120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.783525Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"98b4232b-9e66-4af6-a252-c98313dbbc2f","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.515056Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:0a6504763255a56b27a6755a8955f8c5ebe13a63306a3fc7edfbf41a26d501cc","observation_id":"a29dce32-996e-4b09-9b85-e560dff6dfb2","resolution":{"observed_at":"2026-08-15T21:19:41.792568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.765510Z","title":"• Researchers should communicate the details of the dataset/code/model as part of their submissions via structured templates","venue":null,"work_id":"1496a09d-4b1a-4079-832d-fab033de0f7e","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.517980Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:3b597c7e6222396626696b17206a1b579a1e49fb382476739bee4db92e10ec6a","observation_id":"27395a9e-b895-4c14-88eb-bfb3742071e2","resolution":{"observed_at":"2026-08-15T21:19:41.772923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.746344Z","title":"32 Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"300ace16-4546-4b7f-9970-9dcbdf114a89","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.520830Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:9cd600728ffefe4fc32540453c2a1f8743d52f77cc8715bcbe148562e9956283","observation_id":"4ec17451-33bb-4202-ad24-41121e2d824b","resolution":{"observed_at":"2026-08-15T21:19:41.754738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.731440Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"30331fe6-955c-46fd-9c19-4bfff1983358","year":null},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.524216Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:d1df9f832ccd94ed42da1e406f4944d7aa86f27d1c921d98352839de8262090e","observation_id":"009638ff-9737-402e-ab8d-ae28df7ecc55","resolution":{"observed_at":"2026-08-15T21:19:41.737498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:41.712453Z","title":"Answer: [NA] Justification: LLM is used only for editing, or formatting and does not impact the core methodology, scientific rigorousness","venue":null,"work_id":"26332e95-e7ea-4347-90b1-e2a4d3e469cc","year":2025},"citing_paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:41.527363Z"},"links":{"citing_paper":"/paper/2505.10597"},"observation_digest":"sha256:84a6b168d870022ace1864d180188a432595789be4ba1e956817703806b0eff5","observation_id":"767017fa-c7a9-451f-8aa4-13ab29e25803","resolution":{"observed_at":"2026-08-15T21:19:41.722866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10597","last_updated":"2025-05-19T03:28:14Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T01:47:23.448958Z","submitted_at":"2025-05-15T10:58:20Z","title":"Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 1 inbound Pith citation observation for arXiv:2505.10597."}