{"as_of":"2026-08-08T10:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9c00d81f9663f5d15029848d4e707c86887a34f7cbec7a17b9e80c7ba1f9378","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:56.857674Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:27:05.232691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.265666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T12:20:17.430881Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:1a5cdf57f49688a65160d2ef576ffb7b59c5747681a721b820d1a52e137c146a","observation_id":"09ba2b4f-5426-456b-8e8d-e3b90054b011","resolution":{"observed_at":"2026-05-22T12:21:30.982861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-08-06T04:27:05.232691Z","title":"arXiv preprint arXiv:2505.16265","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:27:05.232691Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:739bbb207586bd25a9f96fa93335bfedd8236ba6cdf46f927eb52aaaa14c08aa","observation_id":"d56e645e-ecad-49e2-beb1-9b4a70e64d7c","resolution":{"observed_at":"2026-08-06T04:27:05.232691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":266,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:b2327cc60fb1d556330a8b44f7477c4ed0795849b5312db30e5306af4bed2832","observation_id":"a4e76bdc-41c2-4d56-a2ec-563800eacb62","resolution":{"observed_at":"2026-05-18T19:21:48.839803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:6330321f59ea82726b585257322d9b4b7056e33e9b1f39e320af6ac8ba6a5ec4","observation_id":"d543c8c8-7392-4f7c-a4c7-18eb6997aa46","resolution":{"observed_at":"2026-05-18T00:05:31.521389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:7e6a5981451d23703a3f1351b3d1924d93c8cb1cc6d80d3b2972af959ea4c98f","observation_id":"6a7b75e1-8549-4c77-a49b-f46d21f74ffc","resolution":{"observed_at":"2026-05-12T10:06:27.574471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:f3c89fae95048296048059cb511954a13033eba3da249e3fbb6b4b8a4ba4f365","observation_id":"7c2feb22-2a50-40a3-a289-dbdae529330b","resolution":{"observed_at":"2026-05-21T09:14:06.015503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:36d25410f03b20685ded6a31663d48514f6f3bf03d0e81053cd8489867758eca","observation_id":"1c86b97d-afc4-47f6-b8d9-8d25caf5fcec","resolution":{"observed_at":"2026-07-01T20:56:13.267006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16265/citation-record","integrity":"/paper/2505.16265/integrity","json":"/paper/2505.16265/citation-record.json","paper":"/paper/2505.16265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:09:52.682509Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.682509Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:6c6edc7611bf5998a322454416d20693185f23591c75907894cbfabe4fdce010","observation_id":"c58bb891-0435-43ff-9642-7742c8b15d5b","resolution":{"observed_at":"2026-08-07T15:09:52.682509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.737506Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.737506Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:7fea8ec8ad659f510822d44bb3848afb9a1cf3293a35c154d54ade5ea12fdf75","observation_id":"59bfa91b-2909-4427-9ccd-c67d9ec13674","resolution":{"observed_at":"2026-08-07T15:09:52.737506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.808601Z","title":"Self-instruct: Aligning language models with self-generated in- structions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.808601Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:9aa60bf92fe9c7058912b54a6576b4499faf2ab0916b4f78eace5b6856881ff8","observation_id":"f07ae36f-c76b-4d7c-8c1f-f222743a2dc6","resolution":{"observed_at":"2026-08-07T15:09:52.808601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.870219Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.870219Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:ddd9691a1600f512d697f8099cc1f4b1d8b31b9f9d3a1416cc55b21e9787ee36","observation_id":"43a330cc-1fed-4d3c-9827-4ac2971ef4f5","resolution":{"observed_at":"2026-08-07T15:09:52.870219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T15:09:52.975342Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.975342Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:4de9e2c4c6b454f9c0acbe6834b8404aa727b7faf5e3ee92bc80528eb70a7b01","observation_id":"d72f5654-f8a9-48f7-8ff6-9ad313727da2","resolution":{"observed_at":"2026-08-07T15:09:52.975342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.051311Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.051311Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:cb8774a9bd56f6af4117ff719456ab189b37450378f3bd277a16c5c26a11d490","observation_id":"923b156a-bd74-4bff-985b-e3b4802d60f3","resolution":{"observed_at":"2026-08-07T15:09:53.051311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T15:09:53.131349Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.131349Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:d0afc644bfdf96002a163718a2a2f5b225ee47fc52dd54c440f04936b9716699","observation_id":"a518297f-2337-45c0-949c-ee65ff909fff","resolution":{"observed_at":"2026-08-07T15:09:53.131349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:09:53.173407Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.173407Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:38637c02cc28e53bdb71e148235d34e9e58d0fd70c2ae18958e7ee0951296a89","observation_id":"d19f54ef-db2a-4b5b-867e-f353c9648dd4","resolution":{"observed_at":"2026-08-07T15:09:53.173407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.526695Z","title":"Beavertails: Towards improved safety alignment of LLM via a human-preference dataset","venue":null,"work_id":"5b97b110-cd6d-4f9c-94dd-5ac982416b22","year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.261459Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:629eecd3d7694803c20d967f9cf9c9bee7ba6f664f6831fe2a476543c40f92f8","observation_id":"95b87412-9d1f-44a2-84a9-81f256e99745","resolution":{"observed_at":"2026-08-07T15:09:59.615816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.325000Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.325000Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:c71fbe16a7abc25eb276ee6a69b4db46611cde33638ade55371fba4c1091132f","observation_id":"b8da442f-c411-4031-8c19-ccdcebc0bbe0","resolution":{"observed_at":"2026-08-07T15:09:53.325000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01111","last_updated":"2024-11-02T02:22:21Z","snapshot_observed_at":"2026-08-08T06:48:58.388827Z","submitted_at":"2024-11-02T02:22:21Z","title":"Rule Based Rewards for Language Model Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01111","snapshot_observed_at":"2026-08-07T15:09:53.390130Z","title":"Rule based rewards for language model safety.arXiv preprint arXiv:2411.01111, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.390130Z"},"links":{"cited_paper":"/paper/2411.01111","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:6baa7d6aebc382bed2320cf48ea6079c4bf4aa6d60a637af46a1f01afb327761","observation_id":"1be1e9ba-9aab-4af3-9a66-735e7c64dbff","resolution":{"observed_at":"2026-08-07T15:09:53.390130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.452403Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.452403Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:49f54502ad545743c0dd2387e168de9d32eed4eae70c4764617c25a472c160f0","observation_id":"6a542a66-92af-4f80-9787-089b613587b3","resolution":{"observed_at":"2026-08-07T15:09:53.452403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.255426Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul F","venue":null,"work_id":"5bdb053f-471a-4dd0-b5c4-a71d40a5a89d","year":2020},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.539620Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:9870da3ed8c6e403da678de805c47d83f236c1311ff66dc3be521b091b453d32","observation_id":"9714b577-6cec-468a-b8b7-8700d92a58cb","resolution":{"observed_at":"2026-08-07T15:09:59.370846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T15:09:53.635786Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking.arXiv preprint arXiv:2312.09244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.635786Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:887fc9948ab1a87b9e84341d730c806d031c0b57c789c082e08d3561cf8e8a9c","observation_id":"f9169d0a-e4b5-4e96-b42f-62d01dd8571c","resolution":{"observed_at":"2026-08-07T15:09:53.635786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.734461Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.734461Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:359746031baf62be0073eea90b8b88e2804927328cf95672b6f86b991973e3f9","observation_id":"2e3a2de9-5eb9-4149-98b7-fb67fb6bd51f","resolution":{"observed_at":"2026-08-07T15:09:53.734461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T15:09:53.852749Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.852749Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:bb922667f659bb51d81b4f936e9102e99895c1f652953f393d6f6c9459fbab81","observation_id":"9cb827c2-9926-4f6e-8717-aabe5f2532a0","resolution":{"observed_at":"2026-08-07T15:09:53.852749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-07T15:09:53.954441Z","title":"Rrm: Robust reward model training mitigates reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.954441Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:67b88346b81090f4735085daabda359acb109ab6d4d99a1e5ad665c9a2733163","observation_id":"31781822-1fb8-43b9-b342-af1f9554021d","resolution":{"observed_at":"2026-08-07T15:09:53.954441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20850","last_updated":"2024-10-18T15:43:02Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:33:07Z","title":"Improving Reward Models with Synthetic Critiques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20850","snapshot_observed_at":"2026-08-07T15:09:54.077941Z","title":"Improving reward models with synthetic critiques.arXiv preprint arXiv:2405.20850, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.077941Z"},"links":{"cited_paper":"/paper/2405.20850","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:ae4a417196967cdc97d352c912c907bf588ee6d7b00f9324a0d7b7de15f6f115","observation_id":"aa3293c5-7248-418f-b6d0-259228f7611e","resolution":{"observed_at":"2026-08-07T15:09:54.077941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T15:09:54.211281Z","title":"Critique-out-loud reward models.arXiv preprint arXiv:2408.11791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.211281Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:3c3dd3e973932445125a9b5879928f41251eaa74c2f045906520d4c8f2994dbc","observation_id":"73873e99-f590-43c3-8f88-36992110828b","resolution":{"observed_at":"2026-08-07T15:09:54.211281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T15:09:54.317164Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.317164Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0d03ee986994812229513373f4880e3eeaa4876ecec799fc73c5dedff10d7c7c","observation_id":"02278e09-b24d-478b-8dae-36186b32ead0","resolution":{"observed_at":"2026-08-07T15:09:54.317164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-07T22:19:32.261381Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-07T15:09:54.445894Z","title":"Self-generated critiques boost reward modeling for language models.arXiv preprint arXiv:2411.16646, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.445894Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:b330ebb37fdcfcdeb0e8128f5dfcbffc5a380363c205b1144eeec96e402e476b","observation_id":"faf6a9ce-0c08-4f47-8de0-a77a1dec0b40","resolution":{"observed_at":"2026-08-07T15:09:54.445894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.074657Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"48410410-295e-455a-ab75-7bd27b9b4b68","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.584180Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:4da6eb94a9fe95ac4d581708b25956c54b46dc36fd1d7ba445f4213f2df3a359","observation_id":"ab3d36a6-1f52-434c-a252-04f94a95dbe2","resolution":{"observed_at":"2026-08-07T15:09:59.140897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:54.673142Z","title":"Learning to reason with llms.OpenAI Blog, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.673142Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0d156c0e640db880f9a3557e5c7fd4bac109396f51d8c50e0025a4fa2269c7c9","observation_id":"ca8cef68-5cf3-4bfc-9169-7caea7e48c55","resolution":{"observed_at":"2026-08-07T15:09:54.673142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:09:54.768046Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.768046Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a26e671c0da3d2dcea6ff0b1bacd6b466bd3effe75daf93d9a18ddb3c0ccbcc4","observation_id":"c2ca967b-49ae-483d-a002-177acfefe3f3","resolution":{"observed_at":"2026-08-07T15:09:54.768046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:09:54.919059Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.919059Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:fa383050c06fa5a5bd048c7af9f7bb07ef672c5d23716ec56af1d892a1abe835","observation_id":"d056e02f-8513-4fec-955c-7b8b41f8f23e","resolution":{"observed_at":"2026-08-07T15:09:54.919059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:09:55.000866Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.000866Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:1e7a9f2a8759ba611fcaa8aac7e13813f92944cc6b9a05cbe278e2a729da296f","observation_id":"d21f3082-9dce-4316-a9f9-2f06c95f2fcf","resolution":{"observed_at":"2026-08-07T15:09:55.000866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:09:55.146505Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.146505Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:6fac7c0586dff2956f0047d7f8c85ba19444cbd7ce430f92273714523e38d33b","observation_id":"b3c836f0-fc4e-4263-b699-052ca9d012b6","resolution":{"observed_at":"2026-08-07T15:09:55.146505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.283280Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.283280Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a1ae6b24df22585bd9ba2360506559114e647f506368786ffd2fbd9cae8efcec","observation_id":"d6f6d54b-6ec2-4a63-9475-00a3d0475250","resolution":{"observed_at":"2026-08-07T15:09:55.283280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.398260Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.398260Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:b7251a8d78cb1b98d701e24988db01a3900833d7ef8c55a24dcac7a1c832c20a","observation_id":"00e257ad-035a-4abd-8868-118ac98e178b","resolution":{"observed_at":"2026-08-07T15:09:55.398260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:09:55.488038Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.488038Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a9a9271ab20d3e94dbb96e84b03147a9896f97cd96e721747bbfffee7e57fd73","observation_id":"1f30d9f2-2268-4864-8233-10613ff33b72","resolution":{"observed_at":"2026-08-07T15:09:55.488038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:09:55.548298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.548298Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0bf5999de2575418f04c73df1ebbb1ff901e46695688a135273f0beaafe1955e","observation_id":"82111220-12b3-46b0-8fc2-b0f3719e97c0","resolution":{"observed_at":"2026-08-07T15:09:55.548298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.607193Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.607193Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:60cd381ae9e59df8df65afa2f151e6188ca05ab14880a6afd18da4dc150aed02","observation_id":"315b6cf5-c3f8-4782-a3d8-6976fb258f4a","resolution":{"observed_at":"2026-08-07T15:09:55.607193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11874","last_updated":"2025-02-25T11:04:02Z","snapshot_observed_at":"2026-08-03T12:57:24.468891Z","submitted_at":"2024-05-20T08:30:13Z","title":"xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11874","snapshot_observed_at":"2026-08-07T15:09:55.688065Z","title":"xfinder: Robust and pinpoint answer extraction for large language models.arXiv preprint arXiv:2405.11874, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.688065Z"},"links":{"cited_paper":"/paper/2405.11874","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:274ab43ce474821a736bb1619ab2f5907d61313bbb0d6712b631ce39223f3841","observation_id":"405f8c7c-4d30-4e61-a0bd-a7d3597ff81a","resolution":{"observed_at":"2026-08-07T15:09:55.688065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.804020Z","title":"Chain of thought prompting elicits reasoning in large language models","venue":null,"work_id":"ca004e5c-f019-44cd-916a-0a8ea659b2ee","year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.756393Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a0b39832c0a917962c194f7eb85f268a3921977026db4a065bbd7ea4b3dd367b","observation_id":"ea497a77-b5f1-46f0-a748-54aa1e3ede75","resolution":{"observed_at":"2026-08-07T15:09:58.870900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T15:09:55.832125Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.832125Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0be7f982a2c2903f6fe125c76c47540739db9dd71ca9cb8df38606762d9b14d7","observation_id":"4755a606-83be-4f69-839a-7730e7adbc10","resolution":{"observed_at":"2026-08-07T15:09:55.832125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.913418Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Ad- vances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.913418Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:c3ad345ff55e9a9e136629a7f36735bbc3b1a69eef5668ac3ca4b94579689771","observation_id":"95e5ed7f-22b3-4919-bbdc-19ac14b174d8","resolution":{"observed_at":"2026-08-07T15:09:55.913418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.612281Z","title":"Introducing openai o3 and o4-mini.OpenAI Blog, 2025","venue":null,"work_id":"af97d2b6-857f-41f3-8535-bfafbf88c6b8","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.990614Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:7a9cca88efe6a4517e98dd1c6b20bb067f84e200af1ed186dbdf427462bf0a67","observation_id":"f8eedf22-3a99-45bf-8183-efc9e4022c63","resolution":{"observed_at":"2026-08-07T15:09:58.678509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:56.047246Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.047246Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:feda1c11dd7dd9ee82becccfde022aa44f365c24cd0b77ae422db72f60681bbd","observation_id":"91ec9f65-4299-4d48-995d-13cef4560e11","resolution":{"observed_at":"2026-08-07T15:09:56.047246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.465558Z","title":"Grok 3 beta — the age of reasoning agents.xAI Blog, 2025","venue":null,"work_id":"8931d628-4aa6-4d03-a2e8-af99ad0d76c3","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.122255Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:4affdfcb22b81f595bfac72b98ff70b3140fd0a28c878891648df1ff435db1cf","observation_id":"fef25670-483a-49d5-8d98-06f2cf72795a","resolution":{"observed_at":"2026-08-07T15:09:58.514382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.292455Z","title":"Helpsteer2-preference: Complementing ratings with prefer- ences","venue":null,"work_id":"24cc61ef-3ccd-41b6-8026-18636197b649","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.198046Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a8f2c28939f1ea157856d4f57af5ad6f4469ef68554b9ed111620a53ac6e1b38","observation_id":"1f226cff-6000-4620-a171-35e03b575a8b","resolution":{"observed_at":"2026-08-07T15:09:58.371923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:09:56.275062Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.275062Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:01f14789a7a714422cb71423cf415d7cb04ff180fe6b37ab055f2fdd2d0b668e","observation_id":"491e81c0-9044-40e1-ae49-84b255cc435f","resolution":{"observed_at":"2026-08-07T15:09:56.275062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T15:09:56.314481Z","title":"High- dimensional continuous control using generalized advantage estimation.arXiv preprint arXiv:1506.02438, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.314481Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:c8305fd9d00615c35165e38398c01d324cae22418ca7af015e9d5bda6250ce17","observation_id":"f9970fc8-6749-4400-8c26-6721eeff6864","resolution":{"observed_at":"2026-08-07T15:09:56.314481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04378","last_updated":"2025-05-30T16:42:57Z","snapshot_observed_at":"2026-08-07T17:24:57.547445Z","submitted_at":"2025-03-06T12:30:24Z","title":"HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04378","snapshot_observed_at":"2026-08-07T15:09:56.386550Z","title":"Dedicated feedback and edit models empower inference- time scaling for open-ended general-domain tasks.arXiv preprint arXiv:2503.04378, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.386550Z"},"links":{"cited_paper":"/paper/2503.04378","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:09c3d589e77e949dd89650ffb52fee777a879dc1cbfda7737b390c102a3d28f8","observation_id":"2c5bc38d-4ee2-48c6-b992-dabbb58dff82","resolution":{"observed_at":"2026-08-07T15:09:56.386550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T15:09:56.474821Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.474821Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0dac332d4cb4c12a2c706f6f90799aaf200239bde276c344b56af9c064c47f04","observation_id":"c77ff6d2-21a3-4b1c-b875-fabd16585d9a","resolution":{"observed_at":"2026-08-07T15:09:56.474821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.176163Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"a7774a56-cc44-418b-86e6-0fcae4268244","year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.552982Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0068308854cd0c2030f88e51b4b929af3a518507bcc697e082853b74ec7ce94c","observation_id":"ff40040a-91c2-4b89-acc5-7b8adba6ef66","resolution":{"observed_at":"2026-08-07T15:09:58.236959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T15:09:56.640514Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework.arXiv preprint arXiv:2405.11143, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.640514Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:2d42cc463749a263bfb052258b2b0cf58b383b99035c3d3fbb5def3488bb8b91","observation_id":"f22dc59e-be31-420c-83ff-cf2f8ae7d59d","resolution":{"observed_at":"2026-08-07T15:09:56.640514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:09:56.727030Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.727030Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:7373bb130657c8ea7e3cf40bc665fca76199e373a950d6f694f1bf84ebf0c35c","observation_id":"855b4e30-ca65-46b9-8145-2edb3eeeaab0","resolution":{"observed_at":"2026-08-07T15:09:56.727030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:09:56.803561Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.803561Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:9f9dde16a7488133f1de71dc73014e3cf6a394c67833e0e22d3a4946dbbb1c80","observation_id":"3f293609-f5a0-4863-ace7-1a3fb58bb197","resolution":{"observed_at":"2026-08-07T15:09:56.803561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:09:56.857674Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.857674Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:05b616830aa4469d81a2185ab75021f904c62edf535dd6ddb8fe95171b9f6712","observation_id":"6a916405-9325-47ba-adc5-217306390a62","resolution":{"observed_at":"2026-08-07T15:09:56.857674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 7 inbound Pith citation observations for arXiv:2505.16265."}