{"as_of":"2026-08-08T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4524129ae449a549999205d6cf796b28d127a18a4ee9684312bb57f628b1bf18","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:53:03.339487Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:e864fe19bbc093483c7d908632c1f89ccdee1bd3ee5f0b37dfc93d4b2e95cd9a","observation_id":"d655d4cf-9b93-415e-84c2-e0a144d85aaf","resolution":{"observed_at":"2026-05-17T16:18:01.675521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:3294f1b6ca3222ac22d1db6db8cdd31e64a7904c8b2ca4427d67743e7e01080d","observation_id":"6a029ccd-4f98-48ef-9ea0-a947deed1b80","resolution":{"observed_at":"2026-05-12T15:39:41.285505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:1ceeec13d2a9b819e03c3713b8323aecc503c9964646c5f0a80623ce74ddb0b4","observation_id":"1109fac1-d0c1-485c-ba78-d9ec08f5d82d","resolution":{"observed_at":"2026-05-22T19:32:01.189460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:53:03.339487Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-08T14:42:39.321664Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.339487Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:b78ca3b93492868a0de007618c284ec75e815f517530fd8db753a000242e1dcf","observation_id":"93f23228-ef50-42f8-802c-ad68b2f37369","resolution":{"observed_at":"2026-08-07T12:53:03.339487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:27:50.908285Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.908285Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:8bb589c51e4e3ac7366e94a6ffcde0684ab79b4b89c67a23a13616633ca7fef4","observation_id":"e57198dc-bc3b-4e25-9d4e-e0450c9c8766","resolution":{"observed_at":"2026-08-07T12:27:50.908285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T11:18:03.965711Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.01937"},"observation_digest":"sha256:a6b31589d5d45cd0831ac28198eb7e23ff0f7dff81564cd66b0572a5632b89a4","observation_id":"ad03ac79-0afa-486b-b655-aa3c4bee344f","resolution":{"observed_at":"2026-05-19T11:22:16.733814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T00:42:47.880878Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12915","last_updated":"2025-06-15T17:19:19Z","snapshot_observed_at":"2026-08-07T00:34:00.489875Z","submitted_at":"2025-06-15T17:19:19Z","title":"PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:42:47.880878Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.12915"},"observation_digest":"sha256:bfec5a76d9f95b55f68fe443d3860a4ef63347c9fd91f8e1d062944f781aa9c5","observation_id":"b3b23bd3-640a-4e84-89ff-091dd43c11d9","resolution":{"observed_at":"2026-08-07T00:42:47.880878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T00:15:33.902602Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models.arXiv preprint arXiv:2406.08673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-07T06:24:38.514791Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.902602Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:5faf7071ad331739220b0e8158157eb6b195b85c5cbf74a1cc31e6354b9daf16","observation_id":"0eb732b7-d282-465f-b157-e4328d374676","resolution":{"observed_at":"2026-08-07T00:15:33.902602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T22:51:33.947555Z","title":"Zhilin Wang, Yi Dong, Olivier Delalleau, Jiaqi Zeng, Gerald Shen, Daniel Egert, Jimmy J Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20544","last_updated":"2025-06-25T15:37:53Z","snapshot_observed_at":"2026-08-08T14:35:28.664930Z","submitted_at":"2025-06-25T15:37:53Z","title":"When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:51:33.947555Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.20544"},"observation_digest":"sha256:894ba439114c55a65b51916da2ea1902abb1a69446f76ee16434fe05e8a9e88d","observation_id":"e077090a-7ba5-4c32-8c37-46c2b97c1ef3","resolution":{"observed_at":"2026-08-06T22:51:33.947555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T18:11:19.396424Z","title":", author Dong, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09075","last_updated":"2025-07-11T23:35:54Z","snapshot_observed_at":"2026-08-08T12:25:01.827357Z","submitted_at":"2025-07-11T23:35:54Z","title":"OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:19.396424Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09075"},"observation_digest":"sha256:c8911aae9ef41b8c43b87f60d9830872dd2754a1265cc701c638da620312b80d","observation_id":"a415e80b-7a3e-428c-b68d-885bbdbf7a28","resolution":{"observed_at":"2026-08-06T18:11:19.396424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T17:48:07.201291Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.201291Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:243db25fed372f368b36d2816d12a1014ae5cfcc019f159c331baffaeca5accc","observation_id":"5be4873b-40e3-45a8-896b-91a648f1633d","resolution":{"observed_at":"2026-08-06T17:48:07.201291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T16:58:14.283812Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12584","last_updated":"2025-07-16T19:09:58Z","snapshot_observed_at":"2026-08-08T14:42:40.073650Z","submitted_at":"2025-07-16T19:09:58Z","title":"Second-Order Bounds for [0,1]-Valued Regression via Betting Loss","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:58:14.283812Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.12584"},"observation_digest":"sha256:a5d0ed7b8326a666d72828e210089bfb8642dc4a24303e6bdcb3f28c577b466a","observation_id":"ab21d6ac-d056-44f4-9ca7-01b06844b234","resolution":{"observed_at":"2026-08-06T16:58:14.283812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T12:27:27.632845Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T14:14:58.948394Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.632845Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:f1b7e96e1e48150cfce7beb021d59a2d4ddfe59368bee1f2175993a072213632","observation_id":"abf26adc-4c7d-4de0-b06e-55ef50970bdd","resolution":{"observed_at":"2026-08-05T12:27:27.632845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2601.03630","last_updated":"2026-05-14T03:13:06Z","snapshot_observed_at":"2026-07-06T22:40:56.386532Z","submitted_at":"2026-01-07T06:19:26Z","title":"Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T17:18:10.045283Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2601.03630"},"observation_digest":"sha256:26d9c4c3b91923cc53bbf62ce53447857ced613c9a09bc5c2d3f3c29b3450073","observation_id":"bc0d8b94-5e21-4b50-841c-5a4a769fafd5","resolution":{"observed_at":"2026-05-16T17:21:07.946949Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2606.13227","last_updated":"2026-08-06T07:22:09Z","snapshot_observed_at":"2026-08-08T15:17:33.637909Z","submitted_at":"2026-06-11T11:41:07Z","title":"PolyAlign: Conditional Human-Distribution Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T06:38:55.992652Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2606.13227"},"observation_digest":"sha256:0d13f423783706e357cf7dd3533d2c86cba5df1cba40e05e86467457df1b73a4","observation_id":"db8f3726-5db8-4eb9-b9e8-983974304b8c","resolution":{"observed_at":"2026-07-03T15:08:33.613033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2606.27578","last_updated":"2026-06-25T22:09:50Z","snapshot_observed_at":"2026-07-07T00:01:44.678954Z","submitted_at":"2026-06-25T22:09:50Z","title":"PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T01:26:00.228782Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2606.27578"},"observation_digest":"sha256:2e5c42e357527810ec2e40406b43b30edad2d375fd2b70a37d710ee91138bf84","observation_id":"efbb4249-af8a-485e-903b-8c4416d37995","resolution":{"observed_at":"2026-07-01T18:55:58.586206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-02T02:00:27.655165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14485","last_updated":"2026-07-16T01:58:53Z","snapshot_observed_at":"2026-08-05T05:54:30.420741Z","submitted_at":"2026-07-16T01:58:53Z","title":"Step-Level Preference Learning for Generative Agents in Social Simulations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:00:27.655165Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2607.14485"},"observation_digest":"sha256:7c41e09c16b175a0403f66c9ec76d3a5f2d57374f0481260fe27876fa610617a","observation_id":"26726097-ee01-4fec-bbb3-dc053c65c315","resolution":{"observed_at":"2026-08-02T02:00:27.655165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-07-31T00:30:21.547440Z","title":"Helpsteer2: Open-source dataset for training top- performing reward models.arXiv preprint arXiv:2406.08673,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25136","last_updated":"2026-07-27T23:05:12Z","snapshot_observed_at":"2026-08-05T13:28:51.386291Z","submitted_at":"2026-07-27T23:05:12Z","title":"Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:30:21.547440Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2607.25136"},"observation_digest":"sha256:077aeeafc7179a9c1b5bbe7a9caab28db2c3f5228b512f8547417e33d541c522","observation_id":"ff47f6f4-94a1-4420-ae85-74801ece0ce2","resolution":{"observed_at":"2026-07-31T00:30:21.547440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08673/citation-record","integrity":"/paper/2406.08673/integrity","json":"/paper/2406.08673/citation-record.json","paper":"/paper/2406.08673"},"outbound":[],"paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2406.08673."}