{"as_of":"2026-08-17T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:719c5b74be14d5037668ad524607d30ee7631fb060488a8b947c867bdd0591f8","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:45:53.918108Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06601/citation-record","integrity":"/paper/2505.06601/integrity","json":"/paper/2505.06601/citation-record.json","paper":"/paper/2505.06601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.103853Z","title":null,"venue":null,"work_id":"58da66e0-b9c1-443f-be8b-f451b5801ee4","year":2019},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.870651Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:742d2e688c86f25bdff26323e7828e05e61afde686bc4cc11b99ef2bf190bd30","observation_id":"0329729c-1293-4c61-85e3-ccfa75fe2e25","resolution":{"observed_at":"2026-08-15T22:45:54.107037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.043356Z","title":"Now, we define two sets, given anyη∈(0,1), S1 ={s∈S: 0<r ∗(s,πr∗(s))−max a∈A/πr∗(s) r∗ a(s)≤η}; S2 ={s∈S:r ∗(s,πr∗(s))−max a∈A/πr∗(s) r∗ a(s)>η}","venue":null,"work_id":"f2c0cd30-0c6d-4ed0-836f-5dd73d83cf56","year":2006},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.904919Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:6e4f77434031055afc47dff75c881705d0589cdf4085cd6d6c0ad16f1e5463f5","observation_id":"84cdfbd8-5826-4501-9843-5d8d24bbc0fa","resolution":{"observed_at":"2026-08-15T22:45:54.046769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.093908Z","title":null,"venue":null,"work_id":"d13c8d66-83ae-42dc-b492-88ef515af2dc","year":1970},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.878712Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:c7fcec3a95d98e801764d00fb000fd20480456c21a16fc3411bc950fb73e49d5","observation_id":"a370af60-ad00-4d31-a9cb-6e3fc2fe9c40","resolution":{"observed_at":"2026-08-15T22:45:54.097126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.064450Z","title":null,"venue":null,"work_id":"f3dcc123-b8d1-43d5-86a7-90275c021b16","year":1991},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.897920Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:22868818cbe2cd9a7185830eb6c1b2c2425983c4f62d9ef5f8e36c01ccc76d29","observation_id":"d2ec498a-836a-462a-8c4b-ca0dec5f7998","resolution":{"observed_at":"2026-08-15T22:45:54.067826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.054002Z","title":null,"venue":null,"work_id":"400c38bc-1f68-4150-a232-ef6ad8cd3cb6","year":2016},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.901469Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:0e04beb777b58ea0697e06013fbb293ce6891dd8c40be3a9ed7ccf13fbf4777b","observation_id":"daf2ee32-c232-43a1-bfa2-15b3c775353e","resolution":{"observed_at":"2026-08-15T22:45:54.057379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.032505Z","title":"Without loss of generality, we also define classes of sub-networks ofFDNN, that is,{F1,F 2,···,F |A|}, with non-sharing hidden layers","venue":null,"work_id":"e995f6e8-67bb-4ebc-8748-6adedddf458b","year":2024},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.908290Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:e79fb433d32dd6dfaf869f327c1b9d8c91d23405945fddaf470cbc3b7f327223","observation_id":"b0801597-7ea2-4518-b8f9-03d2e6f84c16","resolution":{"observed_at":"2026-08-15T22:45:54.036104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.022696Z","title":null,"venue":null,"work_id":"45922cb1-0055-426a-ae98-926b0f0538af","year":2023},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.911478Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:e842ceaf17b4dfb80c243d549217ee0f974d4ea9b940841dfb80b0a106d1a262","observation_id":"11e422ca-cc1a-43b4-9d64-cde127037e15","resolution":{"observed_at":"2026-08-15T22:45:54.026020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.012394Z","title":null,"venue":null,"work_id":"a40450d5-8cb4-41b4-a6f1-c3d212a210dc","year":2016},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.915042Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:011b46b8a57b9ccc616b3070232c258fb1e1e77b4f9c93208ed04a455d28894f","observation_id":"40a15220-f7fa-43f0-886a-384e0e4f9b36","resolution":{"observed_at":"2026-08-15T22:45:54.015633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:53.999945Z","title":"□ Different from the deep regression and classification problem, the convergence of the excess risk does not directly ensure the functional convergence of the estimated reward","venue":null,"work_id":"219ba3fa-1ba9-4645-9a82-544b477c9e86","year":2023},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.918108Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:a5a6b0dc78a14fed84989c11669cfcbc2362efa29049f8001c252d4a3e6681a2","observation_id":"9e009a17-72c6-4c14-a707-f9738718d352","resolution":{"observed_at":"2026-08-15T22:45:54.005167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:53.875103Z","title":"and Bayati, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.875103Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:82c8332ceb2e6d0fd00d3bf7eab537f43a1f22dbd1b39e541c1937cfaaa1278a","observation_id":"e5792b3a-01cc-4237-af5e-36dad5b3bfd8","resolution":{"observed_at":"2026-08-15T22:45:53.875103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02504","last_updated":"2024-12-31T01:36:40Z","snapshot_observed_at":"2026-08-16T13:12:57.797978Z","submitted_at":"2024-10-03T14:09:58Z","title":"Dual Active Learning for Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02504","snapshot_observed_at":"2026-08-15T22:45:53.882277Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.882277Z"},"links":{"cited_paper":"/paper/2410.02504","citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:bccdcff44f0f60b7182e7b9a0bb5d1f8ff61e69c2f36a806848c4e6a91ee500d","observation_id":"9cf49d02-47d6-4dca-a9cc-20311bf1a2e1","resolution":{"observed_at":"2026-08-15T22:45:53.882277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.084358Z","title":"and Kupper, L","venue":null,"work_id":"09bffd42-dbfb-4029-ab71-94bca72c561a","year":1967},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.886562Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:8e7a3127b9c08cba8724436528fe9db4f5b03282e61e3614be2718dc021c36ec","observation_id":"4a897fcd-bf4b-46a4-b36f-645274ee75c9","resolution":{"observed_at":"2026-08-15T22:45:54.087748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-15T22:45:53.893955Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.893955Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:ec0b8c565eff02bc4667c1acaa45c30e94e4cc57f1b4b4c144162ff985484dc6","observation_id":"ff05ea61-5cf2-4448-bb54-cb05ad9c6d9f","resolution":{"observed_at":"2026-08-15T22:45:53.893955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:54.074333Z","title":"B., Balakrishnan, S., Bradley, J., Parekh, A., Ramch, K., Wainwright, M","venue":null,"work_id":"20d4ea73-858c-4253-830a-6003092fc017","year":2016},"citing_paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks","version":1},"reference_index":1897,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:53.890107Z"},"links":{"citing_paper":"/paper/2505.06601"},"observation_digest":"sha256:fe945d6cb129eef993c91f42c939457a836ae8c08635c92009bb67160fea1876","observation_id":"6dca5193-da27-4c43-a9f9-60b89abe5e22","resolution":{"observed_at":"2026-08-15T22:45:54.077909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06601","last_updated":"2025-05-10T11:21:29Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-15T22:36:04.794923Z","submitted_at":"2025-05-10T11:21:29Z","title":"Learning Guarantee of Reward Modeling Using Deep Neural Networks"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2505.06601."}