{"as_of":"2026-08-08T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63a1c8def3169e18e12127ed90c99c0f1f0e414cf540e5f6934303d40b91f140","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:55:53.556785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":"2406.10216","doi":"10.48550/arxiv.2406.10216","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":"arXiv (Cornell University)","work_id":"cec225c6-a617-4c17-90f8-e1e7ecbcd238","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:4b1570f76f18a0f284c3b7ec1f25f7fb4cb764ef05c0d265333d2e19c0a5cfda","observation_id":"f5786330-897c-49a8-9ffd-bc257326029b","resolution":{"observed_at":"2026-05-17T16:18:01.683896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":"2406.10216","doi":"10.48550/arxiv.2406.10216","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":"arXiv (Cornell University)","work_id":"cec225c6-a617-4c17-90f8-e1e7ecbcd238","year":2024},"citing_paper":{"arxiv_id":"2412.08812","last_updated":"2026-04-19T16:29:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-11T23:02:26Z","title":"Test-Time Alignment via Hypothesis Reweighting","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-23T06:55:54.051821Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2412.08812"},"observation_digest":"sha256:b610c2e2db6e2d59076eaf106186b3aa04fe597e64e8733d595e6dcf1fbbfdc1","observation_id":"447d25aa-7459-4144-8226-1b23bbab127d","resolution":{"observed_at":"2026-05-23T06:57:40.512693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T12:55:53.556785Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.556785Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b3a788f29ce6a16a6f8a8af5a4f374a2840a577285b4097cc8488d1cbce6c1dc","observation_id":"c2be624d-9675-487d-92de-65d134ad6429","resolution":{"observed_at":"2026-08-07T12:55:53.556785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T00:33:56.851632Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.851632Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:7fb5816058e44007acc03c209830ae4e21717abdb582daf1789cf526ce664695","observation_id":"17375a3c-39b5-4c5f-93b5-1113f5dbca4a","resolution":{"observed_at":"2026-08-07T00:33:56.851632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-06T16:34:25.269350Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.269350Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:9ba0e885cee8071966865614d9d97b7223bb30bfca077b63fa3e00b2d8fe010e","observation_id":"b248e687-6a40-4976-a20b-c4b0a2463933","resolution":{"observed_at":"2026-08-06T16:34:25.269350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T15:25:35.397981Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19922","last_updated":"2025-08-27T14:30:08Z","snapshot_observed_at":"2026-08-07T23:38:01.894494Z","submitted_at":"2025-08-27T14:30:08Z","title":"HEAL: A Hypothesis-Based Preference-Aware Analysis Framework","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:35.397981Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2508.19922"},"observation_digest":"sha256:eda9c940e266f911dfb1a1662e628d310da7a6af8007198ff2cece9830944d5f","observation_id":"ca0fdb99-e30d-4830-9981-4e1aa7a27de4","resolution":{"observed_at":"2026-08-05T15:25:35.397981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":"2406.10216","doi":"10.48550/arxiv.2406.10216","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":"arXiv (Cornell University)","work_id":"cec225c6-a617-4c17-90f8-e1e7ecbcd238","year":2024},"citing_paper":{"arxiv_id":"2606.03131","last_updated":"2026-06-02T04:18:08Z","snapshot_observed_at":"2026-08-02T20:05:30.693121Z","submitted_at":"2026-06-02T04:18:08Z","title":"HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:32:16.166724Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2606.03131"},"observation_digest":"sha256:b0fea2b8b4fad49518306423b14478e64b002c9b87a5e466472dd0221b440154","observation_id":"73a94515-8b5d-404a-a12a-94383c9bb9c5","resolution":{"observed_at":"2026-07-02T01:46:26.795751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":"2406.10216","doi":"10.48550/arxiv.2406.10216","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":"arXiv (Cornell University)","work_id":"cec225c6-a617-4c17-90f8-e1e7ecbcd238","year":2024},"citing_paper":{"arxiv_id":"2606.09043","last_updated":"2026-06-08T05:24:15Z","snapshot_observed_at":"2026-08-02T05:26:25.857871Z","submitted_at":"2026-06-08T05:24:15Z","title":"DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T17:26:17.072017Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2606.09043"},"observation_digest":"sha256:26ee4e952afd9816d21e84b27a93eb8381a562a77e5324872bb48a9152ae9729","observation_id":"a77023ae-d679-40fd-88d7-c47287cfdbbd","resolution":{"observed_at":"2026-06-27T17:31:06.948767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":"2406.10216","doi":"10.48550/arxiv.2406.10216","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":"arXiv (Cornell University)","work_id":"cec225c6-a617-4c17-90f8-e1e7ecbcd238","year":2024},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:8f5c60184c0a3940ee0eee64d0d6139ee0e2c8e3ea65732918d7db48adde8524","observation_id":"49586af3-8237-4e3c-805f-e53f310e390b","resolution":{"observed_at":"2026-07-01T08:55:35.598816Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10216/citation-record","integrity":"/paper/2406.10216/integrity","json":"/paper/2406.10216/citation-record.json","paper":"/paper/2406.10216"},"outbound":[],"paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2406.10216."}