{"as_of":"2026-08-08T14:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11b6b9e9cfe0a6ce89abfa617fe9841b2a486bcb757dff639c36b3f1745917dc","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:06:25.403043Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:39:02.891861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:00:28.579853Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"cited_work":{"arxiv_id":"2602.10623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.10623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward hacking in rlhf via bayesian non-negative reward modeling","venue":null,"work_id":"9a9ad0a0-cd82-4bcc-8192-491d5fc10955","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2602.10623","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:cf37becd03f636fa9b862bfd170474ffa45644f9402516e1d81f4fe838f06f95","observation_id":"733f837e-17c2-4e01-bfe8-852524d4de8f","resolution":{"observed_at":"2026-06-02T03:04:38.582535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"cited_work":{"arxiv_id":"2602.10623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.10623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward hacking in rlhf via bayesian non-negative reward modeling","venue":null,"work_id":"9a9ad0a0-cd82-4bcc-8192-491d5fc10955","year":2026},"citing_paper":{"arxiv_id":"2605.04431","last_updated":"2026-05-06T02:50:00Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:50:00Z","title":"Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:41.302164Z"},"links":{"cited_paper":"/paper/2602.10623","citing_paper":"/paper/2605.04431"},"observation_digest":"sha256:8ca5fdc0949620bd06d02c1a4dc97e1d869b8f122e3d16ae06fded1d3123a471","observation_id":"ebaac4fd-fbd1-4d1a-b479-e99b2ee84248","resolution":{"observed_at":"2026-06-02T03:04:38.582535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10623","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mitigating reward hacking in rlhf via bayesian non-negative reward modeling.arXiv preprint arXiv:2602.10623, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2602.10623","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:746004f40e941daee52838e06a7cec5dda45c679b7c5f8e9eaad4911d35a9f32","observation_id":"81dcee44-4941-42a0-b217-466f5710df25","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.10623/citation-record","integrity":"/paper/2602.10623/integrity","json":"/paper/2602.10623/citation-record.json","paper":"/paper/2602.10623"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:24.938679Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:24.938679Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:c234bd517ed43f542722bb113a08721ee8afeca85f3787d2e401bc3dad2042a5","observation_id":"45c0ea56-6d84-4151-aecb-afbb4342e5f5","resolution":{"observed_at":"2026-08-03T01:06:24.938679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:24.979514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:24.979514Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:26aae05779f664438aca0f0facc3cabcb556749a8fe996855dc3845a4ec2f5db","observation_id":"8cfc5805-e433-4df9-8115-680fb2a9cae3","resolution":{"observed_at":"2026-08-03T01:06:24.979514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.010890Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.010890Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:8d5a5b633f4d993fc196d72e061c6c30c0e22d5c2aac033d25fcf9d105cdb26e","observation_id":"678e5c54-e360-4cfa-aafe-ef1fc4ac4688","resolution":{"observed_at":"2026-08-03T01:06:25.010890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.050054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.050054Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:7bedf88d6babd84f6df8323a00af3e7865f49e2f2d42bc53716ae64820cf3058","observation_id":"48de6a4e-50b7-4075-b9db-d0fc5195d55e","resolution":{"observed_at":"2026-08-03T01:06:25.050054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.071900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.071900Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:358ff52c02eaba7e9b12d7efcb63025e7a836e037b9355693a83328463e15597","observation_id":"e58d9cf4-c98f-48da-88ea-d744c0f00c25","resolution":{"observed_at":"2026-08-03T01:06:25.071900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.123714Z","title":"3https://github.com/vllm-project/vllm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.123714Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:9c5a91dc6fbd572aac92ec0f6441d198b529be109ae38de50debbc1f138825d7","observation_id":"a25d2624-1d4a-410a-a32d-ae2982f7173b","resolution":{"observed_at":"2026-08-03T01:06:25.123714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.180869Z","title":"good” or “bad","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.180869Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:ff02ebb63c9a2a363a1db0feff7f35ae540aa53fefe4bb7ea48c1684dc3de194","observation_id":"95fd40e9-4e6c-4d89-9b91-9b5dec5f36b8","resolution":{"observed_at":"2026-08-03T01:06:25.180869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.240241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.240241Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:96006ca20bc0d4902f21c9755e8ff089798a2d08fb3c4d9ebf6adbf98b406a72","observation_id":"bb7f70ff-e993-482c-96a7-15a81b7062cc","resolution":{"observed_at":"2026-08-03T01:06:25.240241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.268589Z","title":"Justify your judgement using the high-activation examples above","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.268589Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:5852090c0cbaccd6159e5717938cd335ff688637038109dda992140463f4cd99","observation_id":"1298910b-0d39-499c-a0a1-fbd7433687e1","resolution":{"observed_at":"2026-08-03T01:06:25.268589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.322569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.322569Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:c538e40b4bb47edf514913600b67f337014f6b71e2cb31c1ce00b8c0a34dea2a","observation_id":"1fc126a7-d615-46b2-a29a-51bd8291bc25","resolution":{"observed_at":"2026-08-03T01:06:25.322569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.349105Z","title":"FactorName","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.349105Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:8e757ebe070c36c41363b35f4c4243e892f72b2cb629e63b2e8b731e936bc7cf","observation_id":"33dabb3f-934b-44cc-b3c8-1e27f6bb26c7","resolution":{"observed_at":"2026-08-03T01:06:25.349105Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:25.403043Z","title":"Sorry, but I can’t assist with that","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:25.403043Z"},"links":{"citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:c938bf586e17439f0355fd6a4ac7b7bc585ab464ece1f5ea62b5eb59b1812c67","observation_id":"22b17670-b1d9-45f2-a47f-f8bb9827c25c","resolution":{"observed_at":"2026-08-03T01:06:25.403043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17230","last_updated":"2024-07-14T08:02:49Z","snapshot_observed_at":"2026-07-06T16:25:29.858870Z","submitted_at":"2023-09-29T13:29:22Z","title":"Spurious Feature Diversification Improves Out-of-distribution Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17230","snapshot_observed_at":"2026-08-03T01:06:24.853310Z","title":"emnlp-main.281/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":281,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:24.853310Z"},"links":{"cited_paper":"/paper/2309.17230","citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:d674d082081a9991734261ade5678c30d9bad29a1da8bed11b92f3eb343f786a","observation_id":"aa981351-cdd1-4906-8b72-001ca6833084","resolution":{"observed_at":"2026-08-03T01:06:24.853310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-03T01:06:24.896678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:24.896678Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2602.10623"},"observation_digest":"sha256:f0e3a13f539a3de2dcbb20b692b7607570542312208f0466b47e421638793d6a","observation_id":"4182d5ab-7695-4523-805c-a384433e185d","resolution":{"observed_at":"2026-08-03T01:06:24.896678Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T01:06:22.800179Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 3 inbound Pith citation observations for arXiv:2602.10623."}