{"as_of":"2026-08-15T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab3f1e9e0bfef775a28d275a60349094b3b70bda0750a57c9c9cf886f34b2d2f","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T13:41:43.189796Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24484/citation-record","integrity":"/paper/2607.24484/integrity","json":"/paper/2607.24484/citation-record.json","paper":"/paper/2607.24484"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:43.183116Z","title":"The greater this value, the more extreme a features impact on average","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:43.183116Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:94fa662172d9ea43bc11e1c2cfbbacc12e796387d99463307e2f8ea379fdabaf","observation_id":"c3b8e438-53d9-4952-9eaf-08021161d7d0","resolution":{"observed_at":"2026-07-31T13:41:43.183116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:43.186446Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:43.186446Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:028715964f5ea98e611aa25de9459bf1005c78e3c10885f9d4602c36e0d27589","observation_id":"550204db-b0f4-429f-9a5d-84b58c0c080c","resolution":{"observed_at":"2026-07-31T13:41:43.186446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:41.808291Z","title":"InProceed- ings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Pa- pers), pages 18647–18664, Vienna, Austria","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.808291Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:19c7421f36353d22f87bb3c05a17feceead7fc8fa2d8fbc69ff6a861892d1981","observation_id":"d89ec3c4-1558-4f11-a917-4702b2fa51bc","resolution":{"observed_at":"2026-07-31T13:41:41.808291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:41.912434Z","title":"InICML 2025 Workshop on Collaborative and Federated Agentic Workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.912434Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:bfcf200cc66642b7d79313a329812657f9b216b5705c155e5d6d9bdfd2e9555d","observation_id":"5fecea50-10d8-4ae8-b216-812f8a83f6e4","resolution":{"observed_at":"2026-07-31T13:41:41.912434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:42.062185Z","title":"InThe Thirty-ninth 9 Annual Conference on Neural Information Process- ing Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.062185Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:633a419e8c12d30e83980e0e0194de2e0d62ebd6a3e5e881195d33b537b9924f","observation_id":"2da47083-87dd-4a94-a959-abcdffae1e08","resolution":{"observed_at":"2026-07-31T13:41:42.062185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00258","last_updated":"2025-06-30T20:52:15Z","snapshot_observed_at":"2026-08-12T03:57:01.745310Z","submitted_at":"2025-06-30T20:52:15Z","title":"Impact of Fine-Tuning Methods on Memorization in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00258","snapshot_observed_at":"2026-07-31T13:41:42.393478Z","title":"Edward J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.393478Z"},"links":{"cited_paper":"/paper/2507.00258","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:2c9fc5f202787a258fd9882d913a2b1ba1cb9fc6d7dd5320521b4a47c9317981","observation_id":"a0a18f50-3a5c-4dde-91a9-4e4c6a427eec","resolution":{"observed_at":"2026-07-31T13:41:42.393478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:42.610163Z","title":"InFindings of the Associ- ation for Computational Linguistics: EMNLP 2024, pages 12891–12907, Miami, Florida, USA","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.610163Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:7ef1196161ea83433452d3bcab641ed49ca45e03e17dfbfaac7da40714e3c3b1","observation_id":"32c34279-9c81-4ede-bb2c-9f550f714cff","resolution":{"observed_at":"2026-07-31T13:41:42.610163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T13:41:42.726088Z","title":"InProceedings of the 37th International Conference on Neural Infor- mation Processing Systems, NIPS ’23, pages 53728– 53741, Red Hook, NY , USA","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.726088Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:e963054c4c3ca6d58481b0e74639e2e303e37790163a031b0afd4ee46af54876","observation_id":"2d223efb-27c7-4eba-b131-46810dd16bfd","resolution":{"observed_at":"2026-07-31T13:41:42.726088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-31T13:41:42.895479Z","title":"the margin term can indeed help the reward model perform better on more separable comparison pairs ... [it] also regresses performance on similar samples","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.895479Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:f869a91e019b5150ab29340bdbe3e44432f9dde6e319d61b153d5113f08c73c0","observation_id":"043a5c66-d191-449a-afca-960a7c2be8ca","resolution":{"observed_at":"2026-07-31T13:41:42.895479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:43.125252Z","title":"This model was specifically trained on human-LLM interactions Rule-based Rewards {0,1} 16 We annotate responses for possessing one of the identified LLM behaviors in Mu et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:43.125252Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:5977ab2d79b0c4967d21c497cd51e9c4c8ee22ffaeb63a7acc0c7a5665abbc67","observation_id":"ae456a65-c765-4297-ad50-3c6aa884b0ed","resolution":{"observed_at":"2026-07-31T13:41:43.125252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:43.189796Z","title":"Unlike the previous metrics, which capture the impact of a feature absolutely, this metric is relative to all other features active in a preference pair","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:43.189796Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:d47bd4573a617ee92c7613ae5a1237b955da639dd5d3eaffe899e4b1c19dbd91","observation_id":"e16b773b-8a36-48a3-a21f-9270ac99e8b1","resolution":{"observed_at":"2026-07-31T13:41:43.189796Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:42.962985Z","title":"16 0 1 2 3 0.0 0.5 1.0 1.5 Loss 0 1 2 3 0 10 20 30 40 Grad Norm Figure 8: Loss and gradient norm curves for all 25 model iterations when training onPRISM","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":1400,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.962985Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:cbb4e20fff948de652cb6d21573707e0e2788fdd16ae4d3e54f322180b3b672b","observation_id":"1514c4d5-2b78-40e1-ab1c-695e424d4c9c","resolution":{"observed_at":"2026-07-31T13:41:42.962985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-13T05:02:09.847989Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-07-31T13:41:42.277767Z","title":"InProceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pages 4040–4054, Online","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.277767Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:d9b08149003130bf16d0f83cae2d3a12d3c9cdcafcb3a71f610c91534e5635b2","observation_id":"1589a814-1230-4d0d-a3e6-e6e0514900d8","resolution":{"observed_at":"2026-07-31T13:41:42.277767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-07-31T13:41:41.701623Z","title":"Elisa Bassignana, Amanda Cercas Curry, and Dirk Hovy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.701623Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:61e2350c0dd2656b898abbd3861be5ab13bcd08da8f55e09d19e87636d0e6d3b","observation_id":"e271d6b8-d375-436b-b23e-59f13dfa1513","resolution":{"observed_at":"2026-07-31T13:41:41.701623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:42.495503Z","title":"InPro- ceedings of the 2022 Conference on Empirical Meth- ods in Natural Language Processing, pages 1816– 1826, Abu Dhabi, United Arab Emirates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.495503Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:bb339b03b4ab309292dd0a63b65db9701a50f410c288b87b5caf7473c8d5ecf2","observation_id":"e0fd8dad-e47a-4213-b904-349fe34cbe70","resolution":{"observed_at":"2026-07-31T13:41:42.495503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:42.160391Z","title":"InProceedings of the 2023 Conference on Empirical Methods in Natural Lan- guage Processing, pages 8323–8343, Singapore","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.160391Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:b28c54070c3b677b5b7b05495872f416bd1d2dc4adcf16065efa02e007e80937","observation_id":"8f344aab-7505-4da7-b766-1c0804a95f65","resolution":{"observed_at":"2026-07-31T13:41:42.160391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-08-11T19:38:54.071574Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-07-31T13:41:41.992934Z","title":"Bart Bussmann, Noa Nabeshima, Adam Karvonen, and Neel Nanda","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.992934Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:809a6b58b1622cc9e1e81130d319b68ddff42548373a1dc935c3891e079bcda1","observation_id":"0fa6ef38-b4d4-4936-937a-80e179737dcc","resolution":{"observed_at":"2026-07-31T13:41:41.992934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:41.502883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.502883Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:2ea52a7863abdb15794916cc63f6128fefd17d2800122ce00dbef1052bcb2bbe","observation_id":"dfff48d2-40c6-4bc4-aea6-717ae7fd865d","resolution":{"observed_at":"2026-07-31T13:41:41.502883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T13:41:41.611493Z","title":"Intel® Corporation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:41.611493Z"},"links":{"citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:2fcbc8afaa26a0907d63fe464062ce0641af2edafb89b3ea6bb275c0e51778f9","observation_id":"7662c23f-a6af-492a-9cce-5579b624fca4","resolution":{"observed_at":"2026-07-31T13:41:41.611493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-31T13:41:42.807753Z","title":"Ruike Song, Zeen Song, Huijie Guo, and Wenwen Qiang","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":9471,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.807753Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:21ff5b7927003888c94ba1e8b333734986981b4611359b8597f89f550d5bc1fd","observation_id":"7813fcd5-2593-44be-8d87-0810b7e3ed01","resolution":{"observed_at":"2026-07-31T13:41:42.807753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T19:33:23.554973Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.24484."}