{"as_of":"2026-08-06T16:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bf97d7e62551b38efb1cb950e8472c2d086a787aac3a785efd88c48eb2ea636","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:17:58.970049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:30.312996Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2601.05106","last_updated":"2026-05-21T03:21:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-08T16:53:16Z","title":"Token-Level LLM Collaboration via FusionRoute","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T12:25:59.747665Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2601.05106"},"observation_digest":"sha256:f4f7d8e894d36908fa6e409428351935f29af4fb49b5110106eba7e825371e96","observation_id":"c5f310af-a24e-4a49-bc3c-7c61467b464f","resolution":{"observed_at":"2026-05-22T12:26:31.463111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T14:18:33.768962Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2601.21350"},"observation_digest":"sha256:161e273b02afdba61431438479bfae8861ddc995b7c583c441dccfccb3a81d3a","observation_id":"1652529e-63d4-48c6-b9f1-18c2e2152821","resolution":{"observed_at":"2026-05-21T14:20:13.610834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2602.06475","last_updated":"2026-05-13T09:12:10Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-06T08:03:11Z","title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T07:21:01.335414Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2602.06475"},"observation_digest":"sha256:e1c6dd61f09920b6ebd8e96597108f951fc2bb3794fd1b8dd7cffda74b70c298","observation_id":"179f691f-920f-4e6c-940f-1558f0e63770","resolution":{"observed_at":"2026-05-16T07:22:31.155448Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:c784e94cdcdd77d22054ab4576f533bd762cde1b3ac5fa98fad8924879e61b58","observation_id":"cfc6e527-9550-452b-97d5-ed00910a49c1","resolution":{"observed_at":"2026-05-10T14:00:29.618255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.16339","last_updated":"2026-05-07T16:48:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-07T16:48:48Z","title":"Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:54.238767Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.16339"},"observation_digest":"sha256:05a6f32e5ec4e9c9fc02e9b2be7c6b6c1d110457344db51e0ff4f82308d01eb6","observation_id":"13eda639-c3b6-4123-b9ec-b038e7e81e47","resolution":{"observed_at":"2026-05-20T22:49:10.189118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:56.522345Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:274b00ae10063d83d8f2fc61544f5bf634980a489a27a6cca9792a284ab399c9","observation_id":"e9c2965c-b75e-43b0-9ebb-2b896aa8d476","resolution":{"observed_at":"2026-05-20T12:48:17.738781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T07:50:00.963837Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:d4f30a8abee921df3e5d27d418fb4c3c34afc90fb730bbdec1795fd244f244aa","observation_id":"2cb5d842-b19a-408f-ae1c-5c2321cf1067","resolution":{"observed_at":"2026-05-21T07:54:02.919308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T09:24:39.228616Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:97f02dcc1f64b8b1da964e11cac9d14b8e2be224abc034d2e2a931de445ed580","observation_id":"6141da83-70ab-495c-873f-1f9cadf5b143","resolution":{"observed_at":"2026-05-22T09:24:45.673645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.24076","last_updated":"2026-05-22T16:48:11Z","snapshot_observed_at":"2026-08-05T11:54:09.443911Z","submitted_at":"2026-05-22T16:48:11Z","title":"Causality as the Statistical Conscience of Artificial Intelligence: From Pearl's Ladder to Trustworthy Machines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T15:06:58.205536Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.24076"},"observation_digest":"sha256:9160bd06fb454d796b5aa7d9fc579245687a6bfdcf2bff998279b1e3e8f6b240","observation_id":"1e74ceca-1986-4219-9dab-cf06241319fe","resolution":{"observed_at":"2026-06-30T15:14:47.427916Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2605.27996","last_updated":"2026-05-29T02:24:56Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T05:40:22Z","title":"Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-29T12:22:06.635622Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2605.27996"},"observation_digest":"sha256:f7cc3a2f53b01e1f8aa08b023111631e28b59614b683f5b6f7c53b57b6381ec0","observation_id":"bcaadb17-13e9-4e69-b5b7-dd25a1675cfd","resolution":{"observed_at":"2026-06-29T12:23:24.235837Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:237a1573e47082b65af706ca04cf6eda1d31d58766c5a71822085d23e02a44a6","observation_id":"187781a2-cf6c-4319-a5dc-22d5ffae41ed","resolution":{"observed_at":"2026-07-03T01:37:30.314429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-08-01T15:17:58.970049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18508","last_updated":"2026-07-20T21:05:08Z","snapshot_observed_at":"2026-08-03T06:07:32.304261Z","submitted_at":"2026-07-20T21:05:08Z","title":"Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:17:58.970049Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2607.18508"},"observation_digest":"sha256:a9c3051544c8e45e7fb1b7e0114f544c85ffae8c82e9568d968b34410153be64","observation_id":"0112c743-f68e-4928-a191-06466a8189c1","resolution":{"observed_at":"2026-08-01T15:17:58.970049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-31T13:41:42.895479Z","title":"the margin term can indeed help the reward model perform better on more separable comparison pairs ... [it] also regresses performance on similar samples","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-01T21:51:08.739040Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.895479Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:52bad8774447e87d7716ef41e750e07dc7f33c426c2abc7bfc30247e5fb56d5d","observation_id":"043a5c66-d191-449a-afca-960a7c2be8ca","resolution":{"observed_at":"2026-07-31T13:41:42.895479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09620/citation-record","integrity":"/paper/2501.09620/integrity","json":"/paper/2501.09620/citation-record.json","paper":"/paper/2501.09620"},"outbound":[],"paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2501.09620."}