{"as_of":"2026-08-01T15:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55045a8968549703f984305648ce1759daa6ce32f9bdf5120aa6befe712a6e00","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:50:47.902911Z","state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.13833/citation-record","integrity":"/paper/2604.13833/integrity","json":"/paper/2604.13833/citation-record.json","paper":"/paper/2604.13833"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:6fdea63e7506be763b117cc9d11f64eed9b73763cb5fedd67bc1f551ca48d257","observation_id":"93163713-4833-40c2-ad31-24fd5d384d74","resolution":{"observed_at":"2026-05-10T14:00:29.610326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-01T03:58:43.232245Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:90d5862fa25afc8cf4b6e21c69d11c3ea87a3694a8f144e589eb77f68f92e9b5","observation_id":"f5703def-dd90-49d8-8885-be064697dd6a","resolution":{"observed_at":"2026-05-10T14:00:29.614432Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-07-31T03:04:36.916121Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:d20545dd7360fafc8f4e372a57a73df640a8b5b6db41c6f60167a5628a76288e","observation_id":"cfc6e527-9550-452b-97d5-ed00910a49c1","resolution":{"observed_at":"2026-05-10T14:00:29.618255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"919f11a1-66e3-478a-a64d-ffce6550994f","year":null},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:73dd4544f3d00307beca8725b9e1e1fd91e84ddc1304030cd6566d099d77d09e","observation_id":"f45a0ccb-bc98-4615-be12-c9d49c4529aa","resolution":{"observed_at":"2026-05-18T21:11:52.027838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8283.2466","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assumption 3(Top-K Margin Condition).For si =P f(w i) and ideal Top-K indices Jwi, there existsδ >0such that: min j∈Jwi min t /∈Jwi (|si,j| − |si,t|)≥δ","venue":null,"work_id":"43f12cf8-6522-48ab-9bb8-6f14ffbb9194","year":2011},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:26cc5bf841e18d7f83208e4b5ab750591771f2dca5518b36b60aa80701224621","observation_id":"e9e7b4a4-8b3d-4c0a-b2c0-a5d4468ba555","resolution":{"observed_at":"2026-05-10T14:00:29.622746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 0 inbound Pith citation observations for arXiv:2604.13833."}