{"as_of":"2026-08-07T19:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78a99258cad7544699f2d68032635238d9095f9cc4034042c9acd2a0d7abe84a","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:14:13.563948Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26094/citation-record","integrity":"/paper/2607.26094/integrity","json":"/paper/2607.26094/citation-record.json","paper":"/paper/2607.26094"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-01T03:14:10.842492Z","title":"arXiv:2402.14740","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:10.842492Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:195068a6b23d7b1d49ab2825a88a15bebfccff6e8be85467bfe6e3b061104c26","observation_id":"51040481-5837-49d3-8358-f99c6d01eb97","resolution":{"observed_at":"2026-08-01T03:14:10.842492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-01T03:14:11.128584Z","title":"arXiv:2310.01377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.128584Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:ad7a9d03d3ca279ea5b6914398b1fd0dfd5282cf88be8b39bf52520a18c5bc77","observation_id":"8fb2c7a8-6ead-4e92-b780-9321a19dc83a","resolution":{"observed_at":"2026-08-01T03:14:11.128584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-01T03:14:11.464266Z","title":"arXiv:2403.13787","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.464266Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:6751c36c85a0365c003c04517cf3b1ef91133a117cd60047ada95a18c1bcf807","observation_id":"d10d2cd2-a4c2-4cb7-88a7-3f85aa373f0c","resolution":{"observed_at":"2026-08-01T03:14:11.464266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-01T03:14:11.626530Z","title":"RLHF: Scaling Reinforcement Learning from Human Feed- back with AI Feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.626530Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:9843244eaee0734066bb56dce2f633f457f8b5db60a5598437c84ec6c2ca8da6","observation_id":"48a605e5-6313-47ef-8ce5-c44dc9c7a684","resolution":{"observed_at":"2026-08-01T03:14:11.626530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-01T03:14:11.774881Z","title":"arXiv:2305.20050","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.774881Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:ca467073f499ab4e99e4345a78bbd1e54b57ccbd9e4d12fd34af1b244465475f","observation_id":"0645fb08-2d27-4bd5-8b20-734940f2ba5c","resolution":{"observed_at":"2026-08-01T03:14:11.774881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03029","last_updated":"2025-02-28T12:21:00Z","snapshot_observed_at":"2026-07-06T18:57:22.433852Z","submitted_at":"2024-08-06T08:22:16Z","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03029","snapshot_observed_at":"2026-08-01T03:14:11.955077Z","title":"arXiv:2408.03029","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.955077Z"},"links":{"cited_paper":"/paper/2408.03029","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:c5b95c7d4984e6f02d841e675750a49ed38aaf436ef2db3d61bbc05921f3fb80","observation_id":"60712595-d350-4103-9b40-62289167d629","resolution":{"observed_at":"2026-08-01T03:14:11.955077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-01T03:14:12.096567Z","title":"arXiv:2405.14734","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.096567Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:1262c3d1f10c27a5ea5522bf6f8af27e60238a0312f158da8a980f5af1382fff","observation_id":"e68c4f83-74cb-4aa6-ae17-d92108e4637f","resolution":{"observed_at":"2026-08-01T03:14:12.096567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T03:14:12.268409Z","title":"InInter- national Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.268409Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:40a3cf0c72bade741e8ed0181aeca10b86394b7d60f77f26a6584494d22ef83d","observation_id":"994fa857-840e-4df8-8a72-8c376f28cd8e","resolution":{"observed_at":"2026-08-01T03:14:12.268409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T03:14:12.436765Z","title":"arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.436765Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:1cc8bcf003980eeb76e49b25f309c72f8cc4729fa11184c35e3c49ea44c0a9fb","observation_id":"463e2fcb-5601-4877-bee7-ed326d82e249","resolution":{"observed_at":"2026-08-01T03:14:12.436765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-01T03:14:12.620290Z","title":"arXiv:2211.14275","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.620290Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:bf3696190dd291f3505c225a8738dae6d1b3a943e9634bb317f4bbbe1b039366","observation_id":"ee29d25c-1280-4512-ba25-21417f06d751","resolution":{"observed_at":"2026-08-01T03:14:12.620290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-01T03:14:12.745471Z","title":"arXiv:2401.06080","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.745471Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:2f6bd10d9408a20258f830640dd5b5b1509af2a386bd77c36b1e893454aa8b73","observation_id":"36eec2bb-fe64-48d6-9715-b767de896496","resolution":{"observed_at":"2026-08-01T03:14:12.745471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04592","last_updated":"2023-08-08T21:23:23Z","snapshot_observed_at":"2026-07-06T16:04:11.116224Z","submitted_at":"2023-08-08T21:23:23Z","title":"Shepherd: A Critic for Language Model Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04592","snapshot_observed_at":"2026-08-01T03:14:12.848281Z","title":"arXiv:2308.04592","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.848281Z"},"links":{"cited_paper":"/paper/2308.04592","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:e7022be270d248bac7e0390b56a5c520d34178af36bd307a2d4ac9d02e3d8ef0","observation_id":"b7d42c34-5f16-46a9-9cb9-82521729b748","resolution":{"observed_at":"2026-08-01T03:14:12.848281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-01T03:14:12.941468Z","title":"arXiv:2309.11489","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.941468Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:a6f3bedc224ff856f0a0983de794d99d59c1f56b6ebd0a4cebac147f60fb2b8f","observation_id":"78f09d93-52dd-4add-9bea-8dfd62e6d254","resolution":{"observed_at":"2026-08-01T03:14:12.941468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-01T03:14:13.190121Z","title":"arXiv:2401.10020","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:13.190121Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:fd2abae202ebf107638b840a15111d2f20e0d456e2ca560b1a6f64335b91303c","observation_id":"547954f7-9c66-4dd1-af5b-2907541648ac","resolution":{"observed_at":"2026-08-01T03:14:13.190121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-01T03:14:13.379937Z","title":"arXiv:2311.07911","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:13.379937Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:2e24cf9b13b11003e594ddea132bb6e67bcea06f3d776a0ffcef0f063d5bb445","observation_id":"afc01fc8-d4da-4fb7-83db-221c62e941f5","resolution":{"observed_at":"2026-08-01T03:14:13.379937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09330","last_updated":"2019-01-27T06:38:24Z","snapshot_observed_at":"2026-07-06T07:29:14.938525Z","submitted_at":"2019-01-27T06:38:24Z","title":"Reward Shaping via Meta-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09330","snapshot_observed_at":"2026-08-01T03:14:13.563948Z","title":"arXiv:1901.09330","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:13.563948Z"},"links":{"cited_paper":"/paper/1901.09330","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:887c3108a0051a72b568d2882323f87717d77212c55bbb110f4cbc37c879db3d","observation_id":"03ec0e56-5877-4bdf-856e-e1f22df7607a","resolution":{"observed_at":"2026-08-01T03:14:13.563948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T03:14:11.329925Z","title":"arXiv:2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.329925Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:525b7c1084c4adfd93e19846dcc428f3223605915f7d37be3dfa71ed688b30a0","observation_id":"fbeb53db-f0cd-4a26-8a74-66021b08a0fb","resolution":{"observed_at":"2026-08-01T03:14:11.329925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-01T03:14:10.992998Z","title":"arXiv:2307.15217","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:10.992998Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:8258056f86bb0331bb12073f0285f0a92b1c91e943d99766f24f11f2364503f0","observation_id":"ff93314f-7801-4b9c-9a7d-3773201a0dfc","resolution":{"observed_at":"2026-08-01T03:14:10.992998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-01T03:14:11.207266Z","title":"arXiv:2404.04475","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.207266Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:440a38574b9ee2a6408677427ff85970680e8ecc18297a0aaf2c264c547585f0","observation_id":"2e737dde-6869-45d3-9274-77ad0eb7785c","resolution":{"observed_at":"2026-08-01T03:14:11.207266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T03:14:13.058627Z","title":"arXiv:2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:13.058627Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:b4f8e20c90f7c694ae78bec4d9f0dcd697a2a2eedb0a8610c482ffcf59e65dd0","observation_id":"2e3c978e-8427-4234-aef3-759f534a98e3","resolution":{"observed_at":"2026-08-01T03:14:13.058627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.26094."}