{"as_of":"2026-08-08T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04431f9582dcefb40b35ffbb1844ad07ff1a505194f83ec167c6e9671cd922b2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:04.302130Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:47:38.286725Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:72bdacaf178d61535a0b8facd750d95a091748db8e1dd18accd3fdbeb77fa512","observation_id":"d23a82d5-3c8d-410b-b9e7-3dd456ea4d2c","resolution":{"observed_at":"2026-05-13T08:57:22.564735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T15:07:04.302130Z","title":"Reward design with language models.arXiv preprint arXiv:2303.00001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-07T14:59:29.508178Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.302130Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:0a2f213e683aa00aaa661e008a5078e4be86c60f2c69c702eaecbf6718c94d01","observation_id":"eedeb1d1-d01b-488b-bf83-d900cfbef269","resolution":{"observed_at":"2026-08-07T15:07:04.302130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T14:54:15.052114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17249","last_updated":"2025-05-22T19:56:03Z","snapshot_observed_at":"2026-08-08T05:34:19.962571Z","submitted_at":"2025-05-22T19:56:03Z","title":"Where You Go is Who You Are: Behavioral Theory-Guided LLMs for Inverse Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:54:15.052114Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.17249"},"observation_digest":"sha256:97968e5d2b870b701727d99e016e111e8872a0cca3e856585d5647cc52e15ae7","observation_id":"20383376-18c4-4a35-860a-eda6c56fc415","resolution":{"observed_at":"2026-08-07T14:54:15.052114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T13:53:38.843038Z","title":"Reward design with language models.arXiv preprint arXiv:2303.00001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.843038Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:b37c543e5c836453622efea0e127ab09e7194c63f05ec98b76b913c21dd3e327","observation_id":"e2c8dac2-a844-4e4f-a062-14f1f34ff23c","resolution":{"observed_at":"2026-08-07T13:53:38.843038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:12:54.004545Z","title":"Emotionally informed language mod- els: A study on emotion bias in text generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00312","last_updated":"2025-05-30T23:45:53Z","snapshot_observed_at":"2026-08-07T12:05:29.974731Z","submitted_at":"2025-05-30T23:45:53Z","title":"An evaluation of LLMs for generating movie reviews: GPT-4o, Gemini-2.0 and DeepSeek-V3","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.004545Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00312"},"observation_digest":"sha256:ee4cc32646dd41d451a4c5d3afaed97e80052f076640eb71146e05ece1ff57a9","observation_id":"89208768-7722-478d-a081-5d8dfc6c7f02","resolution":{"observed_at":"2026-08-07T12:12:54.004545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:11:43.508406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.508406Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:7b0efd40db2712945a8c6d70302effdcb5b4dc4c8297fc5ec8185b22c4daae6c","observation_id":"cd972443-e59a-40ce-b06d-3303f40eea88","resolution":{"observed_at":"2026-08-07T12:11:43.508406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T11:50:00.420509Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01442","last_updated":"2026-06-26T09:06:45Z","snapshot_observed_at":"2026-08-07T11:40:24.655672Z","submitted_at":"2025-06-02T08:57:37Z","title":"Agentic Episodic Control","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:00.420509Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.01442"},"observation_digest":"sha256:c609fde4668983909fa79acd719e02766b70c81dc2b604eeae2908950ff25e2e","observation_id":"c49e6e44-5eb9-430d-b0db-fbe209d244c6","resolution":{"observed_at":"2026-08-07T11:50:00.420509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T11:20:10.973403Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.973403Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b210f08aef1d4820b94d15986234956d004ab9352d12d15335590ac516d02c92","observation_id":"de54f59e-6712-4905-8a83-7fe6714d6b9d","resolution":{"observed_at":"2026-08-07T11:20:10.973403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T22:34:08.994748Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21250","last_updated":"2025-06-26T13:35:53Z","snapshot_observed_at":"2026-08-06T22:27:01.217524Z","submitted_at":"2025-06-26T13:35:53Z","title":"ACTLLM: Action Consistency Tuned Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:08.994748Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.21250"},"observation_digest":"sha256:d7b019226eefe3adca55f35a76d4f2448bde73c59a6807860550a86a12a5aadd","observation_id":"0e6cf36c-3d6b-4d3e-a5a5-6284597625a8","resolution":{"observed_at":"2026-08-06T22:34:08.994748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T17:39:45.103900Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10284","last_updated":"2025-07-14T13:51:28Z","snapshot_observed_at":"2026-08-07T14:06:14.245238Z","submitted_at":"2025-07-14T13:51:28Z","title":"Prompt Informed Reinforcement Learning for Visual Coverage Path Planning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:45.103900Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.10284"},"observation_digest":"sha256:ff4cc29f9e9a65f34f62e0db5c0c8aa2b71b5b1264e461bc99947899207053ee","observation_id":"add81e89-0e28-4c1e-b6a8-8551fdc962c9","resolution":{"observed_at":"2026-08-06T17:39:45.103900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T17:12:28.663704Z","title":"M., Bullard, K., and Sadigh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12496","last_updated":"2025-07-15T21:49:49Z","snapshot_observed_at":"2026-08-06T17:00:15.350427Z","submitted_at":"2025-07-15T21:49:49Z","title":"FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:28.663704Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.12496"},"observation_digest":"sha256:91f70b2458a1b07392e42c977a3e614e95d9a862aee321d4df0cb051535e2367","observation_id":"1c00c216-2a6c-4e00-bfd4-e78c84b992a8","resolution":{"observed_at":"2026-08-06T17:12:28.663704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T15:40:15.257918Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.257918Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:de90237849e00eea2e8ef369463e9c3a1359934c118373be5e85f1a427c073ed","observation_id":"33e0d3f5-5f7a-4d3d-a8d7-a3ec2544814f","resolution":{"observed_at":"2026-08-06T15:40:15.257918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T12:30:39.980782Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21696","last_updated":"2025-08-27T09:28:59Z","snapshot_observed_at":"2026-08-08T00:28:50.797008Z","submitted_at":"2025-07-29T11:20:03Z","title":"Edge Agentic AI Framework for Autonomous Network Optimisation in O-RAN","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:30:39.980782Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.21696"},"observation_digest":"sha256:68909fa3c031fa8a8ce77ebca22569cb5aa37ccddaab0bc73a9f15f09efea216","observation_id":"158fe600-ef6b-423d-b6c2-3bc5a8a134f2","resolution":{"observed_at":"2026-08-06T12:30:39.980782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T17:36:53.242484Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16090","last_updated":"2025-08-22T05:02:50Z","snapshot_observed_at":"2026-08-07T14:17:56.595400Z","submitted_at":"2025-08-22T05:02:50Z","title":"GPLight+: A Genetic Programming Method for Learning Symmetric Traffic Signal Control Policy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:36:53.242484Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.16090"},"observation_digest":"sha256:3ea4db2aa1da47ace0bf69ac645e37bddd6796958066bfc093465a0d8ca9a3e2","observation_id":"f305a4a6-4972-4115-b611-ad80f1e9c0ef","resolution":{"observed_at":"2026-08-05T17:36:53.242484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T16:21:00.388060Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18725","last_updated":"2025-08-26T06:50:11Z","snapshot_observed_at":"2026-08-06T22:55:46.437867Z","submitted_at":"2025-08-26T06:50:11Z","title":"Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-05T16:21:00.388060Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.18725"},"observation_digest":"sha256:2f4e23fb878d088598e2bd8eeb6a9949232731f28d58b0983c288a9d893a0c71","observation_id":"68ebd632-382e-45fe-8ad4-a5484af427e8","resolution":{"observed_at":"2026-08-05T16:21:00.388060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T14:20:39.757357Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21378","last_updated":"2026-07-21T12:16:52Z","snapshot_observed_at":"2026-08-05T14:20:35.593238Z","submitted_at":"2025-08-29T07:47:17Z","title":"RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:39.757357Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.21378"},"observation_digest":"sha256:4c09b99c48c49a73d6b84a4f149f3fb45cc871118f016b2ac943138516b2ef42","observation_id":"0d87d1aa-846d-47c2-8241-a9f836e426a5","resolution":{"observed_at":"2026-08-05T14:20:39.757357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T16:06:58.488030Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16136","last_updated":"2026-06-06T20:56:22Z","snapshot_observed_at":"2026-08-06T11:44:23.885368Z","submitted_at":"2025-09-19T16:35:27Z","title":"Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:58.488030Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2509.16136"},"observation_digest":"sha256:b16fb1ebfba6933b593f93e22faedb2c66b9d73fa6fd2f7c7543a7a76d81dec8","observation_id":"53f15e63-da33-4bec-97ac-afdc54c976d8","resolution":{"observed_at":"2026-08-04T16:06:58.488030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2509.16615","last_updated":"2026-04-14T09:38:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-20T10:37:47Z","title":"LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T15:19:30.609974Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2509.16615"},"observation_digest":"sha256:e31b98255b1e7657a4059a54a1413bbe112a5721f5ccd3d81029f6f85f31f40c","observation_id":"8d415c79-628b-4620-92da-edc874336346","resolution":{"observed_at":"2026-05-18T15:21:32.889019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T10:37:26.093669Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10028","last_updated":"2026-06-07T08:26:55Z","snapshot_observed_at":"2026-08-06T20:27:36.559252Z","submitted_at":"2025-10-11T05:11:21Z","title":"Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:26.093669Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.10028"},"observation_digest":"sha256:b74f036c090790760c1396ccc0247ee3e5fa97ea2d12b5194f1d0f0ed4030ee2","observation_id":"0c805b36-670c-40b6-a7f6-f052dc25baf7","resolution":{"observed_at":"2026-08-04T10:37:26.093669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T09:22:42.928860Z","title":"Reward design with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-08T07:58:01.573052Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.928860Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:8f9beb742ab6e5e06d3292bbc76e88cee13d7eefe60c895e7bb50c4833c13e8e","observation_id":"587ece49-1ab1-4654-ac28-0f2667bb4dd4","resolution":{"observed_at":"2026-08-04T09:22:42.928860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T07:27:03.942685Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.25850","last_updated":"2026-06-23T00:18:36Z","snapshot_observed_at":"2026-08-07T08:02:35.986513Z","submitted_at":"2025-10-29T18:00:16Z","title":"Debate2Create: Robot Co-design via Multi-Agent LLM Debate","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:27:03.942685Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.25850"},"observation_digest":"sha256:dd5cbd5b4f64f64abd10d408aceeb223965c728f469e93b8cc4b029e77cab5d9","observation_id":"e7182a7d-daf9-4bc4-82b3-89d1677e696b","resolution":{"observed_at":"2026-08-04T07:27:03.942685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2512.00778","last_updated":"2026-05-15T09:26:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-30T08:27:59Z","title":"What Is Preference Optimization Doing, and Why?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T18:37:48.161545Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2512.00778"},"observation_digest":"sha256:21f8f0e781a40242bac25440c0da8c0ea6c9d232991b5c70f0863fb323db262d","observation_id":"ebcf14d4-251c-4889-8f75-1e163c19b504","resolution":{"observed_at":"2026-05-21T18:40:28.991254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2604.10517","last_updated":"2026-04-12T08:14:49Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:14:49Z","title":"From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:36.083682Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2604.10517"},"observation_digest":"sha256:ea4b3073e244e8bf6de580b7156c520480108484334583cc59c2093061270547","observation_id":"dffd4cd3-bcf8-45cd-b02b-63d131037c6a","resolution":{"observed_at":"2026-05-11T08:30:58.248439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.01123","last_updated":"2026-05-01T21:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-01T21:49:20Z","title":"PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T19:09:07.557773Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.01123"},"observation_digest":"sha256:9e550578b9c3a1ebe05f411f2f4930a7fac9fab23106bc105bde56156da334a9","observation_id":"e2cb6821-a8dc-49f6-adeb-643f1b2a32b6","resolution":{"observed_at":"2026-05-11T15:51:42.642392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:0accd4a6e4799a62d1d6c0b1f41974862bdd3f374fd9f0c9034579eb92eca829","observation_id":"95fafb7d-3014-4d2b-b6dc-572abe964758","resolution":{"observed_at":"2026-05-09T06:00:35.202959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:531b139c6d44e66be12a5f10382488f68915125419a04a6c6e9a349333a5c53d","observation_id":"dfbba3b9-0fd3-4fa0-86ff-dd484a6ff85b","resolution":{"observed_at":"2026-05-11T03:50:58.007955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.08315","last_updated":"2026-05-08T14:26:40Z","snapshot_observed_at":"2026-07-31T18:56:01.160228Z","submitted_at":"2026-05-08T14:26:40Z","title":"Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:58.315109Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.08315"},"observation_digest":"sha256:0b43fde49787420af7e51f410740063faed617eda95fe2d5a5a33e271506a7d1","observation_id":"a11363b3-61f5-44ea-97ff-02d463e3429f","resolution":{"observed_at":"2026-05-12T08:41:24.007336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.11859","last_updated":"2026-05-12T09:43:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:43:21Z","title":"EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:19:38.587352Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.11859"},"observation_digest":"sha256:18dff397a49ecb48f43d7fb9f5a74aedd8d39c8c152f228d7b555ac219812495","observation_id":"5ee0afc7-d13a-45fd-8fc6-79051e300cb8","resolution":{"observed_at":"2026-05-13T05:27:18.924884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.17900","last_updated":"2026-05-18T06:06:01Z","snapshot_observed_at":"2026-08-02T23:40:34.130341Z","submitted_at":"2026-05-18T06:06:01Z","title":"DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T10:30:48.957568Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.17900"},"observation_digest":"sha256:192a8a0e1987386826365ed4a196c09b6058d5764fba05b1ca4077701db04e3c","observation_id":"1a53cd80-346a-4d58-93e6-720fad5239bf","resolution":{"observed_at":"2026-05-20T10:33:12.905500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.06673","last_updated":"2026-06-04T19:46:45Z","snapshot_observed_at":"2026-08-04T00:52:00.771854Z","submitted_at":"2026-06-04T19:46:45Z","title":"Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:47:16.737433Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.06673"},"observation_digest":"sha256:68e0b85f037759b7a86a0c75f994d79f4b505716cc225388f2b2daf1e411eeac","observation_id":"19b9b349-5bd5-431a-80e2-fc59e6710367","resolution":{"observed_at":"2026-07-02T11:56:55.227147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:428094ae36789acd554dd93eb9e41cbd963fefa0d2a4264073d927351a408210","observation_id":"c880b2a2-7d08-4386-8ba3-647b6b3461c4","resolution":{"observed_at":"2026-07-03T04:47:38.288260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.29869","last_updated":"2026-06-29T07:05:56Z","snapshot_observed_at":"2026-08-02T12:22:24.399410Z","submitted_at":"2026-06-29T07:05:56Z","title":"ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:13.483829Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.29869"},"observation_digest":"sha256:15487f22c8bee0f813961d8545e7693e2eac32214e999f7905a2f751d67e6b53","observation_id":"e6ae1a8e-4136-4dfc-aa6e-dccf1d2d497b","resolution":{"observed_at":"2026-06-30T06:04:21.642435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-01T18:24:05.608019Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17317","last_updated":"2026-07-19T16:01:11Z","snapshot_observed_at":"2026-08-07T23:16:24.147023Z","submitted_at":"2026-07-19T16:01:11Z","title":"TAPAS: Throughput-adaptive Perception for Autonomous Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:24:05.608019Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2607.17317"},"observation_digest":"sha256:36884b33bfa6732e1678a6bee00cbbdd40cc0659da3c37909791dc630b0b10d9","observation_id":"29c5a56c-d257-4a05-9423-3de842757ff7","resolution":{"observed_at":"2026-08-01T18:24:05.608019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-01T15:27:06.396909Z","title":"arXiv preprint arXiv:2303.00001 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18443","last_updated":"2026-07-20T18:51:46Z","snapshot_observed_at":"2026-08-07T21:48:17.505747Z","submitted_at":"2026-07-20T18:51:46Z","title":"Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-08-01T15:27:06.396909Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2607.18443"},"observation_digest":"sha256:1873a3fb60d4529a1edc6e11ae80d04a00686370f3b7c6d2b84926bd93c96e72","observation_id":"913bc2cf-6378-4779-8888-177241f91b5a","resolution":{"observed_at":"2026-08-01T15:27:06.396909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00001/citation-record","integrity":"/paper/2303.00001/integrity","json":"/paper/2303.00001/citation-record.json","paper":"/paper/2303.00001"},"outbound":[],"paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2303.00001."}