{"as_of":"2026-08-07T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69258a5057b755322a9a4b11b86031da036e6719b27dfdc1ef95727beef70f0c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:13:43.841984Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:53:50.316535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:492d36ce5b0cc0ca35dec25287f7494649642c29f6cc0d878f568cf11f508be5","observation_id":"8740558b-4808-4940-86a3-12562da04c3f","resolution":{"observed_at":"2026-05-13T08:57:22.356658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:456e392554fecd98d2fb263d325242c8c1ee709a4f9ffb3ae0cd361a812debd7","observation_id":"174f6f66-0c2a-45e2-9233-ca45e25201a4","resolution":{"observed_at":"2026-05-22T21:42:10.816989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T15:13:43.841984Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15793","last_updated":"2025-05-22T04:48:12Z","snapshot_observed_at":"2026-08-07T15:09:16.633906Z","submitted_at":"2025-05-21T17:47:24Z","title":"HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:43.841984Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.15793"},"observation_digest":"sha256:8dacd52c1ed025e3d06ad418192d48b05236c5a6ab6963c65e911080dbc3eaa0","observation_id":"869f221a-4444-4f51-bd69-bb2e6a21cab0","resolution":{"observed_at":"2026-08-07T15:13:43.841984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T14:25:26.188530Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-07T14:16:40.069238Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.188530Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:809ee937021b2568bc81ff83cacf1ba6362dac4107d4bd77485432b39535ab6b","observation_id":"d0a81003-26d7-43ce-ba62-ae59e4f1d1e5","resolution":{"observed_at":"2026-08-07T14:25:26.188530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T22:16:14.289687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07445","last_updated":"2025-09-09T07:10:39Z","snapshot_observed_at":"2026-08-06T20:26:56.108937Z","submitted_at":"2025-09-09T07:10:39Z","title":"Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:16:14.289687Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.07445"},"observation_digest":"sha256:1bfad721a6e8e495b1795fd1998f7e9c431a18a70eaa014a6d96691927f77754","observation_id":"7a4f9053-a688-482a-ae85-e31501427ad3","resolution":{"observed_at":"2026-08-04T22:16:14.289687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T16:06:57.016648Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16136","last_updated":"2026-06-06T20:56:22Z","snapshot_observed_at":"2026-08-06T11:44:23.885368Z","submitted_at":"2025-09-19T16:35:27Z","title":"Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:57.016648Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.16136"},"observation_digest":"sha256:c40a065b37e0c7fbc49c9dfb7d8eadd5f9ed277f1ad2808e9237f23e456b2798","observation_id":"faf0f930-f3c5-4630-a678-b54619866c89","resolution":{"observed_at":"2026-08-04T16:06:57.016648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2509.16615","last_updated":"2026-04-14T09:38:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-20T10:37:47Z","title":"LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T15:19:30.609974Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.16615"},"observation_digest":"sha256:6fa5e89f763d6f57529c024c499c58a1c7ec8a5d98b1ce8a0a52fb92dba6385a","observation_id":"9f5e5edb-2f76-47dd-ab22-4e6287629dcd","resolution":{"observed_at":"2026-05-18T15:21:32.862328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T10:37:26.211102Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10028","last_updated":"2026-06-07T08:26:55Z","snapshot_observed_at":"2026-08-06T20:27:36.559252Z","submitted_at":"2025-10-11T05:11:21Z","title":"Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:26.211102Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2510.10028"},"observation_digest":"sha256:dbe6f58d97e053fea8b992a07d154d00633376f7609c4484c456844b4981aa6d","observation_id":"5fcb6402-7388-4175-8738-e944f9b01c1b","resolution":{"observed_at":"2026-08-04T10:37:26.211102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T07:23:07.784752Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-06T20:27:36.141566Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.784752Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:0f9ed9ff28fa0d9ff3980cc41746472f5a6251dfa18651e2399978c045e1f2f7","observation_id":"7b3121aa-73da-422d-9565-dc6e6dfe64e0","resolution":{"observed_at":"2026-08-04T07:23:07.784752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2603.12145","last_updated":"2026-05-17T22:47:12Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T16:45:47Z","title":"Automatic Generation of High-Performance RL Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T11:04:11.718672Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2603.12145"},"observation_digest":"sha256:d91926cb967106499104b95bffb8b33dbd2bba76ec799c29f0eb394b12911f14","observation_id":"5eddd61c-4bec-4df1-a17e-c6b1746cd718","resolution":{"observed_at":"2026-05-21T11:05:01.520674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2604.19773","last_updated":"2026-03-27T12:13:20Z","snapshot_observed_at":"2026-08-03T12:53:29.360699Z","submitted_at":"2026-03-27T12:13:20Z","title":"PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T23:17:29.025222Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2604.19773"},"observation_digest":"sha256:94e5b957dbbf31c0c18908b0b94a7d0c500762c533e52baa4c018c089c45b438","observation_id":"8caf378a-ab71-4dc1-b7e9-0f224c756884","resolution":{"observed_at":"2026-05-14T23:18:15.758972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:7081c3604ac8b3403a7a8fa5c9618ad5f8acf8f6afe885393eda9582860fa839","observation_id":"38e963a9-50ad-4d1c-95f0-f9b0c1c28d83","resolution":{"observed_at":"2026-05-09T06:00:35.206079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:06eade210b0140dd9b6204c226ed44ac2b082500d203b43c3d8f2fec4abf3c37","observation_id":"72f94d4b-0117-4a26-8472-e567430873dd","resolution":{"observed_at":"2026-05-11T03:50:57.895007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:44.087943Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:8d4fceb41e94ccb8f5710bb20301b175973567d6e579e3800512739669ad073c","observation_id":"c1a87110-1785-4874-bae1-e61994a20dc9","resolution":{"observed_at":"2026-05-12T06:21:26.415726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-14T21:30:42.766390Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:69096c258e5063b5cad6b36b7659bc12cb474599e41bf8c4a8321bd68693cda6","observation_id":"e8e8a514-64ad-41ec-9936-201378a99ba2","resolution":{"observed_at":"2026-05-14T21:32:59.551200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.11859","last_updated":"2026-05-12T09:43:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:43:21Z","title":"EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:19:38.587352Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.11859"},"observation_digest":"sha256:73b21e304695f0fba2243ba002ed16aaf56ed011e443c9980bdcd539d9297313","observation_id":"8dbef211-ee88-4f67-8fe5-8d0785d58fdb","resolution":{"observed_at":"2026-05-13T05:27:18.909313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.00083","last_updated":"2026-05-22T16:04:22Z","snapshot_observed_at":"2026-08-02T22:15:21.959965Z","submitted_at":"2026-05-22T16:04:22Z","title":"From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T15:25:14.906470Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.00083"},"observation_digest":"sha256:67a8347f0b06ca4e51de3d58903e49ec79b583950bf1e6ade04c3e40170d783e","observation_id":"42126c6e-4e3a-4f13-a566-4228b2b66bac","resolution":{"observed_at":"2026-06-30T15:34:48.377018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.17362","last_updated":"2026-06-15T23:39:36Z","snapshot_observed_at":"2026-08-06T06:37:52.220532Z","submitted_at":"2026-06-15T23:39:36Z","title":"DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T03:04:13.554098Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.17362"},"observation_digest":"sha256:9c6ffdc7e9310453179c3f5abbf584ff5bd1c5f375ae807520c57cb3888a7aeb","observation_id":"88e32e35-6223-45a4-a682-cb088f22245a","resolution":{"observed_at":"2026-07-03T18:28:48.875284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:3cd6920ca9e25a3ad76f8360f43d94b114c7e41b81e0bf23086bf7490cce3db2","observation_id":"6289b284-d96d-4818-964e-f2504f346da8","resolution":{"observed_at":"2026-07-04T08:09:40.538848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:4358941e41839b780f010084c01ba435a5ef5ad8081f22719ba4ed4e10ff7b43","observation_id":"19b326fd-8551-41a7-91eb-26efa587dcb4","resolution":{"observed_at":"2026-07-07T12:53:50.318343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Text2Reward: Reward shaping with language models for reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4","observation_id":"452ca998-7168-4afb-8c1e-428707d1d97f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-01T03:14:12.941468Z","title":"arXiv:2309.11489","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.941468Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:a6f3bedc224ff856f0a0983de794d99d59c1f56b6ebd0a4cebac147f60fb2b8f","observation_id":"78f09d93-52dd-4add-9bea-8dfd62e6d254","resolution":{"observed_at":"2026-08-01T03:14:12.941468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T19:45:35.370242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T09:36:29.490823Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.370242Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:4b996b2c430b5a32439d118fba45852588c78a558e202932945745c809dad070","observation_id":"f020b07f-da1a-4fd7-9999-e83625f0a3d3","resolution":{"observed_at":"2026-08-04T19:45:35.370242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.11489/citation-record","integrity":"/paper/2309.11489/integrity","json":"/paper/2309.11489/citation-record.json","paper":"/paper/2309.11489"},"outbound":[],"paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2309.11489."}