{"as_of":"2026-08-08T03:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f28ff7a9d9f795f232996428309814ac319912ff4bd9b2a36e946213bef1f38","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:42.129182Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20671/citation-record","integrity":"/paper/2505.20671/integrity","json":"/paper/2505.20671/citation-record.json","paper":"/paper/2505.20671"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.139343Z","title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.139343Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:2c441ec403b39315ffb4b8437aa1848e93f74e08e422708ea3b7a5b9f582ebff","observation_id":"d817240d-38a3-4af2-b1f8-cc32045505ad","resolution":{"observed_at":"2026-08-07T13:53:37.139343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T13:53:37.218896Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.218896Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:51c5fda70a2d2762656be407d363007392f621352267fc7381e2347bb73a3101","observation_id":"f8430a45-e6ef-49df-9ff3-396f11e51c05","resolution":{"observed_at":"2026-08-07T13:53:37.218896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T13:53:37.377259Z","title":"Openai gym.arXiv preprint arXiv:1606.01540, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.377259Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:66f48eafaef7954046178879e9cc66b3771041f49115806aff79908c9fb8a6ff","observation_id":"22846068-a9f4-436b-98d3-e1a47af968fe","resolution":{"observed_at":"2026-08-07T13:53:37.377259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T13:53:37.484831Z","title":"Exploration by random network distillation.arXiv preprint arXiv:1810.12894, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.484831Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:71d921b7cc0ab38132e9cc9fe42a56a1b514d9f7c0bed71076da44cfa8880b70","observation_id":"670978e9-6d84-46a8-99d0-96f2821570bf","resolution":{"observed_at":"2026-08-07T13:53:37.484831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:48.242791Z","title":"Imitation learning from vague feedback.Advances in Neural Information Processing Systems, 36:48275–48292, 2023","venue":null,"work_id":"6a87b379-be01-4aaa-9b79-5591e0f89401","year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.615663Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:88db7babbb2aadf6429096f1e695e5c072c4003c557ced70ae9dcdbfe7c96279","observation_id":"62ebb324-b823-48ac-91bf-b85644f567ce","resolution":{"observed_at":"2026-08-07T13:53:48.333620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:48.037855Z","title":"Statemask: Explaining deep reinforcement learning through state mask.Advances in Neural Information Processing Systems, 36:62457–62487, 2023","venue":null,"work_id":"42c35a71-c66b-4206-9c9e-4ff01071d9ea","year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.771974Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:0cb348a37903db637879d06cab80b57aed6142f8f3112029dbddc19e1913a203","observation_id":"e536404e-ff62-4905-96ff-13b9d3dd7b60","resolution":{"observed_at":"2026-08-07T13:53:48.142610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03064","last_updated":"2024-06-06T00:36:03Z","snapshot_observed_at":"2026-08-07T14:06:46.711462Z","submitted_at":"2024-05-05T22:06:42Z","title":"RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation","version":3},"cited_work":{"arxiv_id":"2405.03064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.03064","snapshot_observed_at":"2026-08-07T13:53:43.090478Z","title":"RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation","venue":"cs.LG","work_id":"4fa620a0-7e15-4a13-ba22-c5edb1a17fa1","year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:37.920161Z"},"links":{"cited_paper":"/paper/2405.03064","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:70ac9457672e896d27de70e546a39747c87943550a93870ddb680293c76307cb","observation_id":"65fddf26-7569-45a7-9c3f-12e0a2611be7","resolution":{"observed_at":"2026-08-07T13:53:43.193960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.02020","last_updated":"2019-05-31T04:58:07Z","snapshot_observed_at":"2026-08-04T06:57:32.510700Z","submitted_at":"2019-03-05T19:20:35Z","title":"Using Natural Language for Reward Shaping in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.02020","snapshot_observed_at":"2026-08-07T13:53:38.045573Z","title":"Using natural language for reward shaping in reinforcement learning.arXiv preprint arXiv:1903.02020, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.045573Z"},"links":{"cited_paper":"/paper/1903.02020","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:72aa16c96396cb5cfc07e2ccb1ee613ca43c445741e3aad20759a4cedbeb0cd5","observation_id":"3174fb9c-6810-4c86-b4d3-fe463fc0f735","resolution":{"observed_at":"2026-08-07T13:53:38.045573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:47.853018Z","title":null,"venue":null,"work_id":"37bc630a-4cb3-47f3-adb5-5b6c21c3b41d","year":2021},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.171732Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:858918359df1fb571d75438837233680ec8be557b0e90444c6d2312061eafb1e","observation_id":"1b974b84-8aec-4df4-ba8d-14f2524b65c8","resolution":{"observed_at":"2026-08-07T13:53:47.935363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:47.639623Z","title":"Edge: Explaining deep reinforcement learning policies.Advances in Neural Information Processing Systems, 34:12222–12236, 2021","venue":null,"work_id":"045ed895-b545-4648-a1e3-808ac5aa8054","year":2021},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.341754Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:35fdc568e734cd986de7c14e1f3ad7104c0e0e62b85c0658440944798d5f25d7","observation_id":"e34f203c-d287-4e5f-80d6-ce50ded01619","resolution":{"observed_at":"2026-08-07T13:53:47.739766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:47.450718Z","title":"Uncertainty-aware reinforcement learning for autonomous driving with multimodal digital driver guidance","venue":null,"work_id":"565f0ec3-e639-4ca1-944e-a55560eba8e2","year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.455639Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:bcfaa537eb0fe026d1277f93482580bb3b06d42b6663058c8a27d5dec53cac71","observation_id":"ba18b94e-e4b3-42c1-982e-8ea44066974b","resolution":{"observed_at":"2026-08-07T13:53:47.568713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T13:53:38.626574Z","title":"Inner monologue: Embodied reasoning through planning with language models.arXiv preprint arXiv:2207.05608, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.626574Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:b7542970be5d81d96c1caf8fb3efda2de0a47ed2ed2e388fc54fdd87f579737c","observation_id":"4812f92e-cc31-4232-831c-b9f281382fe4","resolution":{"observed_at":"2026-08-07T13:53:38.626574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T13:53:38.843038Z","title":"Reward design with language models.arXiv preprint arXiv:2303.00001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.843038Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:b37c543e5c836453622efea0e127ab09e7194c63f05ec98b76b913c21dd3e327","observation_id":"e2c8dac2-a844-4e4f-a062-14f1f34ff23c","resolution":{"observed_at":"2026-08-07T13:53:38.843038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13410","last_updated":"2024-11-20T15:52:03Z","snapshot_observed_at":"2026-07-06T19:53:12.584883Z","submitted_at":"2024-11-20T15:52:03Z","title":"A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13410","snapshot_observed_at":"2026-08-07T13:53:38.995783Z","title":"A survey on enhancing reinforcement learning in complex environments: Insights from human and llm feedback.arXiv preprint arXiv:2411.13410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.995783Z"},"links":{"cited_paper":"/paper/2411.13410","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:2d2cb0d08051064451fb60e1a1cc9c28c15bad5f61bc711b83f65f187b1ca34b","observation_id":"693244ae-1063-432e-a529-52d44d492358","resolution":{"observed_at":"2026-08-07T13:53:38.995783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:47.233434Z","title":"Traj-llm: A new exploration for empowering trajectory prediction with pre-trained large language models","venue":null,"work_id":"55208e7c-16fb-4567-a5ad-fd9f437105a4","year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.120232Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:24279c1b31e9829403051a525bbc6fa398a808001d1ba508c0e954a8357fa789","observation_id":"12681bee-52c3-4902-933a-a418ab9f68cb","resolution":{"observed_at":"2026-08-07T13:53:47.327917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.249217Z","title":"Pre-trained language models for interactive decision-making.Advances in Neural Information Processing Systems, 35:31199–31212, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.249217Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:ecd273a90cda22519c61c4167f4cd5a9eed79c28cc1e1197cb73756fb83b6758","observation_id":"2713381e-02ec-4d0b-b4b3-831dc1b409e1","resolution":{"observed_at":"2026-08-07T13:53:39.249217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:47.001536Z","title":"Utility: Utilizing explainable reinforcement learning to improve reinforcement learning","venue":null,"work_id":"1cbc38a7-031e-4b8d-94e7-8e68370acbde","year":2025},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.382941Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:aa24aef7e5b59c8c170326f1f7a9026c3fa29a0db20a4e4365d6234cb1f88e53","observation_id":"ee228267-291e-4941-8d23-1deac2a35ed2","resolution":{"observed_at":"2026-08-07T13:53:47.105048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-07-06T19:52:03.121993Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"cited_work":{"arxiv_id":"2411.11761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11761","snapshot_observed_at":"2026-08-07T13:53:42.619268Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","venue":"cs.LG","work_id":"7ce0b4fc-faf6-4876-8ef1-e9302fd85321","year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.462927Z"},"links":{"cited_paper":"/paper/2411.11761","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:276919780d1bec2a922b277891ee24735326a4bbbbdf022f9f3beae3ab37f426","observation_id":"db71e279-304a-40eb-babd-6ef30e623a54","resolution":{"observed_at":"2026-08-07T13:53:42.823242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02274","last_updated":"2019-08-06T17:54:03Z","snapshot_observed_at":"2026-07-06T07:06:07.852587Z","submitted_at":"2018-10-04T15:24:06Z","title":"Episodic Curiosity through Reachability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02274","snapshot_observed_at":"2026-08-07T13:53:39.550890Z","title":"Episodic curiosity through reachability.arXiv preprint arXiv:1810.02274, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.550890Z"},"links":{"cited_paper":"/paper/1810.02274","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:3950841b8f501222ccddb39005f10f7997381cdcc5715067c922ee00876f42b8","observation_id":"a91e3f3f-b9af-4f4d-82a7-4c258e4dd159","resolution":{"observed_at":"2026-08-07T13:53:39.550890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:53:39.735995Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.735995Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:d163e9aa24608e1ff4c94245db0e6ed5d6cfa4ac317b4848280cd3c0cda17e1f","observation_id":"01195cea-d6ab-40a3-a614-170d2368343d","resolution":{"observed_at":"2026-08-07T13:53:39.735995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.913463Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.913463Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:a33616ddf25f07782d1245eb26e55a26771550a97c4b6fba5cfc13d8e9eafce5","observation_id":"06068cad-f92a-42ea-8564-3df367bfa8d6","resolution":{"observed_at":"2026-08-07T13:53:39.913463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:46.597692Z","title":"Joint rebalancing and charging for shared electric micromobility vehicles with energy-informed demand","venue":null,"work_id":"1d40bc7b-3671-4fb9-9e26-6ffd641be0a6","year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.037041Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:cafe82d08858edd47dfaf95b96eccbca59f93043e7a5ab379c2bbd010458f327","observation_id":"260cef10-6f61-4bbd-9f6a-b10b75bc6283","resolution":{"observed_at":"2026-08-07T13:53:46.732568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.161934Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.161934Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:95598bf097c2f2c2cf25fb13d0aba7f541ea978843704f283ba5f5be6d938a66","observation_id":"3c59896d-b416-4b67-bc3b-ffc9097a5b5e","resolution":{"observed_at":"2026-08-07T13:53:40.161934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:46.374961Z","title":"Correct me if i’m wrong: Using non-experts to repair reinforcement learning policies","venue":null,"work_id":"6ed20f7c-f37a-4d5e-a173-9c02a247b878","year":2022},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.295047Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:56e5a800a4387ed017c6a6328a77adc022fc2e8f0263f2f0ef970c6e6f2302ad","observation_id":"02e1134c-1b30-4393-9a81-ec0766101ccc","resolution":{"observed_at":"2026-08-07T13:53:46.458670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.417064Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.417064Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:2c7c82ddd1bbee9e3e5ddfe5891ab5eb0e1dc51583d33345eed7d046c3a64294","observation_id":"aeeaff42-2518-49ff-9fcc-b8685f8bdd45","resolution":{"observed_at":"2026-08-07T13:53:40.417064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14276","last_updated":"2025-05-29T16:13:21Z","snapshot_observed_at":"2026-08-07T18:02:57.440986Z","submitted_at":"2025-02-20T05:28:44Z","title":"STeCa: Step-level Trajectory Calibration for LLM Agent Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14276","snapshot_observed_at":"2026-08-07T13:53:40.544944Z","title":"Steca: Step-level trajectory calibration for llm agent learning.arXiv preprint arXiv:2502.14276, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.544944Z"},"links":{"cited_paper":"/paper/2502.14276","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:b1fa9ae5c74e3e9ae47a5e199b063a0a7b0866652096dfc24370a6f359d9e095","observation_id":"52c22c42-2152-43e2-87f6-f02544f078e2","resolution":{"observed_at":"2026-08-07T13:53:40.544944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:46.057359Z","title":"Read and reap the rewards: Learning to play atari with the help of instruction manuals.Advances in Neural Information Processing Systems, 36:1009–1023, 2023","venue":null,"work_id":"dd268912-da05-4ed6-a1f1-07159bdd9f81","year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.618574Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:bf76914ce432e2b5c8208a423ee994f22f61b7512c4ac0722656315b26043716","observation_id":"afa650bf-3544-4a5a-b0ec-b02436189bff","resolution":{"observed_at":"2026-08-07T13:53:46.197516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02903","last_updated":"2020-10-06T17:36:29Z","snapshot_observed_at":"2026-07-06T10:02:02.340983Z","submitted_at":"2020-10-06T17:36:29Z","title":"Keep CALM and Explore: Language Models for Action Generation in Text-based Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02903","snapshot_observed_at":"2026-08-07T13:53:40.731232Z","title":"Keep calm and explore: Language models for action generation in text-based games.arXiv preprint arXiv:2010.02903, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.731232Z"},"links":{"cited_paper":"/paper/2010.02903","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:f19b14720a9fc76318d109918ad2de09970f4b5162339f404a8093d5c242c6c8","observation_id":"99f315af-1619-4fde-a573-5a9787d0ae87","resolution":{"observed_at":"2026-08-07T13:53:40.731232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15403","last_updated":"2024-07-22T06:12:21Z","snapshot_observed_at":"2026-08-05T12:52:50.874005Z","submitted_at":"2024-07-22T06:12:21Z","title":"Offline Imitation Learning Through Graph Search and Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15403","snapshot_observed_at":"2026-08-07T13:53:40.827370Z","title":"Offline imitation learning through graph search and retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.827370Z"},"links":{"cited_paper":"/paper/2407.15403","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:f9835f85246f90f210f5f9b9dadd679cdf15867874f646aa7598221454b268f5","observation_id":"100c3049-4c9c-406e-9c5d-55f8c72b669d","resolution":{"observed_at":"2026-08-07T13:53:40.827370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:45.745769Z","title":"{AIRS}: Expla- nation for deep reinforcement learning based security applications","venue":null,"work_id":"4cf66d2c-f179-4cd6-b038-9120ae4369c3","year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:40.914759Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:ea05799773905a5fe83b3318216388e022e1b8d3afdcc32a3ab0f4a36131e4ac","observation_id":"846a6096-7ead-4efe-b425-75e07df69db1","resolution":{"observed_at":"2026-08-07T13:53:45.933464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-07T14:05:45.642543Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-07T13:53:41.067156Z","title":"Language to rewards for robotic skill synthesis.arXiv preprint arXiv:2306.08647, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.067156Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:73a650c5847117b7b3845be1b0a3b2ca1bad1c71b8939f28897c43677d381024","observation_id":"af353fed-4776-48f1-b44b-244220b05b17","resolution":{"observed_at":"2026-08-07T13:53:41.067156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:45.417307Z","title":"+ str(e) +","venue":null,"work_id":"ee1e4708-c2e1-4602-b832-0c85f178a891","year":2018},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.183085Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:7082b00075cf8d29bda71360362432525606834fe6e23faa93402cfe1f951664","observation_id":"06958167-1ff9-409e-a8d3-763007f96967","resolution":{"observed_at":"2026-08-07T13:53:45.573248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:45.071122Z","title":"We should introduce a mechanism to reinforce learning during critical times while undermining actions leading to unfavorable outcomes","venue":null,"work_id":"5ab7810c-cf22-4229-9f0e-5b2dc90e1e6d","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.329697Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:f50e951f3ab79ec0a413b4219187c584dc5a7be8cecbe2559e51b89cc1c87174","observation_id":"7534699e-44c3-4777-affd-0503001fe5ef","resolution":{"observed_at":"2026-08-07T13:53:45.259951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:44.761297Z","title":"The policy should focus on maintaining positional advantage to intercept the ball efficiently","venue":null,"work_id":"9973d9e9-e150-42d0-b388-b441e9873c24","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.439086Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:2c3dfcea363084991a6ade4a6888c15560038b30fbba567c6dc4a9f2cf18c5b1","observation_id":"3534af9b-9eb9-495c-aef9-08c1edb9c65d","resolution":{"observed_at":"2026-08-07T13:53:44.902909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:44.382596Z","title":null,"venue":null,"work_id":"104db4e5-2d2a-4a20-9370-b080d62c1d86","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.611895Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:493b991fea0bbc432b4b4dac9d2a893a925ab35135823a1d04130fd1f348464d","observation_id":"6cc0f9ff-df86-4f86-b4db-b42a43767c48","resolution":{"observed_at":"2026-08-07T13:53:44.549204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:44.142019Z","title":null,"venue":null,"work_id":"51382cc8-706f-498c-b61b-aed55d04a8d5","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.728655Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:7abbb23ea3b67cbfb5b559ceaf3c60f54ce99d7dfd5ab092c7ada06f61abda9c","observation_id":"93396c86-d22d-4fff-aa84-14918688c819","resolution":{"observed_at":"2026-08-07T13:53:44.293375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:43.884215Z","title":"Implementing a mechanism that prioritizes actions based on proximity to the ball in the x-coordinates can significantly improve action selection during critical moments","venue":null,"work_id":"1e4299a3-ecec-44c5-be90-f87188a5b7ac","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.854397Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:a43a518fd4f40dc10a6b09011a59b16586110307d98244293a2076a62f861ee8","observation_id":"586c101f-69b3-4154-81a5-a5d5b6186390","resolution":{"observed_at":"2026-08-07T13:53:43.976039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:43.721985Z","title":null,"venue":null,"work_id":"6d4bec2a-1941-471e-9575-226f7f6952cd","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.987874Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:f0d0b43c0a9e098ccafb9b723b15fbe163816199779f17f5150133f9478b3992","observation_id":"d72a2abc-3c3f-4519-8eb0-cd57a5fa90e9","resolution":{"observed_at":"2026-08-07T13:53:43.797107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:43.495642Z","title":null,"venue":null,"work_id":"9d43ea94-3513-4fa1-921f-6b6bc2a52e60","year":null},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:42.129182Z"},"links":{"citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:777f5007859b12f764354335f6d570092ece1376d5a99ca563a2d0a82abfdce8","observation_id":"38ef5141-ee5b-463d-9b99-8f1a0e6391c9","resolution":{"observed_at":"2026-08-07T13:53:43.615588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.20671."}