{"as_of":"2026-08-18T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c8c86f924a43973968a0d30ce993dc0194751d0849b36168806ee02f9a46d19","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:54:43.782739Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02483/citation-record","integrity":"/paper/2505.02483/integrity","json":"/paper/2505.02483/citation-record.json","paper":"/paper/2505.02483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.092288Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0,","venue":null,"work_id":"c918340f-54d7-403a-8763-3da9514775bb","year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.673416Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:3fa79a52460011934948511d36c4bfb649d711ff58ee2ca48b3eca79f8868883","observation_id":"cbc4e72d-99b4-48b5-9bb2-99c249f151c1","resolution":{"observed_at":"2026-08-16T00:54:44.095329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.083677Z","title":"Universal value func- tion approximators,","venue":null,"work_id":"e1031716-8ece-4054-a25c-bb1a126de12b","year":2015},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.677982Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:0544e08167d23f4278cf446963fa55b0565c9777e166b602d520bf75f2063da5","observation_id":"7be07711-2ff7-4ba6-9a17-b9e057de5c98","resolution":{"observed_at":"2026-08-16T00:54:44.086766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.074399Z","title":"Learning agile soccer skills for a bipedal robot with deep reinforcement learning,","venue":null,"work_id":"de20dea2-9d70-492d-a616-a1f3d1647f05","year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.681404Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:15009d65727514ce5a0467a6459f851d2b7b5165b2d71cfba717e1c5f2386267","observation_id":"9c494614-e082-4a82-91ec-90c93df8ca6b","resolution":{"observed_at":"2026-08-16T00:54:44.077393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.065616Z","title":"Deep reinforcement learning that matters,","venue":null,"work_id":"baf8bb20-80f4-410d-bfc8-fae47dcc3655","year":2018},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.685433Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:ec3d5b576aa805d8496102d23143ed690338348c40a777fff8e0bd2f94d0a640","observation_id":"b8b3681f-b9c1-46ea-a421-4e073e45a213","resolution":{"observed_at":"2026-08-16T00:54:44.068740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.056700Z","title":"Discovering reinforcement learning algorithms,","venue":null,"work_id":"218fb452-9764-49d1-8d63-6a39150ca08b","year":2020},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.689119Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:7ce826172861b4a41b68119d036310b083111d1ff72df06573a2190538453b7a","observation_id":"58fb2ed7-a9a8-48aa-b4ed-7966fd36e6a9","resolution":{"observed_at":"2026-08-16T00:54:44.059787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.692577Z","title":"Legged robots that keep on learning: Fine-tuning locomotion policies in the real world,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.692577Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:6633e0a8b306f017cec642dfc7352ca42e9aadb14110423bef2bfe7a05ee5af1","observation_id":"5ccd08d0-c3ea-4bd8-9f37-01073c09918b","resolution":{"observed_at":"2026-08-16T00:54:43.692577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.040832Z","title":"Reinforcement learning for reduced-order models of legged robots,","venue":null,"work_id":"436ab0b2-37ab-48ee-b62e-5176c58cab4e","year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.696607Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:95505a988817622606866376b5eb48904adc45ec3979e3788206b347fb7e54da","observation_id":"67179b22-4a15-4098-8083-a852534a9cc1","resolution":{"observed_at":"2026-08-16T00:54:44.043906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.029590Z","title":"H-index: Visual reinforcement learning with hand-informed representations for dexterous manipulation,","venue":null,"work_id":"c7363f17-697d-43b4-8b76-068a40e87a89","year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.700066Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:a51822dc917abd23c599c269198ee96b6d5f40c98bcf36e3e3f76ef943f4e0fe","observation_id":"022deb18-6bbb-4fc2-950a-1df922ac3a0b","resolution":{"observed_at":"2026-08-16T00:54:44.033737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.020489Z","title":"Dexterous im- itation made easy: A learning-based framework for efficient dexterous manipulation,","venue":null,"work_id":"4eca491d-b6ae-4138-bb92-df619c92293c","year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.703405Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:74d28af70c1b48ad62d8aa89f55e2896e9c30772a02e27e7c3595bf2151d9412","observation_id":"b44dcc3b-7eb9-4e7d-acfc-d256f11d4c80","resolution":{"observed_at":"2026-08-16T00:54:44.023571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.010844Z","title":"Bi-dexhands: Towards human-level bimanual dexterous manipulation,","venue":null,"work_id":"9bfcb1cb-45e6-4caf-aa64-ae6ae0d6eea5","year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.706315Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:bc706b43fa122d4f35cb17fd6ca7808d500ec3597b15079a2ea3eecad456bf87","observation_id":"33dd97ec-da57-427c-9b08-377bbd68636a","resolution":{"observed_at":"2026-08-16T00:54:44.013923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:44.000713Z","title":"Learning multi-arm manipulation through collaborative teleoperation,","venue":null,"work_id":"38311afc-f887-46e2-af0b-8ff7f50bacaf","year":2021},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.709355Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:05377c5fb0c584bc4928a3f076b7d12995a9b3a27afd96d202cded161de3943e","observation_id":"f0574433-8b35-4a70-bf97-801eb0f0fd29","resolution":{"observed_at":"2026-08-16T00:54:44.003963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-16T00:54:43.712698Z","title":"Playing atari with deep reinforcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.712698Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:450df314752a4a379456e3340a21e9ad29bb2fcb473495a0ee7094d51b8de16b","observation_id":"11424681-f762-44b8-8b1c-2c377687f488","resolution":{"observed_at":"2026-08-16T00:54:43.712698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T00:54:43.716066Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.716066Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:eadbfd40a102972f9dd093237cb3be9a3fb2f7dad47626d31d41cd9dcee94085","observation_id":"05322926-24ee-4cbf-8c5e-e58a67702019","resolution":{"observed_at":"2026-08-16T00:54:43.716066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.990746Z","title":"Hybrid reward architecture for reinforcement learning,","venue":null,"work_id":"28d66c58-9ad7-4e3e-987f-63028594f4e5","year":2017},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.719428Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:80eae8063cc5b6fa272635eeb3b20f3d343ad5562824a8a8616b04fb477b0eb9","observation_id":"c2492b78-cfe9-4607-b515-4a97fea48006","resolution":{"observed_at":"2026-08-16T00:54:43.994371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.980649Z","title":"Reward- adaptive reinforcement learning: Dynamic policy gradient optimization for bipedal locomotion,","venue":null,"work_id":"f05ee64e-2be9-4c01-b571-7d2413633a51","year":2022},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.722488Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:16faeabe64c373f9c2af5d58195adfa0346cdfc843b38372833111e7d02bf8b0","observation_id":"429525b5-7e31-4838-a362-a1ae9311e760","resolution":{"observed_at":"2026-08-16T00:54:43.984412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-16T00:54:43.725448Z","title":"Eureka: Human- level reward design via coding large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.725448Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:eb47e506edf8db021bd6d1e77a3dc8b04d7a32b1f1e6880ede882fe44d80c97a","observation_id":"a99c9a18-1d7a-4935-a394-265f42c82970","resolution":{"observed_at":"2026-08-16T00:54:43.725448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.971171Z","title":"Horde: A scalable real-time architecture for learn- ing knowledge from unsupervised sensorimotor interaction,","venue":null,"work_id":"28d08f14-68b2-41e8-9455-246a6b701c5d","year":2011},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.728949Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:6abccefb526064b43b2259edc183e7b3e620fd99b1c87de4078123b5ddb8581a","observation_id":"40b369bd-4e7b-41ac-b9e3-1f1f630586b8","resolution":{"observed_at":"2026-08-16T00:54:43.974390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T00:54:43.731667Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.731667Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:49f3526821e47ba13dbd87f9861cee57f0bb6d3ffffb432982eb380588c29bea","observation_id":"7f22f43d-f9ae-4570-9740-53a17689252a","resolution":{"observed_at":"2026-08-16T00:54:43.731667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.734906Z","title":"A survey on integration of large language models with intelligent robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.734906Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:675cac9b0e79fb3866d05ddc0bd4dc37b167e4e16c146989942034b5d7f3cbad","observation_id":"41c75371-4942-4334-9b84-77984b53718f","resolution":{"observed_at":"2026-08-16T00:54:43.734906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.738097Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.738097Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:0e69c75e35094414c7435b51b832bfa0d828d752010d5a343442b42201b6b2e7","observation_id":"36caecda-11fb-4d92-9bf4-4ce3a694632a","resolution":{"observed_at":"2026-08-16T00:54:43.738097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T00:54:43.741164Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.741164Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:2f75f3739dd529fd1ef8df2e8dda13d1519d7939e425382c18c97dbd8e9ca33a","observation_id":"1a183650-6279-4444-add1-1409a6ce4935","resolution":{"observed_at":"2026-08-16T00:54:43.741164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.744323Z","title":"Lever- aging pre-trained large language models to construct and utilize world models for model-based task planning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.744323Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:7e5b0cc1ff0be392196b24a014f869f9aa343ddfbb0e33d0225059672cdf93df","observation_id":"829fcc76-1639-4aee-8eae-06d6b909b9ca","resolution":{"observed_at":"2026-08-16T00:54:43.744323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.747215Z","title":"Text2motion: From natural language instructions to feasible plans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.747215Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:f3516d3d54f916678280b19d72b3d69ddf0ec0320c0f5d1d66f7540a76674445","observation_id":"a745327b-295c-4406-b6d6-958ce422ff24","resolution":{"observed_at":"2026-08-16T00:54:43.747215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.750524Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.750524Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:9fe017b802b16ad666db6f0d2fc460a4def7da8dbad10ea9fe270d12af357809","observation_id":"a33a2b9a-6296-42ca-b137-51740b31171f","resolution":{"observed_at":"2026-08-16T00:54:43.750524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.753217Z","title":"Code as policies: Language model programs for em- bodied control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.753217Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:d8c03b0e032574f904ae161f5f9a6288228fd9a59d77d7c1446ecdcc338946f7","observation_id":"961f2aee-d667-4294-8c22-2ef4fe8c6951","resolution":{"observed_at":"2026-08-16T00:54:43.753217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-17T22:16:17.971851Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-16T00:54:43.755841Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.755841Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:6a6d2f555e140a76145290f8d6d89df9c541c6cd7b3cdb215e6651199baf78aa","observation_id":"11a509e6-53b0-4e6a-8e95-fbe315ea49be","resolution":{"observed_at":"2026-08-16T00:54:43.755841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01455","last_updated":"2024-06-14T21:09:49Z","snapshot_observed_at":"2026-08-16T14:46:26.278341Z","submitted_at":"2023-11-02T17:59:21Z","title":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01455","snapshot_observed_at":"2026-08-16T00:54:43.759112Z","title":"Robogen: Towards unleashing infinite data for automated robot learning via generative simulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.759112Z"},"links":{"cited_paper":"/paper/2311.01455","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:84f4ba4b946284698fdd909cfaa8b28c7e305007f59cbd24e97b30168a953b5c","observation_id":"3a911811-6640-401e-a8cb-8621f6bce29e","resolution":{"observed_at":"2026-08-16T00:54:43.759112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-16T00:54:43.762359Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.762359Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:3d9010a114654fc2a0b596fc52feb0edd939997ab6b06b32c3e030532cddca6a","observation_id":"7ad524be-6e0c-4b03-9e89-21f3ebdfc227","resolution":{"observed_at":"2026-08-16T00:54:43.762359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.765362Z","title":"Language models as zero-shot trajectory generators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.765362Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:6cae25aab80e2e96c3dabb2bc3ec9011a0b4f697bbab6e3cf4ece395d537cd27","observation_id":"be46138e-83b1-42da-a143-f3fc8c672178","resolution":{"observed_at":"2026-08-16T00:54:43.765362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.768185Z","title":"Roco: Dialectic multi-robot col- laboration with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.768185Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:4940dea6f2324762284d1255251ecae85de42620bb55bc432051f56658254fb9","observation_id":"3a1b1363-fbb6-4bc4-b161-395902cf2e4a","resolution":{"observed_at":"2026-08-16T00:54:43.768185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-16T00:54:43.770991Z","title":"Llm+ p: Empowering large language models with optimal planning proficiency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.770991Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:1891703632f029ec3bf1ffe90593738e26e795f76476c171200e7132961e23d0","observation_id":"a414e3f0-d429-4d25-983d-aa9ac84349b1","resolution":{"observed_at":"2026-08-16T00:54:43.770991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.916465Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":"d06168ca-2da1-48a6-a945-767d989b355d","year":2024},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.773737Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:c1dbdc058eabd24b6300589eb8f8b87d8e07dfba5785b6586689a4ac576922a8","observation_id":"a5c51b19-5e81-4d5b-acb3-07f223edf92a","resolution":{"observed_at":"2026-08-16T00:54:43.919870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-16T00:54:43.776461Z","title":"High- dimensional continuous control using generalized advantage estima- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.776461Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:a76aa3376b1678af70fe2dcfe999cd0cfb3773edd8e000ab42092b409f87454a","observation_id":"e925e5d6-4fe9-4282-a77e-9ecd7c08064f","resolution":{"observed_at":"2026-08-16T00:54:43.776461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-16T00:54:43.779796Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.779796Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:e18e9e62d556dde1d14badc539ba1c2e55a4f1428789a47841a0de7196a5cd64","observation_id":"d6bdb82f-9553-40d2-a7f1-02d376909e91","resolution":{"observed_at":"2026-08-16T00:54:43.779796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:43.905319Z","title":"Explainable reinforcement learning via reward decomposition,","venue":null,"work_id":"ee53d3bd-369b-401c-8248-e82c97776ea7","year":2019},"citing_paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:43.782739Z"},"links":{"citing_paper":"/paper/2505.02483"},"observation_digest":"sha256:0f10c5fa272618b8a73cf4880d2cd2354f0597c4c0f38b1cc593d6c8cb383cf6","observation_id":"fc26b991-d232-4ef3-b8bf-d16a1277c85d","resolution":{"observed_at":"2026-08-16T00:54:43.910328Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02483","last_updated":"2025-05-05T09:06:17Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T06:03:19.607853Z","submitted_at":"2025-05-05T09:06:17Z","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2505.02483."}