{"as_of":"2026-08-07T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65b67fd700d978e4445fca9c80bcc4f0fe84f6c34e5f2ff2222bbdf1950f08e4","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:03:33.026420Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:46:28.503923Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20061","snapshot_observed_at":"2026-07-13T00:46:28.503923Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09042","last_updated":"2026-07-10T02:17:41Z","snapshot_observed_at":"2026-08-05T03:22:19.844744Z","submitted_at":"2026-07-10T02:17:41Z","title":"Learning More from Less: Reinforcement Learning from Hindsight","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:28.503923Z"},"links":{"cited_paper":"/paper/2506.20061","citing_paper":"/paper/2607.09042"},"observation_digest":"sha256:d1eedd28a558273182a1f1943ba286ac8ce0d816bc42bde781ad2510f49f4b05","observation_id":"0e39e0b9-01c2-4be0-9674-7f933d8fded8","resolution":{"observed_at":"2026-07-13T00:46:28.503923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20061/citation-record","integrity":"/paper/2506.20061/integrity","json":"/paper/2506.20061/citation-record.json","paper":"/paper/2506.20061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.714342Z","title":"Universal value function approximators","venue":null,"work_id":"4d30e93f-3109-436c-9bf9-fab56a1337bf","year":2015},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.373096Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:b5a39f3b704e1db887826456bfbfb7c2f738c4a860591a36a861da3ac1ed8439","observation_id":"ee5ef227-57f1-48ca-94f1-05a33cc845a6","resolution":{"observed_at":"2026-08-06T23:03:35.816841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:29.500447Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.500447Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:4c730a71c81823ad05e5898d11c1e9ce6781b1908375e2f69c57d2c762e671c5","observation_id":"a7e33da3-9a98-4b9b-9623-c7aba574a393","resolution":{"observed_at":"2026-08-06T23:03:29.500447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09382","last_updated":"2020-05-19T12:16:58Z","snapshot_observed_at":"2026-07-06T09:21:36.119578Z","submitted_at":"2020-05-19T12:16:58Z","title":"Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09382","snapshot_observed_at":"2026-08-06T23:03:29.615893Z","title":"Human instruction-following with deep reinforcement learning via transfer-learning from text","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.615893Z"},"links":{"cited_paper":"/paper/2005.09382","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:5916696262395106a18332301913d5dbb0577114ce5cab4c76f532f946451573","observation_id":"f9e5e4fc-9e4b-413a-b71b-5f24f81619dc","resolution":{"observed_at":"2026-08-06T23:03:29.615893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.445073Z","title":"Grounding language for transfer in deep reinforcement learning","venue":null,"work_id":"59b11f8a-1857-4a45-b470-cb5fdb37dbf4","year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.777682Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:b7500d676e3e6b32233679d0646ef92e8361495fba0859c19c48c8f4957cab60","observation_id":"ce835828-b91f-43ec-9f59-4485abcca790","resolution":{"observed_at":"2026-08-06T23:03:35.565489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16801","last_updated":"2024-06-03T14:12:27Z","snapshot_observed_at":"2026-08-06T07:26:12.597538Z","submitted_at":"2024-02-26T18:19:07Z","title":"Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16801","snapshot_observed_at":"2026-08-06T23:03:29.905488Z","title":"Craftax: A lightning-fast benchmark for open-ended reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.905488Z"},"links":{"cited_paper":"/paper/2402.16801","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:5727ef1d5e70ff83d0d45ecadf90facd6c2a0b74681e89a3ef1234bdde994d02","observation_id":"37532636-43af-4b52-8434-53dd47ee7afa","resolution":{"observed_at":"2026-08-06T23:03:29.905488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-07-06T12:29:20.225445Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-08-06T23:03:30.107695Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.107695Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:59f9d85cad7d15b8ccb2879a4fb37c8be2630e8916339d6e2ed6054a4629048d","observation_id":"7974a871-e96a-47a5-9f66-4fe6ab15f670","resolution":{"observed_at":"2026-08-06T23:03:30.107695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.226837Z","title":"Maximum entropy gain exploration for long horizon multi-goal reinforcement learning","venue":null,"work_id":"133e5da6-8296-4124-917c-60f4495c7329","year":2020},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.241905Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:07cc3d580c60c5f39652c02515b138ce01ffb327f40ac3602c3f5ada0ca15c24","observation_id":"b101b800-f6c9-4d69-9320-e99fe1209ddf","resolution":{"observed_at":"2026-08-06T23:03:35.295432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.378167Z","title":"Curriculum-guided hindsight experience replay","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.378167Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:dc7c210375c17f1e58df340c1f8a1da53d9d205d4b4aabdc3e82b02b0b6cc398","observation_id":"ef5a2712-587e-4d1b-b38e-843eac71b0c4","resolution":{"observed_at":"2026-08-06T23:03:30.378167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.546500Z","title":"Exploration via hindsight goal generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.546500Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:3f0d459079326e5b37fb13aeec97a28cc1843c403f6738b4d11be764fcb3aca5","observation_id":"38706882-630a-49cd-93d4-47fb0f010657","resolution":{"observed_at":"2026-08-06T23:03:30.546500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.719316Z","title":"Visual reinforcement learning with imagined goals","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.719316Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:fde51b561c84e5ab621bcdfec79c0255ae2856a1807d3f475283557d08f94676","observation_id":"cb3ba943-5387-44ad-bab6-55dd54832e3f","resolution":{"observed_at":"2026-08-06T23:03:30.719316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11359","last_updated":"2018-11-28T02:35:24Z","snapshot_observed_at":"2026-07-06T07:17:31.201039Z","submitted_at":"2018-11-28T02:35:24Z","title":"Unsupervised Control Through Non-Parametric Discriminative Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.11359","snapshot_observed_at":"2026-08-06T23:03:30.883300Z","title":"Unsupervised control through non-parametric discriminative rewards","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.883300Z"},"links":{"cited_paper":"/paper/1811.11359","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:7321aa71f42da3438de6d082e074390409725820a5bac5fce50114050ef93078","observation_id":"0676bdcf-9d3c-4064-a8a6-e31cf92c2201","resolution":{"observed_at":"2026-08-06T23:03:30.883300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03926","last_updated":"2019-06-10T12:17:45Z","snapshot_observed_at":"2026-08-04T22:31:02.643975Z","submitted_at":"2019-06-10T12:17:45Z","title":"A Survey of Reinforcement Learning Informed by Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03926","snapshot_observed_at":"2026-08-06T23:03:31.066702Z","title":"A survey of reinforcement learning informed by natural language","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.066702Z"},"links":{"cited_paper":"/paper/1906.03926","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:a96a613135fc28237371b3a70f7e845df5a3a408c4ab7c5900d87c3f2b4dff74","observation_id":"9d332c08-ac5d-4255-8d10-a5b3c3b91e42","resolution":{"observed_at":"2026-08-06T23:03:31.066702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.870026Z","title":"The wisdom of hindsight makes language models better instruction followers","venue":null,"work_id":"6296ea4b-e8b2-40ad-b5c1-b2ceedca998c","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.203145Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:729667337b100187c9fcae98cdb04cdd0347a64a687aac6f207989f6fc1d26ef","observation_id":"cfa8ee4d-b0b4-4fb2-b154-95b72e688eac","resolution":{"observed_at":"2026-08-06T23:03:35.061171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09889","last_updated":"2023-05-17T01:55:08Z","snapshot_observed_at":"2026-07-06T15:28:28.566025Z","submitted_at":"2023-05-17T01:55:08Z","title":"Analyzing the Stance of Facebook Posts on Abortion Considering State-level Health and Social Compositions","version":1},"cited_work":{"arxiv_id":"2305.09889","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09889","snapshot_observed_at":"2026-08-06T23:03:33.266902Z","title":"Analyzing the Stance of Facebook Posts on Abortion Considering State-level Health and Social Compositions","venue":"cs.SI","work_id":"b59051c3-0bd6-4aaa-a6b9-c88ea10b3823","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.331751Z"},"links":{"cited_paper":"/paper/2305.09889","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:cac6deeb2737aadd9ee34e4a8c8bfac76a90ae9630e78b434d2a23751c3a68ad","observation_id":"6d3a108f-8727-45c9-92fd-7970ba17c401","resolution":{"observed_at":"2026-08-06T23:03:33.440232Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-06T23:03:31.451743Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.451743Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:89a26771ff2d7d3407522456d72cb8d097b17411b4975e0fe887a74841b262ba","observation_id":"154d05e9-42a3-44d3-a35f-73f261b2fe91","resolution":{"observed_at":"2026-08-06T23:03:31.451743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.589527Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"8c1b818e-7cc6-4648-88cc-bc0b589fa3da","year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.573213Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:f2ae31a0b250f610e3626c57d32baf5a2ee6af077d1ffba1dc0b75ee88b6cc49","observation_id":"ce92ba1f-c190-465b-bf2f-deb45477acf8","resolution":{"observed_at":"2026-08-06T23:03:34.726003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02515","last_updated":"2022-04-05T23:04:18Z","snapshot_observed_at":"2026-08-02T20:01:27.146878Z","submitted_at":"2022-04-05T23:04:18Z","title":"Inferring Rewards from Language in Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02515","snapshot_observed_at":"2026-08-06T23:03:31.747052Z","title":"Inferring rewards from language in context","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.747052Z"},"links":{"cited_paper":"/paper/2204.02515","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:8fd072005ca57a4d2b24ed31de0db10293496bb3625904772be5340394722f90","observation_id":"87ef1c50-298c-4ceb-91aa-0af950e38492","resolution":{"observed_at":"2026-08-06T23:03:31.747052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.249711Z","title":"Guiding pretraining in reinforcement learning with large language models","venue":null,"work_id":"fb8ae188-fe14-4d5b-9c73-4744d9e067d5","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.894792Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:d59f9c10800d2727a2c3bca82febb420331d01a171a5764dc805e6a5f653e698","observation_id":"472cdb42-28bf-4cde-9f5a-e3c525469997","resolution":{"observed_at":"2026-08-06T23:03:34.435119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.011774Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.011774Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:24b32b5131046c5d7165f84cfb2c488f71dcbc85a51a05c628894134559080de","observation_id":"d4cb4566-d3f4-470e-87b5-8ecfd58751f8","resolution":{"observed_at":"2026-08-06T23:03:32.011774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.159440Z","title":"Minedojo: Building open-ended embodied agents with internet-scale knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.159440Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:daf9925626a24d78813bd975b58c4ff4b0fd6e331bd5ca57a45b556a08ac63ef","observation_id":"125b9fc7-cde6-42f3-bf25-12de208fc593","resolution":{"observed_at":"2026-08-06T23:03:32.159440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02077","last_updated":"2025-06-04T02:00:12Z","snapshot_observed_at":"2026-07-06T20:46:04.250876Z","submitted_at":"2025-03-03T21:58:10Z","title":"M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02077","snapshot_observed_at":"2026-08-06T23:03:32.302643Z","title":"M3hf: Multi-agent reinforcement learning from multi-phase human feedback of mixed quality","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.302643Z"},"links":{"cited_paper":"/paper/2503.02077","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:886f5bfc27cdcfdaa7dadf5fb0f5d2df2f8cb1c2c7af39636c72e68edd8fbd7d","observation_id":"4899dffe-6d59-40f4-b0e2-6883148a6f09","resolution":{"observed_at":"2026-08-06T23:03:32.302643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:33.961455Z","title":"Puterman","venue":null,"work_id":"2ebc74bc-9d1e-47cf-8c8a-e25cfdc3ced2","year":1994},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.436169Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:688ae70cf45d2b610de357780b016c5f132fc1cfbdd8c23db7cedd4d79a9f433","observation_id":"68263a5e-58f2-4328-8d97-e32ffec8b761","resolution":{"observed_at":"2026-08-06T23:03:34.043969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.619630Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.619630Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:fd00a7434df27430751ab150d835d846a560a78d2c06b701d684573e696f00c6","observation_id":"5d3772f7-f1c5-4ac3-82f1-a90506281224","resolution":{"observed_at":"2026-08-06T23:03:32.619630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T23:03:32.776946Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.776946Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:0556fc90cca36c1cb3e5921c97a06b92d6e118cbe8dadf343b73002a56eb88d6","observation_id":"c80792ea-c059-4d23-9320-953d70e826d4","resolution":{"observed_at":"2026-08-06T23:03:32.776946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-03T05:46:16.330368Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T23:03:32.888434Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.888434Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:bf58493c7951f4b47bdd8c9c34516795fec53c05031a1ac147cfe511ebf5252e","observation_id":"625ffa4f-d64e-42a5-9af4-316d21545853","resolution":{"observed_at":"2026-08-06T23:03:32.888434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:33.717803Z","title":"Prioritized level replay","venue":null,"work_id":"27a5ec05-30e9-46dd-ae9e-8c98488cbe26","year":2021},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:33.026420Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:df11ec9119ce2f0983164555269851ccffc27fe27cf6ff488fe1fb31742a438f","observation_id":"191974e1-80f5-4535-ae57-ebc654313a33","resolution":{"observed_at":"2026-08-06T23:03:33.846448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T22:55:10.201552Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2506.20061."}