{"as_of":"2026-08-19T03:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd07ca01fde38458815e77dccd58b91ed72bd427123542f0d04071dd36974f58","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:24:21.474479Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T10:57:40.128651Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:58:02.473826Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"cited_work":{"arxiv_id":"2505.01396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01396","snapshot_observed_at":"2026-07-03T10:58:02.473826Z","title":"Sime: En- hancing policy self-improvement with modal-level exploration","venue":null,"work_id":"1876a5c5-2c03-4959-96e7-b679e7bd1326","year":2025},"citing_paper":{"arxiv_id":"2510.17640","last_updated":"2026-08-05T02:51:23Z","snapshot_observed_at":"2026-08-08T23:09:05.210442Z","submitted_at":"2025-10-20T15:21:12Z","title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T06:10:47.309028Z"},"links":{"cited_paper":"/paper/2505.01396","citing_paper":"/paper/2510.17640"},"observation_digest":"sha256:f3fd2a6dcbf26be30a625754aaf995ac627601db5f44525bfd0bafa27b533dd1","observation_id":"065d804c-7470-4df8-8637-5acc0bb5e053","resolution":{"observed_at":"2026-05-18T06:10:57.873959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"cited_work":{"arxiv_id":"2505.01396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01396","snapshot_observed_at":"2026-07-03T10:58:02.473826Z","title":"Sime: En- hancing policy self-improvement with modal-level exploration","venue":null,"work_id":"1876a5c5-2c03-4959-96e7-b679e7bd1326","year":2025},"citing_paper":{"arxiv_id":"2607.02431","last_updated":"2026-07-02T17:00:37Z","snapshot_observed_at":"2026-08-15T17:59:19.515738Z","submitted_at":"2026-07-02T17:00:37Z","title":"WorldSample: Closed-loop Real-robot RL with World Modelling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T10:57:40.128651Z"},"links":{"cited_paper":"/paper/2505.01396","citing_paper":"/paper/2607.02431"},"observation_digest":"sha256:13686795a91d628ee05953fa1d7a0ad2dfbf6aca43fb0db3309e97d0202394b0","observation_id":"d7973617-bd6a-46ce-9e52-db008fe9748b","resolution":{"observed_at":"2026-07-03T10:58:02.475614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.01396/citation-record","integrity":"/paper/2505.01396/integrity","json":"/paper/2505.01396/citation-record.json","paper":"/paper/2505.01396"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:24:21.341416Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.341416Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:fa5b61287b908af88ceacdc3eb0f9ce22aeb0ee5280dec086c9031ff5511b8cc","observation_id":"7657da88-63ef-4663-bcdd-d47e2827ccb1","resolution":{"observed_at":"2026-08-16T04:24:21.341416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.836421Z","title":"From imitation to refinement–residual rl for precise visual assembly","venue":null,"work_id":"04191fcf-3260-4df9-b909-c2522dcee17b","year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.345745Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:db2c0068f905a977a7ee571ac7a175002ff357b3a7ece42ae1d536594da5d9e6","observation_id":"d9d0ae40-9b23-442e-b76f-e12e7e068893","resolution":{"observed_at":"2026-08-16T04:24:21.839594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-17T17:11:08.085240Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-16T04:24:21.349525Z","title":"Robocat: A self-improving generalist agent for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.349525Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:cd3b614506b8652097225ba740f6144e64e3e7fbad3ec7f21f9e54842d74e7a1","observation_id":"80f8ce61-729f-43f7-b43d-140ca8bd98cc","resolution":{"observed_at":"2026-08-16T04:24:21.349525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-16T04:24:21.354753Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.354753Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:02dd368810d35e5c5dc966d867a000ea7b94243a6729d15a80244135e73d3c22","observation_id":"c538e2bf-adc6-425b-ba2a-6683cd0cc79e","resolution":{"observed_at":"2026-08-16T04:24:21.354753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19917","last_updated":"2025-03-17T09:58:58Z","snapshot_observed_at":"2026-08-17T19:39:14.196488Z","submitted_at":"2024-09-30T03:42:06Z","title":"Towards Effective Utilization of Mixed-Quality Demonstrations in Robotic Manipulation via Segment-Level Selection and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19917","snapshot_observed_at":"2026-08-16T04:24:21.358697Z","title":"Towards Effective Utilization of Mixed-Quality Demonstrations in Robotic Manipulation via Segment-Level Selection and Optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.358697Z"},"links":{"cited_paper":"/paper/2409.19917","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:d5661b1c43ddff428e4ad23ad304b54ae2c894948dfdb5d384eba4277bfa5613","observation_id":"a5b5107e-f891-4705-a175-c1c3ff9d2ef9","resolution":{"observed_at":"2026-08-16T04:24:21.358697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.362993Z","title":"Diffusion Policy: Visuomotor Policy Learn- ing via Action Diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.362993Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:3e170e22dee963f2b9999e60fbb53829eea17dbfda56783ab28334593e9aa9aa","observation_id":"57355d6e-1263-44dc-8bb1-1e0ee6d633a6","resolution":{"observed_at":"2026-08-16T04:24:21.362993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-08-18T16:58:44.329929Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-16T04:24:21.366451Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.366451Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:672e599351eee1bf741310ea6973ee705464423b1e43be38b3e670a635ef08d7","observation_id":"d79a4490-6383-4a5b-9c62-75141e65eba2","resolution":{"observed_at":"2026-08-16T04:24:21.366451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.819996Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":"db3ddf32-5867-4dfd-a9fb-e49a0fbde1e6","year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.370020Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:bfd0e5de834d7b46d1a66d3a954776a17125c10c6370880b19236f452764b43f","observation_id":"16b9573b-15e2-4438-a4f6-63f15535d697","resolution":{"observed_at":"2026-08-16T04:24:21.823569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03081","last_updated":"2025-08-25T06:01:46Z","snapshot_observed_at":"2026-08-16T12:53:02.126679Z","submitted_at":"2025-03-05T00:44:12Z","title":"AirExo-2: Scaling up Generalizable Robotic Imitation Learning with Low-Cost Exoskeletons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03081","snapshot_observed_at":"2026-08-16T04:24:21.373632Z","title":"AirExo-2: Scaling up Generalizable Robotic Imitation Learning with Low-Cost Exoskeletons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.373632Z"},"links":{"cited_paper":"/paper/2503.03081","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:4f180dc71eb8dac4d4c48fb5eb1e52f3939cb472981b170682fad4e5998932c6","observation_id":"e9d460da-c12c-4afb-a9ae-ee4feb673e38","resolution":{"observed_at":"2026-08-16T04:24:21.373632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.376637Z","title":"Implicit behavioral cloning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.376637Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:3d6a97ff1f06ef8693558f7bb52263cec50ab60dfb7c9a52473136dcfbff6b0c","observation_id":"4d8815ec-9c11-4ca4-ab53-e48b2493ce0c","resolution":{"observed_at":"2026-08-16T04:24:21.376637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.804158Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"bc5282c7-4c6c-4f3f-bca8-361186ae9ff9","year":2019},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.379510Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:9accc1d1fbe334215a4d1e093c839d903c1be39f9361d4b9968f4fbb27446964","observation_id":"e29f6717-cb5f-4ba5-9800-5cf9f7de8aa9","resolution":{"observed_at":"2026-08-16T04:24:21.807200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.794365Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"21e237c0-4828-4286-86e7-52de07039727","year":2018},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.382395Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:4620dcf821be90e0b1c7d8694844efe641d13860e4c8e51347e84860ff6e0872","observation_id":"e52ffbf8-4e62-4db8-989e-1e9946ff9164","resolution":{"observed_at":"2026-08-16T04:24:21.797656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01497","last_updated":"2023-03-02T18:57:38Z","snapshot_observed_at":"2026-08-16T15:51:16.078717Z","submitted_at":"2023-03-02T18:57:38Z","title":"Teach a Robot to FISH: Versatile Imitation from One Minute of Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01497","snapshot_observed_at":"2026-08-16T04:24:21.384976Z","title":"Teach a robot to fish: Versatile imita- tion from one minute of demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.384976Z"},"links":{"cited_paper":"/paper/2303.01497","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:226f82f73ccd1f9d5e87c9e93966e0c828039d69420f868eb104e234ac144bee","observation_id":"2ff6fc4d-68f2-4903-82fa-0b2964f678a9","resolution":{"observed_at":"2026-08-16T04:24:21.384976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.784420Z","title":"Deep residual learning for image recog- nition","venue":null,"work_id":"225016a2-24a0-4f5a-bf85-c9717c194651","year":2016},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.388579Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:0e76fa4235ed140a8be7a379810357b6d85348a377ba8a62064cfea93892b560","observation_id":"340a3d7e-a9d0-4411-9a8a-a92d0362ede5","resolution":{"observed_at":"2026-08-16T04:24:21.787892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10315","last_updated":"2024-10-14T06:03:55Z","snapshot_observed_at":"2026-08-16T18:14:39.318415Z","submitted_at":"2024-05-16T17:59:07Z","title":"TRANSIC: Sim-to-Real Policy Transfer by Learning from Online Correction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10315","snapshot_observed_at":"2026-08-16T04:24:21.391501Z","title":"Transic: Sim-to-real policy transfer by learning from online correction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.391501Z"},"links":{"cited_paper":"/paper/2405.10315","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:5b092e41cab7bab383e80d2f65c112a456aad1af772688f27fd8041a2e75c2c6","observation_id":"ee8a2335-4dc3-429b-8cfe-dedc1ed1de81","resolution":{"observed_at":"2026-08-16T04:24:21.391501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.775224Z","title":"DROID: A Large-Scale In-The- Wild Robot Manipulation Dataset","venue":null,"work_id":"c291f91e-fba5-48d9-b9a8-521be1b64c40","year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.395120Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:f2dea3a3a33d0efa6ae8ba11c6e34191dc4d409107f5af00a650f5b7ab73937a","observation_id":"92c22eb3-1e93-43e5-a296-d1332fa71037","resolution":{"observed_at":"2026-08-16T04:24:21.778001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.766070Z","title":"Segment anything","venue":null,"work_id":"394cfe2b-c8dc-4fe5-a9db-5a1be79bd8f6","year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.399015Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:bb366db19f7f2ba2275947f2f849fe2addc53787663464568b129f5b60a3e1f3","observation_id":"a45945fc-e060-442f-9feb-e99f01c63889","resolution":{"observed_at":"2026-08-16T04:24:21.769160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-16T04:24:21.402454Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.402454Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:b00593a306c0349dec2e30925ca34b29453ebd926cb8f86b377b164fc155e20f","observation_id":"e5cfdbf5-3315-406c-8edb-2d77df49581e","resolution":{"observed_at":"2026-08-16T04:24:21.402454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.756717Z","title":"Conservative q-learning for offline re- inforcement learning","venue":null,"work_id":"bbda45eb-dbd1-4a35-ab5b-44ff3a6f4898","year":2020},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.407023Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:d981816c34d16ebb3a1b8738c2ff04b32ef947d84f2d787d40c46567b616af1a","observation_id":"732c6017-f3e6-4a10-9247-6cc86c744c69","resolution":{"observed_at":"2026-08-16T04:24:21.759778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T04:24:21.411447Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.411447Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:03834a98247acaef195490e68de0728da8f070c922fa4152476afd4d24781235","observation_id":"244773de-6409-4a48-89ba-5c170241b00e","resolution":{"observed_at":"2026-08-16T04:24:21.411447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.747891Z","title":"Robot learning on the job: Human- in-the-loop autonomy and learning during deployment","venue":null,"work_id":"67605cca-af2a-49ac-a94f-0277db526161","year":2022},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.414904Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:2809b1a0a34383a0a9aa3ed1843565254ceb7df794a34da69b001c9aa481b68d","observation_id":"b56abd12-cba5-4069-bc5a-1b7f796f5424","resolution":{"observed_at":"2026-08-16T04:24:21.750808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21845","last_updated":"2025-03-20T09:16:05Z","snapshot_observed_at":"2026-08-16T14:31:40.509996Z","submitted_at":"2024-10-29T08:12:20Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21845","snapshot_observed_at":"2026-08-16T04:24:21.418807Z","title":"Precise and Dexterous Robotic Manipu- lation via Human-in-the-Loop Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.418807Z"},"links":{"cited_paper":"/paper/2410.21845","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:6085ca4049ee217c4f43d73aa6c2d9f38af37aa6c1d62261d0e217a354b4b156","observation_id":"d7aad825-a44d-4d10-9945-ac9067e8aa22","resolution":{"observed_at":"2026-08-16T04:24:21.418807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.738890Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":"24c13773-3b8a-4656-a373-9f96b29f5835","year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.422103Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:c9e453713a51e84eb5c3a9caf2aa60d3a919d1ab40116df3b8a463ab2179ae47","observation_id":"3acae2ea-6e90-4ea9-9fa3-59f38f3693f0","resolution":{"observed_at":"2026-08-16T04:24:21.741821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00299","last_updated":"2024-10-21T15:56:23Z","snapshot_observed_at":"2026-08-16T13:38:35.547383Z","submitted_at":"2024-06-29T03:37:29Z","title":"Human-Agent Joint Learning for Efficient Robot Manipulation Skill Acquisition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00299","snapshot_observed_at":"2026-08-16T04:24:21.425185Z","title":"Human-agent joint learning for effi- cient robot manipulation skill acquisition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.425185Z"},"links":{"cited_paper":"/paper/2407.00299","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:69466208f159d1cfb0a2f309f042fb94d9104d5804f39fb228704c373e618a5d","observation_id":"abb5c72a-0cb4-4305-9e1f-fcb7c006bc8a","resolution":{"observed_at":"2026-08-16T04:24:21.425185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.729837Z","title":"Sam-rl: Sensing-aware model-based reinforce- ment learning via differentiable physics-based simulation and rendering","venue":null,"work_id":"c7e09f11-6a82-432a-ad69-f79f4b70e2d2","year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.429441Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:b1bb164d60abc8005ae44029d7a61996fb68805733fdef5df059a65aadc0d6c2","observation_id":"351fb2c5-4728-41b0-ace0-84f14ab44bd6","resolution":{"observed_at":"2026-08-16T04:24:21.732889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-16T04:24:21.432445Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.432445Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:be00eb028bd459d6e5577d53f4cccbee84d7b75d59eb8477c4b614cde6cd0bbc","observation_id":"2ff452d4-17e7-4557-b7b9-eaf3ad7fb776","resolution":{"observed_at":"2026-08-16T04:24:21.432445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.719952Z","title":"So You Think You Can Scale Up Autonomous Robot Data Collection?","venue":null,"work_id":"9090d3d6-a18d-44a1-84cf-d168d34caa47","year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.435722Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:3a1c79ae91117705d1763365052d91b9ca22b127915e98be535b34f70a746d1a","observation_id":"679e4985-8878-426d-a0b6-6e2679eee82d","resolution":{"observed_at":"2026-08-16T04:24:21.723650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.438624Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models : Open X-Embodiment Collabora- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.438624Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:f44f4cd87205212e7922432d498c18360d8561808d870f653a79201ba0e0de45","observation_id":"23a93c59-f635-418f-bdee-a9e29a9c0449","resolution":{"observed_at":"2026-08-16T04:24:21.438624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-16T04:24:21.441776Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.441776Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:75da2bdcbfba9f9d4e67c0417a9eaa7dc0f7168c530d1cd7a103a8d0bcb7fcaf","observation_id":"54dcfa2d-7be0-44a0-9ab0-5c55240067db","resolution":{"observed_at":"2026-08-16T04:24:21.441776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17347","last_updated":"2024-05-13T14:02:39Z","snapshot_observed_at":"2026-08-16T14:48:39.250442Z","submitted_at":"2023-10-26T12:27:56Z","title":"CADS: Unleashing the Diversity of Diffusion Models through Condition-Annealed Sampling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17347","snapshot_observed_at":"2026-08-16T04:24:21.445267Z","title":"CADS: Unleashing the diversity of diffusion models through condition-annealed sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.445267Z"},"links":{"cited_paper":"/paper/2310.17347","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:55e680da8d1de7735ebfe8b0ca3fe61a95482c5acbc33f6941a957681169bf65","observation_id":"ec11a19d-8e68-4e59-8835-dc8d075ef115","resolution":{"observed_at":"2026-08-16T04:24:21.445267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T04:24:21.449716Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.449716Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:1b0b46b13f43478538ebe3b525228b38155a57af4a37e107a88fb52c647b9353","observation_id":"4ac55430-72c5-408a-9cc7-49b1d2662d8d","resolution":{"observed_at":"2026-08-16T04:24:21.449716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.453017Z","title":"Behavior transformers: Cloning k modes with one stone","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.453017Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:77a6a8b29fa99cdb91b3da0f5b2a472597ebe0ac4be91b3bda9eb7fe10331724","observation_id":"269c62b3-797f-4f35-bebd-af11667aa5de","resolution":{"observed_at":"2026-08-16T04:24:21.453017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-08-14T17:43:10.264755Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-16T04:24:21.456230Z","title":"Residual policy learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.456230Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:198034c7aab2665f3b22ad511b7d64f17b5e39af62532a339953cec306cbf676","observation_id":"2f9d3fe6-390c-4b9f-b48e-e46c00f774a8","resolution":{"observed_at":"2026-08-16T04:24:21.456230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T04:24:21.459897Z","title":"De- noising diffusion implicit models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.459897Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:5dd0dd236224d8d153990ad717058379a0511d376a95eecba45706eb32d378cb","observation_id":"66da45e2-0cde-4c23-8277-c710f7af89a5","resolution":{"observed_at":"2026-08-16T04:24:21.459897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12281","last_updated":"2024-09-10T15:28:58Z","snapshot_observed_at":"2026-08-16T13:59:42.878901Z","submitted_at":"2024-04-18T15:57:19Z","title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12281","snapshot_observed_at":"2026-08-16T04:24:21.463783Z","title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.463783Z"},"links":{"cited_paper":"/paper/2404.12281","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:5ed49066885c441b13088931dbfbeaa4a68e232658a863701ef411f69e55d9b8","observation_id":"ce636175-18d4-4c72-a790-63aa47e07bc1","resolution":{"observed_at":"2026-08-16T04:24:21.463783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.696069Z","title":"Exponentially weighted imitation learning for batched historical data","venue":null,"work_id":"ace06894-f1bb-44b6-b001-89955e7941f7","year":2018},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.467486Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:e5efff84256c205dee5e0dc486e4f1f37288fa8498f24360327f00798f8a6b23","observation_id":"8c4417a8-f9df-48f6-94f2-5725723e94c1","resolution":{"observed_at":"2026-08-16T04:24:21.700924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-08-16T04:24:21.470866Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.470866Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:08591f7c6cf0755092b6555a37bbe4450af4f39a93e77ba45aa845ee83ceaa83","observation_id":"a35557b9-47ce-4cc4-95b6-172f129c4be9","resolution":{"observed_at":"2026-08-16T04:24:21.470866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:24:21.474479Z","title":"Learning Fine-Grained Bimanual Manip- ulation with Low-Cost Hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:24:21.474479Z"},"links":{"citing_paper":"/paper/2505.01396"},"observation_digest":"sha256:53ea822fe9fd964746d1ea138bcd7e837b9c53a97293e2a0d2c4d01befbe3b9d","observation_id":"9d1981e4-f377-425e-adda-d7325de55126","resolution":{"observed_at":"2026-08-16T04:24:21.474479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01396","last_updated":"2025-05-02T17:13:03Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T19:18:58.000972Z","submitted_at":"2025-05-02T17:13:03Z","title":"SIME: Enhancing Policy Self-Improvement with Modal-level Exploration"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.01396."}