{"as_of":"2026-08-06T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:066d4eeb2c12c5ac7289943574db8e2bbf7915b8ad11158574b713587957c216","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:15:50.566587Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T09:27:43.453005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:06.781891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2603.13707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.13707","snapshot_observed_at":"2026-07-31T02:03:17.213017Z","title":"REFINE-DP: Diffusion policy fine-tuning for hu- manoid loco-manipulation via reinforcement learning,","venue":null,"work_id":"8ecf4a19-2e9e-4c6c-84e9-c13ea589b6d5","year":2026},"citing_paper":{"arxiv_id":"2606.12604","last_updated":"2026-06-10T19:01:40Z","snapshot_observed_at":"2026-08-05T03:29:41.720044Z","submitted_at":"2026-06-10T19:01:40Z","title":"EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T09:27:43.453005Z"},"links":{"cited_paper":"/paper/2603.13707","citing_paper":"/paper/2606.12604"},"observation_digest":"sha256:d515c1c218fb01badd34b4ce419841dafde35092c4c732c45a60b5af8b04c69b","observation_id":"f2339b25-7a1a-432e-bffe-48e6c843d5f8","resolution":{"observed_at":"2026-07-31T02:03:17.213017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2603.13707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.13707","snapshot_observed_at":"2026-07-31T02:03:17.213017Z","title":"REFINE-DP: Diffusion policy fine-tuning for hu- manoid loco-manipulation via reinforcement learning,","venue":null,"work_id":"8ecf4a19-2e9e-4c6c-84e9-c13ea589b6d5","year":2026},"citing_paper":{"arxiv_id":"2606.25706","last_updated":"2026-06-24T11:19:38Z","snapshot_observed_at":"2026-08-04T01:24:27.891834Z","submitted_at":"2026-06-24T11:19:38Z","title":"Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:08:43.127148Z"},"links":{"cited_paper":"/paper/2603.13707","citing_paper":"/paper/2606.25706"},"observation_digest":"sha256:8bfc6f8084a4c75782e546e288815777f7aaad5e265c125c61a96991266d93d3","observation_id":"a50faa90-7ed9-4a1f-bec1-50924d3641f0","resolution":{"observed_at":"2026-07-31T02:03:17.213017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.13707/citation-record","integrity":"/paper/2603.13707/integrity","json":"/paper/2603.13707/citation-record.json","paper":"/paper/2603.13707"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.683331Z","title":"Tai- loring solution accuracy for fast whole-body model predictive control of legged robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.683331Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:196145277564b10ee5779f65c16639cadca60bd900d269a61f209c36bf3ce7f8","observation_id":"e6b7662f-cde7-401e-9e3a-835639d176c8","resolution":{"observed_at":"2026-08-02T18:15:46.683331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.732651Z","title":"Seec: Stable end- effector control with model-enhanced residual learning for humanoid loco-manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.732651Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:a6ceb59f54596608203ab108d42a31e54fa5fd1373e217d638acae72b06f4188","observation_id":"cb16dc8d-5e96-4cbc-976b-0b522170c050","resolution":{"observed_at":"2026-08-02T18:15:46.732651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.790300Z","title":"Omnih2o: Universal and dexterous human-to-humanoid whole-body teleoperation and learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.790300Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:ef81af9453ea10c20b36f6117dc1f1d161a30c12284718d735c40d3216c00c36","observation_id":"2295d57f-360b-4992-a9d3-82cd7fa09cb2","resolution":{"observed_at":"2026-08-02T18:15:46.790300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.842412Z","title":"Humanplus: Hu- manoid shadowing and imitation from humans,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.842412Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:109b20d4e99ba9ddae556fda79f7c97af61ab571e113a6e855dcb480cf78738a","observation_id":"84b3c53a-dbff-4d45-9410-8d34a65a5fb3","resolution":{"observed_at":"2026-08-02T18:15:46.842412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.914916Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.914916Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:a58ae1e0a28c0209487b003db21b5c20394583da1553e50bc5d4d79e7dfc6bf8","observation_id":"edd77b51-2099-48ca-a89d-46c35361b14d","resolution":{"observed_at":"2026-08-02T18:15:46.914916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:46.991325Z","title":"Diffusion policy policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:46.991325Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:450ba178be23f85abc7361b392e2a04809bde4b4f67ea5f17f9ae412d178b869","observation_id":"7d07d19c-11c7-4a8e-a39e-c1fab143f97c","resolution":{"observed_at":"2026-08-02T18:15:46.991325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.147433Z","title":"Ppf: Pre-training and preservative fine-tuning of humanoid locomotion via model-assumption- based regularization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.147433Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:be2cf373c8abcc532e2ce5294b6bbb572c7a56b3b3cc34fd7b11b70d4eab7a80","observation_id":"07be161b-a45e-434d-99a7-ae6c5e9fdf43","resolution":{"observed_at":"2026-08-02T18:15:47.147433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.274577Z","title":"Humanoid locomotion and manipulation: Current progress and challenges in control, planning, and learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.274577Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:266e7c051977d54e0233b640b2a9302413750ddab0d62539bad63178329be4e0","observation_id":"47997f94-1242-468f-a641-6d34497aa582","resolution":{"observed_at":"2026-08-02T18:15:47.274577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.413631Z","title":"Twist2: Scalable, portable, and holistic humanoid data collection system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.413631Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:798191c91ff3e3f106e922d998f9dada2f85e22227fe6bcefa31a9d5450612e6","observation_id":"a9a935df-5963-4bfc-951e-ffd88bd011e3","resolution":{"observed_at":"2026-08-02T18:15:47.413631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.556653Z","title":"Falcon: Learning force-adaptive humanoid loco- manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.556653Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:bca788f261b0e5a22bdc003bc55a3b64e60fc6838a5b456509bc0ead100ab2c7","observation_id":"7ca0f4b8-9443-4b8f-8845-4eded4a28ad2","resolution":{"observed_at":"2026-08-02T18:15:47.556653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07773","last_updated":"2025-03-09T08:41:46Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:59:50Z","title":"Mobile-TeleVision: Predictive Motion Priors for Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07773","snapshot_observed_at":"2026-08-02T18:15:47.698722Z","title":"Mobile-television: Predictive motion priors for humanoid whole-body control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.698722Z"},"links":{"cited_paper":"/paper/2412.07773","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:31888740f42205b27575dbaec84d0ddbb9b7084d756831f96e92f3f5932a0727","observation_id":"32751e62-7876-4883-b9af-9eee0fad104d","resolution":{"observed_at":"2026-08-02T18:15:47.698722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.782052Z","title":"HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.782052Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:ccc6a31313f31579eefcfa94879ed46578fb90fca36de69bb1008f1628af1fa9","observation_id":"dca8669d-b1e6-4fca-9040-c7b2c8ed063b","resolution":{"observed_at":"2026-08-02T18:15:47.782052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.894940Z","title":"Wococo: Learning whole-body humanoid control with sequential contacts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.894940Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:6747868e303d7b2dfbcd6ce6ac3e27b9eb5a8799aafcf2b3c10831e77adcd08d","observation_id":"5f0f052b-fb0e-4015-b6f2-5ba8b3f8715f","resolution":{"observed_at":"2026-08-02T18:15:47.894940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:47.969528Z","title":"Curiosity-driven learning of joint locomotion and manipulation tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:47.969528Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:2c93de025c0f60f6f1fe0d94aff2112f1a682031f87fc88dcf208232afac1117","observation_id":"65a300ab-954f-470b-a9bf-cfa9e50c9245","resolution":{"observed_at":"2026-08-02T18:15:47.969528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.052472Z","title":"Learning agile soccer skills for a bipedal robot with deep reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.052472Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:fe81e117f133ea6a0a8403693496dd974eaf313f1f07898999446ee9a89e3fbb","observation_id":"9670c6cc-c8b7-4d52-840a-2308ebb17a2d","resolution":{"observed_at":"2026-08-02T18:15:48.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.158430Z","title":"Opening the sim-to-real door for humanoid pixel-to- action policy transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.158430Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:7e58e8ad54c25de467d94dfeff61ca5dd99c05b3fad949301e1077f52faff64d","observation_id":"4ede54d1-788d-4f23-ae2f-730e90754b08","resolution":{"observed_at":"2026-08-02T18:15:48.158430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.240523Z","title":"Sim-to-real learning for humanoid box loco-manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.240523Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:eb76ec48f7ec362ff6b0107068f717ca3904cba27100d55ebb58e02a35496c68","observation_id":"ad6f6515-edfb-4643-b4e8-bb7021c761e3","resolution":{"observed_at":"2026-08-02T18:15:48.240523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.351210Z","title":"Opt2skill: Imitating dynamically-feasible whole-body trajectories for versatile humanoid loco-manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.351210Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:f86bf64ad2c2e6194020c20afe21db10f93bcfc1db053b3b7c58ef55ad641684","observation_id":"cda389a6-1076-4912-a836-ce51652aa1ef","resolution":{"observed_at":"2026-08-02T18:15:48.351210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.460920Z","title":"Hier- archical planning and control for box loco-manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.460920Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:ac7abef99280f13b17d061c26614d272e1c389461e52104acff7c1ec29b9cfed","observation_id":"5d206791-09fb-47d7-b75b-c5e671578c54","resolution":{"observed_at":"2026-08-02T18:15:48.460920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.602126Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.602126Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:cd9cced18de3134dd660adc371044128944eddfb475b8fad95248a9aacb2f950","observation_id":"5673059d-8830-4ad6-9cf8-3cadadb9e32b","resolution":{"observed_at":"2026-08-02T18:15:48.602126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.703596Z","title":"Visualmimic: Visual humanoid loco-manipulation via motion tracking and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.703596Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:120d7f585644c165315298c15822b3414987ccc7479eafdda0d4223413f78169","observation_id":"f72cddf3-1bdd-4d01-a9ab-da6283afaff1","resolution":{"observed_at":"2026-08-02T18:15:48.703596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.879849Z","title":"Hdmi: Learning interactive humanoid whole-body control from human videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.879849Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:733416665431d849b5834a68f3bc1ef10264dd60094fe494b0500f3d0ed27822","observation_id":"b0343bb9-65fe-4e55-b041-d126507fe94e","resolution":{"observed_at":"2026-08-02T18:15:48.879849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:48.992696Z","title":"From imitation to refinement – residual rl for precise assembly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:48.992696Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:e662174a2caaeb45f8c3d1e2a3797fbe372d66906a1e124cd523fcab5ee077fe","observation_id":"305bb488-6dba-4fc5-b99a-b45adbe7e23e","resolution":{"observed_at":"2026-08-02T18:15:48.992696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.131081Z","title":"Rfs: Reinforce- ment learning with residual flow steering for dexterous manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.131081Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:5b300faac73508edb4a2e31fcb2fc63ca5c95a54eed0e1012888faf07e269ef2","observation_id":"db184c3c-63c1-4d1c-a119-5f2ecc1f6247","resolution":{"observed_at":"2026-08-02T18:15:49.131081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.220783Z","title":"Residual off-policy rl for finetuning behavior cloning policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.220783Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:11b199408184adaa764a2c4b2dd4f9cdb4c3d64c44c9cf058a0aba7b71f35def","observation_id":"2b63d6d6-8220-4e3e-b889-07204454c797","resolution":{"observed_at":"2026-08-02T18:15:49.220783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T18:15:49.360402Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.360402Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:c3addae574351276bf1777ff0df13c15a3095989a07d81942a8160e5b37e575c","observation_id":"ba798607-ea78-49cd-8cab-0fc7deef9f1d","resolution":{"observed_at":"2026-08-02T18:15:49.360402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.499122Z","title":"Efficient online reinforcement learning for diffusion policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.499122Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:1a7a20cfc4b2b015b4346bdf33aa3459fc5517bea71b7a6399039b7ce40f2e64","observation_id":"a74d813b-ea64-4e86-8bcb-913bf209e99a","resolution":{"observed_at":"2026-08-02T18:15:49.499122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.582649Z","title":"π RL: Online rl fine-tuning for flow-based vision- language-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.582649Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:315fa9bf120b92fc63d25a70a9fba5f48d184675f6de919feb77a2e61737e560","observation_id":"2d72b892-502b-4cf9-859d-f9f25451a1e1","resolution":{"observed_at":"2026-08-02T18:15:49.582649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04831","last_updated":"2025-11-06T21:43:02Z","snapshot_observed_at":"2026-08-03T21:57:13.401415Z","submitted_at":"2025-11-06T21:43:02Z","title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04831","snapshot_observed_at":"2026-08-02T18:15:49.694818Z","title":"Isaac lab: A gpu-accelerated simulation framework for multi-modal robot learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.694818Z"},"links":{"cited_paper":"/paper/2511.04831","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:b2760afa6fedaf6267d2401d8ce350835e9a3f5e6c99a6741be1e4244846ec22","observation_id":"71651857-4908-47c2-b5e4-35b53fd4ce40","resolution":{"observed_at":"2026-08-02T18:15:49.694818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10363","last_updated":"2025-04-27T13:49:42Z","snapshot_observed_at":"2026-07-06T20:36:45.378436Z","submitted_at":"2025-02-14T18:42:42Z","title":"BeamDojo: Learning Agile Humanoid Locomotion on Sparse Footholds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10363","snapshot_observed_at":"2026-08-02T18:15:49.743659Z","title":"Beamdojo: Learning agile humanoid locomotion on sparse footholds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.743659Z"},"links":{"cited_paper":"/paper/2502.10363","citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:f032666d70d5bf7d9f4d60df12e5a935ff788bbf613dfe6b0dd8410cff6bc300","observation_id":"c50a1bac-1116-4886-b20a-53a708757a20","resolution":{"observed_at":"2026-08-02T18:15:49.743659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.850902Z","title":"Re- inforcement learning-based footstep control for humanoid robots on complex terrain,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.850902Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:6fc1d7381b692558563594534d226dd516994f9320c62e59a983a1a92682ba49","observation_id":"6331e3f7-12eb-42d1-bd60-c692afb82ef9","resolution":{"observed_at":"2026-08-02T18:15:49.850902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:49.972201Z","title":"Deepmimic: example-guided deep reinforcement learning of physics-based character skills,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:49.972201Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:bd437f0afbc50e7a3d4415d7e498c3b704cc957640dd0b9d7bb6f8e9fa29a9e5","observation_id":"9a56f533-4561-4441-948a-38df0a363957","resolution":{"observed_at":"2026-08-02T18:15:49.972201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.018839Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.018839Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:e8ef111e45de4bac69a3a451308c289a49e662fac7cfd4c656774829da1106b1","observation_id":"9b0f6f8a-4800-4fe7-bcaf-7c045b10541a","resolution":{"observed_at":"2026-08-02T18:15:50.018839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.103256Z","title":"High- dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.103256Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:c3c57dc99e4863fec855accef2472f6fc7e6da6ad0afc66a9868910936cda3d9","observation_id":"e83cbd15-2b66-4150-b438-78460c0ee39d","resolution":{"observed_at":"2026-08-02T18:15:50.103256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.196798Z","title":"Improved Denoising Diffusion Proba- bilistic Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.196798Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:da8634ae246645a0ab81d4ae2b9342b18f51a5bde9709962cdff7405ffa2eff4","observation_id":"8284605d-37e2-41f7-ad39-7cd5e70c5cb0","resolution":{"observed_at":"2026-08-02T18:15:50.196798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.306809Z","title":"Stageact: Stage-conditioned imitation for robust humanoid door opening,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.306809Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:b0f805e31f942d24d9fc4076736e92ae6116f96afc5e8aaaea20ae14f01cbbcd","observation_id":"00433e31-41fc-4383-aaae-c9853f160f01","resolution":{"observed_at":"2026-08-02T18:15:50.306809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:15:50.566587Z","title":"A behavior architecture for fast humanoid robot door traversals,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:50.566587Z"},"links":{"citing_paper":"/paper/2603.13707"},"observation_digest":"sha256:2d2fb1d8b108af3050463e6e63f1a7784a12cde408a2794b053e6530c277bd47","observation_id":"1d79d6f4-75fa-4a49-bd1e-2b3d38e2fc76","resolution":{"observed_at":"2026-08-02T18:15:50.566587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.13707","last_updated":"2026-07-30T04:48:49Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-04T18:22:08.454514Z","submitted_at":"2026-03-14T02:21:19Z","title":"REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2603.13707."}