{"as_of":"2026-08-08T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed8043c72b965cd9e97eac8b818eaa7b4c0354fead4103bd3881cfe3ffb2b610","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:43:18.014761Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16652/citation-record","integrity":"/paper/2506.16652/integrity","json":"/paper/2506.16652/citation-record.json","paper":"/paper/2506.16652"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:06.524744Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:06.524744Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:afe4c67a741450b149732b8bd1f1ba1b3ac130bf0e2f362119765b870575f9e3","observation_id":"530392fa-4ac1-4262-b2ef-0e2eb71e91cd","resolution":{"observed_at":"2026-08-06T23:43:06.524744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:06.725145Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:06.725145Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:c5eda90c45a162b90e685a57ca5fc8bdd2a0d76e354a5c8fe9a4352d2c4ccc4e","observation_id":"ead7d370-fa97-43c5-b65a-d15525e1cb99","resolution":{"observed_at":"2026-08-06T23:43:06.725145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:06.944752Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:06.944752Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:496e1cc6273d7b1daca32c4aca525513127f02c7ba9b66759f59158f8023a0ad","observation_id":"4dff6c96-a746-419b-8240-584857b1acb1","resolution":{"observed_at":"2026-08-06T23:43:06.944752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T23:43:07.226489Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.226489Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:78893ac0a5d3d5b5301d4c57e5239300f9161194f9aa7bdc14cbf088e8744bab","observation_id":"2174d77b-c611-46b9-89ca-276929a64c8b","resolution":{"observed_at":"2026-08-06T23:43:07.226489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T23:43:07.314820Z","title":"Berg, Wan-Yen Lo, Piotr Doll \\'a r, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.314820Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:4751bebe7bfb804d84e6c94d41a578c3ad107b74e83f865ad331a0aacdfb2193","observation_id":"8809d1b7-15b0-47ff-97cb-b6e4e48dae43","resolution":{"observed_at":"2026-08-06T23:43:07.314820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:07.385285Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.385285Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:5d111afb0296136a383b98d82125552a0056be72b4a1268e43c892eb5c140a6e","observation_id":"6065ebc8-815a-4f50-a592-32ee335909ba","resolution":{"observed_at":"2026-08-06T23:43:07.385285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T23:43:07.434890Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.434890Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:0bbb370f8b9469af0a6ef59631ec6092943690e40255bb26e20421f28c228300","observation_id":"57edf40d-6821-492f-921e-d87a80fbbd81","resolution":{"observed_at":"2026-08-06T23:43:07.434890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-06T23:43:07.614816Z","title":"Mobile aloha: Learning bimanual mobile manipulation with low-cost whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.614816Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:c12c62596f22b3289bb39a17187e8b240cee23a396ecde4cb4f822fac2cd8e91","observation_id":"3c414d5e-1d2e-45b6-a06b-450cf0660d82","resolution":{"observed_at":"2026-08-06T23:43:07.614816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-06T23:43:07.755134Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.755134Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:c712ea0e95f75d659c7129a41cefe638d5ffdea5f73a04fcd74933ff672f37f6","observation_id":"4bb60adb-ff49-4b5c-a282-471ffffec83c","resolution":{"observed_at":"2026-08-06T23:43:07.755134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10353","last_updated":"2024-07-14T23:03:23Z","snapshot_observed_at":"2026-07-06T18:46:09.997234Z","submitted_at":"2024-07-14T23:03:23Z","title":"UMI on Legs: Making Manipulation Policies Mobile with Manipulation-Centric Whole-body Controllers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10353","snapshot_observed_at":"2026-08-06T23:43:07.925121Z","title":"Umi on legs: Making manipulation policies mobile with manipulation-centric whole-body controllers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:07.925121Z"},"links":{"cited_paper":"/paper/2407.10353","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:f8a4f72c0e6b436165f674daa35a394fef326234bc9113481f832a878a7c18c1","observation_id":"8d5f6eea-21b9-4c7b-a359-0dd3062b97ab","resolution":{"observed_at":"2026-08-06T23:43:07.925121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.047140Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoperation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.047140Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:8e55d03ebf06a70e95dcf830a168ab470edd6bf44f3fe006602251245cc361c4","observation_id":"2d433d63-85a0-4f1d-b7a7-f03355f6da61","resolution":{"observed_at":"2026-08-06T23:43:08.047140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14896","last_updated":"2023-06-26T17:59:31Z","snapshot_observed_at":"2026-08-03T05:45:44.514692Z","submitted_at":"2023-06-26T17:59:31Z","title":"RVT: Robotic View Transformer for 3D Object Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14896","snapshot_observed_at":"2026-08-06T23:43:08.226401Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.226401Z"},"links":{"cited_paper":"/paper/2306.14896","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:f199318bc1afee5b8c3842293c51ae9be3ab37b05d10db3b241cedb87e10eae6","observation_id":"2809c5b8-11b8-4f18-a6e0-b106d0e4a14a","resolution":{"observed_at":"2026-08-06T23:43:08.226401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.344892Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.344892Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:dfcb1cf9d5260846837102554ee795851e17a13c1adce5e2e94106808fad3ec9","observation_id":"edb8223a-b967-4055-9910-92b6dae55ec1","resolution":{"observed_at":"2026-08-06T23:43:08.344892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.454754Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.454754Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:6a64874924c25ce3591dde068eb2d9e212986c5a72691cb85252afbe1f691470","observation_id":"2946c490-6631-4bf1-b88b-f56eb95646cd","resolution":{"observed_at":"2026-08-06T23:43:08.454754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.584847Z","title":"Viola: Imitation learning for vision-based manipulation with object proposal priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.584847Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:924887f5528e96ccece14c64999f4b9c8bda7e467012ea69ac5707bd719facad","observation_id":"2a830790-43a8-40d7-83dc-68cfd6059798","resolution":{"observed_at":"2026-08-06T23:43:08.584847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-06T23:43:08.684947Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.684947Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:28950f5f966867715190b1a3dd103b1b983b4896cc4e9b0c200a36edba27191c","observation_id":"a0d9b467-9f52-4700-9076-064ce1f70f4b","resolution":{"observed_at":"2026-08-06T23:43:08.684947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.753600Z","title":"Self-supervised correspondence in visuomotor policy learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.753600Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:869042d46880d52b705644dc7c767d280d64adc4d9acbf089002b125b29b50b3","observation_id":"3296d67c-ca87-4065-a1f1-964eb548aead","resolution":{"observed_at":"2026-08-06T23:43:08.753600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:08.906191Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:08.906191Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:61da51dd886a203c7e70a368cb20d83ab928ec31a85bcdbca8af007328ff1217","observation_id":"cfaf3d92-9842-481e-a4ee-72dca1477af4","resolution":{"observed_at":"2026-08-06T23:43:08.906191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:09.014825Z","title":"One-shot imitation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.014825Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:b5bbfb48e5d9229098d5bae3933cf34f6da46742df0b690f0163f579e7f9ac7d","observation_id":"ae4975c4-86a8-4bda-8d89-19c6418507d7","resolution":{"observed_at":"2026-08-06T23:43:09.014825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14326","last_updated":"2023-07-26T17:45:55Z","snapshot_observed_at":"2026-07-06T15:58:51.597795Z","submitted_at":"2023-07-26T17:45:55Z","title":"Waypoint-Based Imitation Learning for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14326","snapshot_observed_at":"2026-08-06T23:43:09.093640Z","title":"Waypoint-based imitation learning for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.093640Z"},"links":{"cited_paper":"/paper/2307.14326","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:9630ab26b372dbcad41f3d3f2a3091edaf3cba189c8e0523630a3f5931c53e40","observation_id":"f258fed9-b238-4ff8-bbb2-71d694138387","resolution":{"observed_at":"2026-08-06T23:43:09.093640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19578","last_updated":"2024-10-17T19:31:39Z","snapshot_observed_at":"2026-08-08T10:09:47.842330Z","submitted_at":"2024-03-28T17:04:00Z","title":"Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19578","snapshot_observed_at":"2026-08-06T23:43:09.225030Z","title":"Keypoint action tokens enable in-context imitation learning in robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.225030Z"},"links":{"cited_paper":"/paper/2403.19578","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:5a5857987eb1176953e89bbb774fb6f36e23f526358f930c6bfc4de9fa30381b","observation_id":"ffef1f68-1225-406c-a3ed-e42db8dbfda4","resolution":{"observed_at":"2026-08-06T23:43:09.225030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13181","last_updated":"2024-02-20T17:48:11Z","snapshot_observed_at":"2026-07-06T17:32:56.445791Z","submitted_at":"2024-02-20T17:48:11Z","title":"DINOBot: Robot Manipulation via Retrieval and Alignment with Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13181","snapshot_observed_at":"2026-08-06T23:43:09.322992Z","title":"Dinobot: Robot manipulation via retrieval and alignment with vision foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.322992Z"},"links":{"cited_paper":"/paper/2402.13181","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d4f0ca6412a88286c1462932ca75347444d23d7564abe3a4e1978cc17b36a59b","observation_id":"8b6ec2ab-7a13-4a87-ad71-d6e6fe8e7731","resolution":{"observed_at":"2026-08-06T23:43:09.322992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12716","last_updated":"2022-05-06T14:46:46Z","snapshot_observed_at":"2026-08-07T11:18:45.003229Z","submitted_at":"2022-01-30T03:59:14Z","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12716","snapshot_observed_at":"2026-08-06T23:43:09.462361Z","title":"You only demonstrate once: Category-level manipulation from single visual demonstration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.462361Z"},"links":{"cited_paper":"/paper/2201.12716","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:4c5d5a61d2a054e70db4ca5bb4b60e56496d44e0dccc78539fe08c90a7fb9b8a","observation_id":"16b0c840-5580-4c33-8187-73367d7db7e1","resolution":{"observed_at":"2026-08-06T23:43:09.462361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-06T23:43:09.554909Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.554909Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:32a4326b85d001bf7130af1660af6e4ab096296f4bdca77d8417d29533b217ed","observation_id":"4fa11043-2014-49f4-b99b-14c3b146a2a3","resolution":{"observed_at":"2026-08-06T23:43:09.554909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T23:43:09.623942Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.623942Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:6d64232e2bff7a30daa1cb15820e1bdb840c488108675004fae15fee643e45c2","observation_id":"0eb65afc-73aa-4012-a46d-7086cd463469","resolution":{"observed_at":"2026-08-06T23:43:09.623942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T23:43:09.744807Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.744807Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:ed0cc38e63ea1727a8488c18276405010406fba124f312179e491922c45cba20","observation_id":"091b71fd-fb37-4c23-8d27-0fc21cc53282","resolution":{"observed_at":"2026-08-06T23:43:09.744807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:09.874754Z","title":"Implicit kinematic policies: Unifying joint and cartesian action spaces in end-to-end robot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:09.874754Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:5db64278adbcb0b3d12041ed2bb0072733d08fcc39bfecba1adc8cef3bfa7288","observation_id":"8feba9ee-3f59-4720-acf3-db53a4ca4472","resolution":{"observed_at":"2026-08-06T23:43:09.874754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:10.034752Z","title":"Implicit behavioral cloning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.034752Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:2a1a7303e38cf558397ced9ec655024f61e60b650acb121d955c331ab3007b95","observation_id":"97035697-5cfe-4cbf-8d4b-855eced3c79e","resolution":{"observed_at":"2026-08-06T23:43:10.034752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:10.154899Z","title":"Behavior transformers: Cloning k modes with one stone","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.154899Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:8056bd74612d2fcd4b3b927f37e019d011cc8ab59ccc887abd9eae31648eb332","observation_id":"aebd1e15-2bf3-4fb7-9b55-d3c33bba4883","resolution":{"observed_at":"2026-08-06T23:43:10.154899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08689","last_updated":"2020-06-30T03:25:59Z","snapshot_observed_at":"2026-07-06T07:40:37.448174Z","submitted_at":"2019-03-20T18:34:29Z","title":"Implicit Generation and Generalization in Energy-Based Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08689","snapshot_observed_at":"2026-08-06T23:43:10.275181Z","title":"Implicit generation and generalization in energy-based models","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.275181Z"},"links":{"cited_paper":"/paper/1903.08689","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d2f9aa537e1e68f3330f494736bd0ea1607b303089eeaf8e418ab7cb3a351c13","observation_id":"ea6ac4b4-8084-4130-91f4-173a7978e7c8","resolution":{"observed_at":"2026-08-06T23:43:10.275181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:10.394745Z","title":"Bayesian learning via stochastic gradient langevin dynamics","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.394745Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:9b04d3e33719512b1e3e09318d8f0636f3647018713be5ed05b9c7d0cb281a1e","observation_id":"75d25a69-607c-44f9-a2de-f704f0cd451f","resolution":{"observed_at":"2026-08-06T23:43:10.394745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02486","last_updated":"2018-11-06T16:52:20Z","snapshot_observed_at":"2026-08-06T20:57:11.126334Z","submitted_at":"2018-11-06T16:52:20Z","title":"Concept Learning with Energy-Based Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02486","snapshot_observed_at":"2026-08-06T23:43:10.504918Z","title":"Concept learning with energy-based models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.504918Z"},"links":{"cited_paper":"/paper/1811.02486","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:2e50544a5012faac6000207d22248b079e3e6bf4681053934f234e8b4d72a1c2","observation_id":"dfb10ef5-910c-4f1b-97df-f04cd563b746","resolution":{"observed_at":"2026-08-06T23:43:10.504918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:10.664926Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.664926Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:24610479550c1f70207ad92e84fb2e6bd3ea64ea0e0fbe15a254dad9ea54947a","observation_id":"edb0c770-db8b-44a1-9b3b-93190f5aacc4","resolution":{"observed_at":"2026-08-06T23:43:10.664926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-07-06T14:44:34.387448Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-08-06T23:43:10.794754Z","title":"Imitating human behaviour with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.794754Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:6ed31c10745bba64a4804adb73334e0bff66b3de952494f13293e2e40cd7990a","observation_id":"6c2b88e6-ccdc-42aa-bc2a-fc54646e79d4","resolution":{"observed_at":"2026-08-06T23:43:10.794754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-06T23:43:10.907921Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:10.907921Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:f9be5450ff7b67203617ca97db8c1b3d18c9cec9e6578520242c44b46996d13d","observation_id":"4d1ee1dd-f098-4c0a-806e-c5e791fbd988","resolution":{"observed_at":"2026-08-06T23:43:10.907921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18121","last_updated":"2024-09-26T17:57:16Z","snapshot_observed_at":"2026-08-06T09:13:33.968909Z","submitted_at":"2024-09-26T17:57:16Z","title":"Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D Reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18121","snapshot_observed_at":"2026-08-06T23:43:11.034889Z","title":"Robot see robot do: Imitating articulated object manipulation with monocular 4d reconstruction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.034889Z"},"links":{"cited_paper":"/paper/2409.18121","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d37a389a9fcdda91f29aa05efc814453d313268031be28b342efdb376594ab13","observation_id":"8783cb81-7809-42ad-9252-0f905344f7b1","resolution":{"observed_at":"2026-08-06T23:43:11.034889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:11.164759Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.164759Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:b1c4e2b5fe3892912654b9297815570c8e987baf8688d870923f96ca7240c20e","observation_id":"0cbd6ddb-4183-4f50-a16e-73171450c14f","resolution":{"observed_at":"2026-08-06T23:43:11.164759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T23:43:11.344830Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.344830Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:07a3e29ee49adbce9b7745ebaf162f387fb5e790f18eeefc627082c8ccf1bec5","observation_id":"0074272f-7172-45a0-86f5-08d662e1a7fb","resolution":{"observed_at":"2026-08-06T23:43:11.344830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:11.474826Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.474826Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:05f6f6b633d0d3d59ec5e08871767ca212761d857bcc6418b5d59986e44c0977","observation_id":"da5d5e3c-1c63-48ff-ba5e-f47dd7c18765","resolution":{"observed_at":"2026-08-06T23:43:11.474826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:11.615171Z","title":"D ^3 fields: Dynamic 3d descriptor fields for zero-shot generalizable rearrangement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.615171Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:27732a55bd05fc9751f37f47528723fd80323ac41fd5bdaca0142dbee84f0074","observation_id":"4b3b404a-6513-4fd6-8418-b2fb404a711b","resolution":{"observed_at":"2026-08-06T23:43:11.615171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:11.734834Z","title":"Gendp: 3d semantic fields for category-level generalizable diffusion policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.734834Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d863c9fade3bae40c2d844f862bf68ff827678763f1f384120e8576f39892510","observation_id":"04b808b3-4aa1-409f-9808-cd2ece70b37f","resolution":{"observed_at":"2026-08-06T23:43:11.734834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:11.895556Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:11.895556Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:1dc33e0a9690a4a5da7c30081e2af2162cab5625f378aca62fe28ee635a999fa","observation_id":"fc9b5885-c966-4250-baf8-8b3bf3babe5e","resolution":{"observed_at":"2026-08-06T23:43:11.895556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:12.084748Z","title":"Voxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.084748Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:ab91c1a04cfc0003ef2c851e91442306a6d853115b3faadacfbc876901117505","observation_id":"8c8153aa-701d-4d6c-92ab-266d308e75e2","resolution":{"observed_at":"2026-08-06T23:43:12.084748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-07T09:28:55.481217Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-06T23:43:12.224995Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.224995Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d47ad57df3ba46616562f1783a3ae677ba2eb320f55be46215e903ee8f5776bc","observation_id":"baeba0e1-6394-4aa3-9a37-1d1f60b9587b","resolution":{"observed_at":"2026-08-06T23:43:12.224995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:12.424891Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.424891Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:a4977b93e3c8e64cf41e6214b498b2b841775d2531821c341e9caaf5f619cfd7","observation_id":"54760dfe-5af2-412f-91c1-0585dadd9377","resolution":{"observed_at":"2026-08-06T23:43:12.424891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-06T23:43:12.634833Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.634833Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:5752bce692c5d90b08dd324435635d4664259ed9d291a85ca0f6858fb36365ce","observation_id":"04a0e119-9373-4eb0-9516-6287aac01525","resolution":{"observed_at":"2026-08-06T23:43:12.634833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:12.754774Z","title":"Learning generalizable manipulation policies with object-centric 3d representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.754774Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:bfc4cfddc2a4b3a5e79b04dc84806373d6d3c537b57deb2582085850fce30835","observation_id":"b6c77665-4bc1-4580-bd8c-c945edf18c79","resolution":{"observed_at":"2026-08-06T23:43:12.754774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:12.869559Z","title":"Spawnnet: Learning generalizable visuomotor skills from pre-trained network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.869559Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:a0fc08b4ea18b499f98be069100248e01652547672554f4f0a576dec57d2e548","observation_id":"f08ac459-94e5-486c-8cb4-36f6a0702591","resolution":{"observed_at":"2026-08-06T23:43:12.869559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:12.984828Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:12.984828Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:d95d383d81ad765eaeaad2c008e8120db7d2f4102af230727b0dbc7cd901ee99","observation_id":"8d712428-93d8-4135-b097-07804ac85b02","resolution":{"observed_at":"2026-08-06T23:43:12.984828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-06T23:43:13.155135Z","title":"Conceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.155135Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:dea75aa2a703ee2dd2035ef260aff6a7e941407acaa72b7d33efa48ceb061e2f","observation_id":"e37e1365-4398-4676-a12f-1fb0c0a3c49e","resolution":{"observed_at":"2026-08-06T23:43:13.155135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15487","last_updated":"2024-10-08T05:32:25Z","snapshot_observed_at":"2026-08-05T09:27:23.060259Z","submitted_at":"2024-02-23T18:27:17Z","title":"RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15487","snapshot_observed_at":"2026-08-06T23:43:13.254910Z","title":"Roboexp: Action-conditioned scene graph via interactive exploration for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.254910Z"},"links":{"cited_paper":"/paper/2402.15487","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:8413891aa462863b48c9dbf83c11d58fc6e5d1c2147203f29894210e245fc684","observation_id":"0b8c997a-c733-4774-827a-f373d9736cc9","resolution":{"observed_at":"2026-08-06T23:43:13.254910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13360","last_updated":"2022-06-20T21:54:36Z","snapshot_observed_at":"2026-08-06T11:45:35.114773Z","submitted_at":"2022-01-31T17:15:41Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13360","snapshot_observed_at":"2026-08-06T23:43:13.374775Z","title":"Hydra: A real-time spatial perception system for 3d scene graph construction and optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.374775Z"},"links":{"cited_paper":"/paper/2201.13360","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:bfb355b12000e5ee164e840a445e16afa67e8c434ca131e86af7fa4306077f59","observation_id":"277d7f32-9bb2-40f8-a18d-18a839f067be","resolution":{"observed_at":"2026-08-06T23:43:13.374775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13696","last_updated":"2024-09-26T20:34:51Z","snapshot_observed_at":"2026-07-06T18:03:19.407231Z","submitted_at":"2024-04-21T15:50:40Z","title":"Clio: Real-time Task-Driven Open-Set 3D Scene Graphs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13696","snapshot_observed_at":"2026-08-06T23:43:13.468970Z","title":"Clio: Real-time task-driven open-set 3d scene graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.468970Z"},"links":{"cited_paper":"/paper/2404.13696","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:8c8ced61c695f2ba26e83df31860016d1741a777bca6092ab2f63b1f38327adb","observation_id":"ea00edfd-c4e9-43ca-a520-b893ceacf694","resolution":{"observed_at":"2026-08-06T23:43:13.468970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:13.644865Z","title":"Foundations of spatial perception for robotics: Hierarchical representations and real-time systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.644865Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:e71437009aa1ec88c8ddbfc49d083b827c8eff999551f226d6780dd4c4f626c1","observation_id":"3cca6a6e-f9d4-45c4-bd33-8f45a73db08a","resolution":{"observed_at":"2026-08-06T23:43:13.644865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:13.764920Z","title":"Indoor and outdoor 3d scene graph generation via language-enabled spatial ontologies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.764920Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:04a624abdc160ad5ea3b46ce1b40aa3b6d0bddf96bdffc02b18c89a37a973f46","observation_id":"adabcccf-81e8-4fbb-aab6-8905679838b7","resolution":{"observed_at":"2026-08-06T23:43:13.764920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:13.854754Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.854754Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:4e9700d9b20403b3257f3a908d74ab56799e548fbd05ee39b983ca1bf39eebcc","observation_id":"e6b65aa2-1669-460d-b865-fc389ea89bb5","resolution":{"observed_at":"2026-08-06T23:43:13.854754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11514","last_updated":"2022-12-06T11:09:39Z","snapshot_observed_at":"2026-07-06T13:34:29.673291Z","submitted_at":"2022-07-23T13:10:25Z","title":"Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11514","snapshot_observed_at":"2026-08-06T23:43:13.972628Z","title":"Semantic abstraction: Open-world 3d scene understanding from 2d vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:13.972628Z"},"links":{"cited_paper":"/paper/2207.11514","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:23037ce3446f019b0087a33ec8687145b42610c2b91743543f6a8dd9be76fc08","observation_id":"3431d5ca-1f8a-479e-81c5-404bd67954ea","resolution":{"observed_at":"2026-08-06T23:43:13.972628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:14.084778Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.084778Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:e8a26d5e51f3dec96381aa764137c4bdeb39df1f4a9c7850de7ff1ad9b4d22b9","observation_id":"9863f160-baa8-4e26-ba60-7d13bcf74934","resolution":{"observed_at":"2026-08-06T23:43:14.084778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:14.204894Z","title":"Think, act, and ask: Open-world interactive personalized robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.204894Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:2e5ef7f2b3a24a5e17dd7d650611420795b471c2d88c6df5a1229c20257f0f51","observation_id":"c50c77f9-a746-4716-b91b-9c183bf18084","resolution":{"observed_at":"2026-08-06T23:43:14.204894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T23:43:14.324750Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.324750Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:badc6860ee5c926b6f27c8d06e95bfe8d5fde4fc88a3a154a994e77c64b435aa","observation_id":"4d92a6aa-6110-43b3-9744-5bb6b49fd89e","resolution":{"observed_at":"2026-08-06T23:43:14.324750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T23:43:14.464752Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.464752Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:9999c7538b1588bdbba0ae71e4425e1a2dcfc575e5f1ca618524198350867162","observation_id":"bebc264f-8b16-4565-a2d4-042f5a69df21","resolution":{"observed_at":"2026-08-06T23:43:14.464752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-06T23:43:14.599688Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.599688Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:46ff87ff3673d4b192436dd7dbdcb8aa0680daf86d0d7e955cf8a95eb9fd7be6","observation_id":"88cdb411-390e-453d-b3dc-59d4c3cc855f","resolution":{"observed_at":"2026-08-06T23:43:14.599688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:14.713014Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.713014Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:3561b76f6e168d5ec19c1f56d38a39da533a940ca0b083d49d4cdedd0e9d92b1","observation_id":"a336effe-8789-4c4f-9578-0cbaa647c504","resolution":{"observed_at":"2026-08-06T23:43:14.713014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08248","last_updated":"2024-03-13T05:03:58Z","snapshot_observed_at":"2026-08-02T02:09:06.312626Z","submitted_at":"2024-03-13T05:03:58Z","title":"CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08248","snapshot_observed_at":"2026-08-06T23:43:14.844779Z","title":"Copa: General robotic manipulation through spatial constraints of parts with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.844779Z"},"links":{"cited_paper":"/paper/2403.08248","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:5cc014cc411ea95c5476e5e9076020e5d1e4e97819aa927655df40596c981f77","observation_id":"a73b0e8e-ffde-4648-b2bd-8326791eb01d","resolution":{"observed_at":"2026-08-06T23:43:14.844779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-06T23:43:14.985685Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:14.985685Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:6084775660c1ca21cff2fdbd8d21802c28cf8326ae86578b6e535b639f286380","observation_id":"253e318f-ba78-4852-baad-4fafd143d470","resolution":{"observed_at":"2026-08-06T23:43:14.985685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-06T23:43:15.132492Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.132492Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:1bc3701c53d0ce5a3d2e6670a63c63422c826234622fc4bc15ca29d349ae47c9","observation_id":"9593aab6-c73b-4d81-bdf0-6cc766bb02c1","resolution":{"observed_at":"2026-08-06T23:43:15.132492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-08-06T23:43:15.274831Z","title":"Video language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.274831Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:816afec2893e6d0dc38dde75d3292878c595dfd046df3d198efb38fcd82896d3","observation_id":"4632c0d5-df63-413b-91ca-f45090d767fa","resolution":{"observed_at":"2026-08-06T23:43:15.274831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:15.384574Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.384574Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:869a98eac8555b4379d74e746ac330421644c181fefce16b165f71916312169e","observation_id":"be6e9c80-d299-4615-811a-83901dfa5cc2","resolution":{"observed_at":"2026-08-06T23:43:15.384574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:15.494772Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.494772Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:3bcbbe5ea9488de97cae7bdca17c6eac4bf3e46b39bb2bac81bb1fa873fd2da3","observation_id":"6c40e8b2-3289-4f05-ba9e-b31810248948","resolution":{"observed_at":"2026-08-06T23:43:15.494772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:15.654847Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.654847Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:00aa827a1b459abe8aa8c6b4dbfc954673cf3cfd4c06e832ba6e73b0821caeaf","observation_id":"8196e1ae-bcf9-4f1c-b5de-c60dda6e8ab4","resolution":{"observed_at":"2026-08-06T23:43:15.654847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17124","last_updated":"2024-04-29T04:34:52Z","snapshot_observed_at":"2026-07-06T17:50:31.162054Z","submitted_at":"2024-03-25T19:04:59Z","title":"Grounding Language Plans in Demonstrations Through Counterfactual Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17124","snapshot_observed_at":"2026-08-06T23:43:15.814911Z","title":"Grounding language plans in demonstrations through counterfactual perturbations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.814911Z"},"links":{"cited_paper":"/paper/2403.17124","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:1dbb5ddfb4c347d2d1ac7af67fce586ab14a0b3d22e4674aaa4767a5c0c84b98","observation_id":"410d0aa1-3209-44c5-bae8-2de46a11e1c0","resolution":{"observed_at":"2026-08-06T23:43:15.814911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:15.974832Z","title":"Ns3d: Neuro-symbolic grounding of 3d objects and relations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:15.974832Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:23bb8e1a53de1b124d9ddee450bb39a707cc87de10d4682b9a5d465fbea19934","observation_id":"a4065065-fe87-48de-b923-98e6854f2713","resolution":{"observed_at":"2026-08-06T23:43:15.974832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T23:43:16.136090Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.136090Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:ab5f3e8d28522f8c0bbc2609eb378ac5cdcad1d621054485eb496250de8b0432","observation_id":"d2c9f0f7-54d6-4314-9f05-e85f520a24dd","resolution":{"observed_at":"2026-08-06T23:43:16.136090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18915","last_updated":"2024-08-29T16:07:30Z","snapshot_observed_at":"2026-07-06T18:37:43.309281Z","submitted_at":"2024-06-27T06:12:01Z","title":"Manipulate-Anything: Automating Real-World Robots using Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18915","snapshot_observed_at":"2026-08-06T23:43:16.284842Z","title":"Manipulate-anything: Automating real-world robots using vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.284842Z"},"links":{"cited_paper":"/paper/2406.18915","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:e6430d5499cc80fbbe87e4c0ab6b3a7c75997e95ee1a5b60a5026a7ab8e8dcff","observation_id":"23a833c6-23d9-49c7-93ab-3bf69e1c2e61","resolution":{"observed_at":"2026-08-06T23:43:16.284842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07997","last_updated":"2023-08-15T19:01:19Z","snapshot_observed_at":"2026-08-06T03:03:10.665669Z","submitted_at":"2023-08-15T19:01:19Z","title":"$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07997","snapshot_observed_at":"2026-08-06T23:43:16.396717Z","title":"A2nav: Action-aware zero-shot robot navigation by exploiting vision-and-language ability of foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.396717Z"},"links":{"cited_paper":"/paper/2308.07997","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:1d8bfdc4b5a9f29a5f02bbebd0492a372a68b536ae435dd5846f8a1f54de4307","observation_id":"dfcc3070-edec-4eba-93b5-78d3cbacfefe","resolution":{"observed_at":"2026-08-06T23:43:16.396717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:16.591307Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.591307Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:3cec32ce263ac1564a6d5c205f4663e3df40e1dec2be2ca549a26109a9db2eea","observation_id":"9923e08f-29ec-425f-939a-aa14592b801f","resolution":{"observed_at":"2026-08-06T23:43:16.591307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-06T23:43:16.734915Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.734915Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:62fd88725bcc88fb746c940d3af6883945f31b9e7cda279f8e246276fa7234c7","observation_id":"42bb8f5a-c3de-46c7-b076-5a94690a86f0","resolution":{"observed_at":"2026-08-06T23:43:16.734915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-07-06T17:01:35.415575Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-06T23:43:16.914894Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.914894Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:a85ada3f9ee5c5d37b0f34e7f134b374646685ae7d2ba7615726306ebd015f14","observation_id":"eb990b57-1269-4fc5-940c-bb2bd06c059c","resolution":{"observed_at":"2026-08-06T23:43:16.914894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07843","last_updated":"2023-12-13T02:20:42Z","snapshot_observed_at":"2026-07-06T17:00:53.532910Z","submitted_at":"2023-12-13T02:20:42Z","title":"Foundation Models in Robotics: Applications, Challenges, and the Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07843","snapshot_observed_at":"2026-08-06T23:43:17.034898Z","title":"Foundation models in robotics: Applications, challenges, and the future","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.034898Z"},"links":{"cited_paper":"/paper/2312.07843","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:000709e7168c63fee3b877e379facfbe6328836c831c4f7e76d0fecb0c057b6f","observation_id":"6de6e3ff-3790-4354-a455-e104a1e34e46","resolution":{"observed_at":"2026-08-06T23:43:17.034898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05741","last_updated":"2024-10-23T03:39:00Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:19:50Z","title":"Real-World Robot Applications of Foundation Models: A Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05741","snapshot_observed_at":"2026-08-06T23:43:17.184834Z","title":"Real-world robot applications of foundation models: A review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.184834Z"},"links":{"cited_paper":"/paper/2402.05741","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:abf5293c057f403e86a1068d20df6c0bbf8cbffbb6c041b9f777bc3c3e074c67","observation_id":"7b95dbea-a782-486b-817c-97b08670ac1b","resolution":{"observed_at":"2026-08-06T23:43:17.184834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04129","last_updated":"2023-03-07T18:44:07Z","snapshot_observed_at":"2026-08-03T19:24:56.017408Z","submitted_at":"2023-03-07T18:44:07Z","title":"Foundation Models for Decision Making: Problems, Methods, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04129","snapshot_observed_at":"2026-08-06T23:43:17.295896Z","title":"Foundation models for decision making: Problems, methods, and opportunities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.295896Z"},"links":{"cited_paper":"/paper/2303.04129","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:1b1e432be03f701961c541ae0fbeaa71eb5519edde4ceaf2b0e1611556a07a06","observation_id":"8c29bd59-3681-4b3b-a308-f23a2617ccc8","resolution":{"observed_at":"2026-08-06T23:43:17.295896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:43:17.404763Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.404763Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:4d9a0196c7883d3d1999f7ecbbec439037c0e6e16a279920a26511f2c466fed1","observation_id":"c53eb4c9-8195-4621-937e-4076ad1aab15","resolution":{"observed_at":"2026-08-06T23:43:17.404763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-06T23:43:17.491513Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.491513Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:a93aa9882e3d25f9ad1df3117e35db4f0d5e2e94eb6f8e5b9522b13b7f52009f","observation_id":"fdfb772a-44d8-4d52-8768-01c7e5d3dded","resolution":{"observed_at":"2026-08-06T23:43:17.491513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:17.585171Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.585171Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:67f8d880619e5ff2c43f562d04df7ca510caa0711850067f8d0e0fd3a2bbc923","observation_id":"9b9bf2b4-bb07-4e99-b12a-def58e8930a7","resolution":{"observed_at":"2026-08-06T23:43:17.585171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:17.704751Z","title":"Chang, Leonidas J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.704751Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:b0a8f9ff5e8910c825a98ca6e0909f8c380ba5d099f71038ecea9ad9a41e04e5","observation_id":"122bba3d-6819-4c37-a05f-7388bde83acf","resolution":{"observed_at":"2026-08-06T23:43:17.704751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:17.816826Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.816826Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:fefc6ee971b4b8606cf98da9887d30b6dc9038f51199eb30c18e118060fc51db","observation_id":"b8c45de2-f754-46cf-a913-c8cde18d3ea5","resolution":{"observed_at":"2026-08-06T23:43:17.816826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:17.904752Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:17.904752Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:70d1e2d5ab75179bc6a6e9e29e0970feddcbbe103890db7f02df97b1563dd42d","observation_id":"4aeba1c7-db8e-40eb-9dc0-ea161c416339","resolution":{"observed_at":"2026-08-06T23:43:17.904752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:43:18.014761Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:18.014761Z"},"links":{"citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:ff972c5b772a11852044881cbd334872c1e7c35e52b2d683e4b748404271572a","observation_id":"78e455b4-cfe8-41e7-a6e6-19bd15ba26c3","resolution":{"observed_at":"2026-08-06T23:43:18.014761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T01:05:22.164916Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2506.16652."}