{"as_of":"2026-08-05T23:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:715daa387673730b53084e1cd3cc670944acdee398ff8535d6cada9635f45768","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:17:26.054444Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:39:15.211339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T13:26:58.923873Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2601.16870","last_updated":"2026-04-16T16:30:59Z","snapshot_observed_at":"2026-07-31T03:37:30.764909Z","submitted_at":"2026-01-23T16:22:21Z","title":"A Multimodal Data Collection Framework for Dialogue-Driven Assistive Robotics to Clarify Ambiguities: A Wizard-of-Oz Pilot Study","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T11:56:08.770880Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2601.16870"},"observation_digest":"sha256:e00ef7301d5615d59ca38feb17508eff1cfaebbe70d420526965b8cd659f02d0","observation_id":"94877d78-3c1c-4841-b06e-00e965f4f464","resolution":{"observed_at":"2026-06-05T02:16:19.597095Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2604.17252","last_updated":"2026-04-19T04:36:33Z","snapshot_observed_at":"2026-08-03T17:18:05.770284Z","submitted_at":"2026-04-19T04:36:33Z","title":"Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:23:15.951693Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2604.17252"},"observation_digest":"sha256:383b249f07fafcf38b3dde78969359ab083b4b5e948ae7ee9a532c20878228b1","observation_id":"b53e80d9-ca96-4be4-99c7-0cdb57287f41","resolution":{"observed_at":"2026-06-05T02:16:19.597095Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2605.06223","last_updated":"2026-05-15T10:32:27Z","snapshot_observed_at":"2026-07-31T17:47:57.473889Z","submitted_at":"2026-05-07T13:19:03Z","title":"ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T10:16:21.362244Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2605.06223"},"observation_digest":"sha256:1b3c6f94883dc1977b9ecb4db88e5e22417e7563f12fc297f51528dafee7aa48","observation_id":"acae5eae-3d74-4dd8-9ded-70ac6ebc647c","resolution":{"observed_at":"2026-06-05T02:16:19.597095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2605.06223","last_updated":"2026-05-15T10:32:27Z","snapshot_observed_at":"2026-07-31T17:47:57.473889Z","submitted_at":"2026-05-07T13:19:03Z","title":"ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T02:21:32.381100Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2605.06223"},"observation_digest":"sha256:784b9e5d2590b4988287dddbd25d4747251e4f63257cced8d13f34fb6d24180a","observation_id":"b21d970b-3837-45aa-891a-ed973cbb5f0b","resolution":{"observed_at":"2026-06-05T02:16:19.597095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2605.06223","last_updated":"2026-05-15T10:32:27Z","snapshot_observed_at":"2026-07-31T17:47:57.473889Z","submitted_at":"2026-05-07T13:19:03Z","title":"ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T17:00:32.029802Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2605.06223"},"observation_digest":"sha256:7ce57e18739b82ba702519d118ee865c345c17762c48030725ae1067f9b2e48e","observation_id":"27703564-48cf-45d5-b6e3-53fcd0b7c6a3","resolution":{"observed_at":"2026-06-05T02:16:19.597095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2605.30834","last_updated":"2026-05-29T04:40:12Z","snapshot_observed_at":"2026-08-05T19:24:52.553229Z","submitted_at":"2026-05-29T04:40:12Z","title":"Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T22:39:15.211339Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2605.30834"},"observation_digest":"sha256:c10adb9cba51c272aca5ea0ee79f4f8a3ad8bde047996c342fe5b2f14c046b54","observation_id":"fa950bc0-4116-4726-86b4-d535a2f97adb","resolution":{"observed_at":"2026-06-28T22:42:46.559866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"cited_work":{"arxiv_id":"2509.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15061","snapshot_observed_at":"2026-07-02T13:26:58.923873Z","title":"arXiv preprint arXiv:2509.15061 , year=","venue":"cs.RO","work_id":"f5f70bed-7d1c-401d-8868-2dce95e12271","year":2025},"citing_paper":{"arxiv_id":"2606.06194","last_updated":"2026-06-04T14:01:01Z","snapshot_observed_at":"2026-08-04T07:55:49.422544Z","submitted_at":"2026-06-04T14:01:01Z","title":"ActiveMimic: Egocentric Video Pretraining with Active Perception","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T01:19:47.785250Z"},"links":{"cited_paper":"/paper/2509.15061","citing_paper":"/paper/2606.06194"},"observation_digest":"sha256:c3d854368b9ba34e240f669988ba0731c7bfe06b447c29e434126d730f16b721","observation_id":"1c263f66-795b-4edb-8c38-099f18786185","resolution":{"observed_at":"2026-07-02T13:26:58.925120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.15061/citation-record","integrity":"/paper/2509.15061/integrity","json":"/paper/2509.15061/citation-record.json","paper":"/paper/2509.15061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.949778Z","title":"Computing machinery and intelligence,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.949778Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:6dd647c76ca1fafc8c5cec1fc1d247c7d3ea1d74691fbf2ced414d1f7facf664","observation_id":"b84b1851-2495-4fdc-bb15-096e75be0b6a","resolution":{"observed_at":"2026-08-04T16:17:25.949778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.953796Z","title":"Artificial intelligence for long-term robot autonomy: A sur- vey,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.953796Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:08fbf0babfbf336dbf3e5965e1e7fa0215a6171ecc6fd17529a9c5f0b2140b88","observation_id":"0099fe16-72dd-47e4-b142-ac83a49e25e2","resolution":{"observed_at":"2026-08-04T16:17:25.953796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.957217Z","title":"A survey of embodied ai: From simulators to research tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.957217Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:6f222aa5f1b3eb523f9747d13fbb513e0089309e74d1a1bf2e77c94c8df741f7","observation_id":"3a19d9d1-a47b-4b69-911b-2cd00556df08","resolution":{"observed_at":"2026-08-04T16:17:25.957217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.960815Z","title":"Autonomous agents as embodied ai,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.960815Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:505ad9fc1c75fcf387ada016eb08b064f64fdde9fb8b396b1b2476a2396facad","observation_id":"0ee5f43f-c102-47c6-af10-d5a2d5a5f67a","resolution":{"observed_at":"2026-08-04T16:17:25.960815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.963871Z","title":"Dialfred: Dialogue-enabled agents for embodied instruction following,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.963871Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:348dc3f56baf53235de9995678b9b4e57a4574a9b703732edd9765cc26f2431b","observation_id":"058e4661-22fb-4b01-9c30-da6c653621a8","resolution":{"observed_at":"2026-08-04T16:17:25.963871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.967025Z","title":"Teach: Task-driven embodied agents that chat,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.967025Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:195cdd8bff2fa17f6ebd5c2b70e299c05febef6ba2f8882dff7691b8ff532b54","observation_id":"9aaded77-abb8-40a0-ad4b-c43a3e8331ed","resolution":{"observed_at":"2026-08-04T16:17:25.967025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.970064Z","title":"Grounding multimodal llms to embodied agents that ask for help with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.970064Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:5cc3103584030b812e3569d484d7d3932019d03070a0015e1baa174c3a3d340c","observation_id":"1f0807b0-43f7-410e-b1db-2e77b07f9eac","resolution":{"observed_at":"2026-08-04T16:17:25.970064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T16:17:25.973193Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.973193Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:ce20a13c06ab65afe624683b96f71b0470ea6dc079a2cb8e80e13edd17df5aa2","observation_id":"dcf27dbb-763d-4fc4-99d6-8988c21531b6","resolution":{"observed_at":"2026-08-04T16:17:25.973193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T16:17:25.976904Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.976904Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:092bb793d63e832c33f24cce8d7b37e84a059bea0e8d07bfe3aa811bfdfb2d44","observation_id":"90e33f91-4bd9-483b-87a4-aa566715af39","resolution":{"observed_at":"2026-08-04T16:17:25.976904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-04T16:17:25.979843Z","title":"Fine-tuning vision- language-action models: Optimizing speed and success,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.979843Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:4ecd24f8e48dbd29219ef9d35267bb199f3525032f0dcc61949a0f36d0e7e25f","observation_id":"7aed8850-7e70-48a7-b505-55c26c36a5b6","resolution":{"observed_at":"2026-08-04T16:17:25.979843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.982949Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.982949Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:515954885cb68de79004710d108a4c1a166f6d1a55b7928307f6e4326654e883","observation_id":"51eb7b32-0154-4748-8e0b-50e5a879435b","resolution":{"observed_at":"2026-08-04T16:17:25.982949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.985729Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.985729Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:02fb23872161e0a2877ddfadb93881f49583b61c4e641661ec888cb425a79f29","observation_id":"55dab2e1-8209-4049-b286-471901583ab1","resolution":{"observed_at":"2026-08-04T16:17:25.985729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.988385Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.988385Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:39ed26a693a20e7a03e28b16834f22a0dbbae505608abcae845c64f44ceb6c21","observation_id":"8aa62538-c2c7-466a-bfc1-e881bf69e96a","resolution":{"observed_at":"2026-08-04T16:17:25.988385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:25.991114Z","title":"Open x-embodiment: Robotic learning datasets and rt-x mod- els: Open x-embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.991114Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:1ecf47164c4ed8fdd45093b229d1d2d292184f0970e81d2b0b8908941d5e7b12","observation_id":"650aa07b-d05e-43d3-b455-b141774665e1","resolution":{"observed_at":"2026-08-04T16:17:25.991114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-04T23:25:15.750324Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-08-04T16:17:25.993819Z","title":"Knowledge insulating vision-language-action mod- els: Train fast, run fast, generalize better,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.993819Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:99f64a7619d861689087f853fea9717fbac4fbeb749dacdd291f80db42f26966","observation_id":"279dc0ba-c25c-47be-9435-1f5c0f46b60f","resolution":{"observed_at":"2026-08-04T16:17:25.993819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T16:17:25.996881Z","title":"π 0.5: a vision-language-action model with open-world generaliza- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.996881Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:60ff7fe5324989e256ed4527d623c575d21b4f38a9296b233473fe2acea20ba7","observation_id":"317d6c8c-a1f1-45cc-8389-fde0af5ed0f4","resolution":{"observed_at":"2026-08-04T16:17:25.996881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-04T16:17:26.000162Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.000162Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:00f934066d7c484eb8057df2cf9cab397262859d4934491126f9ad0bcb1f534b","observation_id":"93a7a8c4-2f48-4749-8ce0-ac7eb01b1dcd","resolution":{"observed_at":"2026-08-04T16:17:26.000162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-04T16:17:26.003505Z","title":"Cogact: A foun- dational vision-language-action model for synergizing cog- nition and action in robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.003505Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:b5f929f59ffc2b599697b0f4f3a4e44c71a839312c9d314d6d42983e31957b1a","observation_id":"80494ba4-6565-40e0-a562-7a1910025732","resolution":{"observed_at":"2026-08-04T16:17:26.003505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.006639Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.006639Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:1871a4c615f70feeaec07b47e7e10397d18994af14dfe1b788c542b0bf54a189","observation_id":"254ed329-28f6-4c21-b7a5-8bea6d60c05f","resolution":{"observed_at":"2026-08-04T16:17:26.006639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-04T16:17:26.009661Z","title":"Graspvla: a grasping foundation model pre-trained on billion-scale synthetic action data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.009661Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:5c1427353bcbd026922a243b05882dbd293bc6a921296abe1bd10b5460ebf48b","observation_id":"ae435393-ddaa-4990-a5d7-aa609b935ee6","resolution":{"observed_at":"2026-08-04T16:17:26.009661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.013035Z","title":"Ask4help: Learning to leverage an expert for embodied tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.013035Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:0010e995d6ba6e0f96514658801473b577ea69d23873072cffa8adecde358364","observation_id":"3d68ffdc-a951-4c0f-bf19-831c59d0ef87","resolution":{"observed_at":"2026-08-04T16:17:26.013035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.015934Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.015934Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:579b13fa0235c82f361683afd4207622f892a7b19145ab0cd1ed35a2be75096d","observation_id":"bb83ed1c-e11c-4df6-99d3-e4ebebd13499","resolution":{"observed_at":"2026-08-04T16:17:26.015934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.019089Z","title":"Human2robot: Learning robot actions from paired human-robot videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.019089Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:5b5520cb02a5483300ea62c9b87e817f023a5ce3c3ec27fd4273d8423339644c","observation_id":"91ca754f-df7e-46b4-840e-56c395021ff2","resolution":{"observed_at":"2026-08-04T16:17:26.019089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15695","last_updated":"2024-04-16T13:24:59Z","snapshot_observed_at":"2026-07-06T15:33:02.985929Z","submitted_at":"2023-05-25T04:05:08Z","title":"Asking Before Acting: Gather Information in Embodied Decision Making with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15695","snapshot_observed_at":"2026-08-04T16:17:26.022065Z","title":"Asking before acting: Gather information in embodied decision mak- ing with language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.022065Z"},"links":{"cited_paper":"/paper/2305.15695","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:04c95771d40c08d10078de591043b2801ce3cc6730c0cd4399fa00d305d6b553","observation_id":"cbae75cc-c0ac-452d-a2ce-849078d1bcf0","resolution":{"observed_at":"2026-08-04T16:17:26.022065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17555","last_updated":"2023-10-26T16:46:12Z","snapshot_observed_at":"2026-07-06T16:39:04.459332Z","submitted_at":"2023-10-26T16:46:12Z","title":"Interactive Robot Learning from Verbal Correction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17555","snapshot_observed_at":"2026-08-04T16:17:26.025627Z","title":"Interactive robot learning from verbal correction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.025627Z"},"links":{"cited_paper":"/paper/2310.17555","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:00a1b98eb2e9c9b18e4fe1a4f63d4ac137595301cb75b83b7909c497bc965d71","observation_id":"3f4ab3e9-f50e-43d7-a6d6-734c9b0daa9a","resolution":{"observed_at":"2026-08-04T16:17:26.025627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.029157Z","title":"Robots that ask for help: Uncertainty alignment for large language model planners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.029157Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:935854b5913c4138b66baeaaed5206e89f92ab01d9293f7e7ef2d52a719ee56d","observation_id":"61ac8913-312d-43e1-ad34-86292fff7cb6","resolution":{"observed_at":"2026-08-04T16:17:26.029157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.032090Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.032090Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:7b485ca0965971844a5822c385434fd63c4425579bc41acd54cb37e419d17cf3","observation_id":"befbf5f7-e24a-44cc-9b18-41183306cd8b","resolution":{"observed_at":"2026-08-04T16:17:26.032090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T16:17:26.035567Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.035567Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:a301131f34a82bef1586e6604abf9f695cc3f01109e09274cd7ca713350c3587","observation_id":"a5033b54-dea4-4979-aac1-c42a4a113f71","resolution":{"observed_at":"2026-08-04T16:17:26.035567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14411","last_updated":"2024-11-14T11:59:09Z","snapshot_observed_at":"2026-07-06T19:19:24.759288Z","submitted_at":"2024-09-22T12:14:16Z","title":"Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14411","snapshot_observed_at":"2026-08-04T16:17:26.038823Z","title":"Scaling diffusion policy in transformer to 1 billion parameters for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.038823Z"},"links":{"cited_paper":"/paper/2409.14411","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:f489c96fb1753c5bd194335b94bc100bb52197c4c762ab9d1b078c0c9ea8b88e","observation_id":"2a4f2fa6-002e-4a45-b4bd-32d8c217e312","resolution":{"observed_at":"2026-08-04T16:17:26.038823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.042069Z","title":"Film: Visual reasoning with a general condi- tioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.042069Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:033bb28f58d3a87b11e88cabb1d1c91751e536fa8862c24e56e063e0166e8b48","observation_id":"a396e26f-2129-47ca-856f-b95e591e5ccf","resolution":{"observed_at":"2026-08-04T16:17:26.042069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.045167Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.045167Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:f151786de18cdc13aadd655c8baa41efe77b22b9d250fced3fc6aabe54ee33df","observation_id":"01420dde-6d5b-45c7-9b8c-3772dd43505d","resolution":{"observed_at":"2026-08-04T16:17:26.045167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:17:26.048000Z","title":"xarm python sdk,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.048000Z"},"links":{"citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:1fe0a64a1cec60e67d58c87fd74e6025c9d1a70e28da304bf723b2c7011ce37f","observation_id":"2a81ed7e-4434-4b26-9c17-7e2fcac71adf","resolution":{"observed_at":"2026-08-04T16:17:26.048000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T16:17:26.051211Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.051211Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:2da1af0b886804238d3c4b176f42d91848ba3ab4f97db8421fbe041b5485be46","observation_id":"590c2f16-63d2-414e-9243-15192b78afb5","resolution":{"observed_at":"2026-08-04T16:17:26.051211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07870","last_updated":"2024-03-12T17:58:38Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T17:58:38Z","title":"OPEN TEACH: A Versatile Teleoperation System for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07870","snapshot_observed_at":"2026-08-04T16:17:26.054444Z","title":"Open teach: A versatile teleoperation system for robotic manipulation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:26.054444Z"},"links":{"cited_paper":"/paper/2403.07870","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:bd0767be6a9aa080262853ca53fd182b2a8033897ce868558cd499dce56fa49a","observation_id":"27bd111a-a1ad-4a4b-a12a-b1b71767dab5","resolution":{"observed_at":"2026-08-04T16:17:26.054444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 7 inbound Pith citation observations for arXiv:2509.15061."}