{"as_of":"2026-08-18T16:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f2eca7511c2dbb4c5e394b05bec36eb6a50b0c394d03099b292f47a11359c4f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:15:06.119010Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T22:31:13.391859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:32:10.973323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"cited_work":{"arxiv_id":"2504.13351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13351","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain- of-modality: Learning manipulation programs from multimodal human videos with vision-language-models","venue":null,"work_id":"62a7b566-6157-4fe6-97b6-6751ccbc863d","year":2025},"citing_paper":{"arxiv_id":"2511.12878","last_updated":"2026-05-11T01:22:42Z","snapshot_observed_at":"2026-08-10T21:40:24.450522Z","submitted_at":"2025-11-17T02:14:13Z","title":"Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T22:31:13.391859Z"},"links":{"cited_paper":"/paper/2504.13351","citing_paper":"/paper/2511.12878"},"observation_digest":"sha256:23b36a06a04778b070e3dfbb3091fa0b2e05f84679c6538f1fdfa253b2d74ebb","observation_id":"4aaef4b5-f425-411a-b59c-31eadb2ff0d2","resolution":{"observed_at":"2026-05-17T22:32:10.976303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13351/citation-record","integrity":"/paper/2504.13351/integrity","json":"/paper/2504.13351/citation-record.json","paper":"/paper/2504.13351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:15:05.823996Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.823996Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a68438bd3317d59a29dca0234fa0ae94bca92a8cf53f5cb38f55e30f2dfd5e6b","observation_id":"8b5e9176-f274-4bf5-8f78-19c8935e8aaf","resolution":{"observed_at":"2026-08-16T12:15:05.823996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T12:15:05.829473Z","title":"Do as i can, not as i say: Ground- ing language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.829473Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d80f5cdf5b4a971dc965784e81a2961c8b146bc9b9c5d4275e659bbc0fe2d93f","observation_id":"953d85a8-f64c-4f59-9276-8907087ead28","resolution":{"observed_at":"2026-08-16T12:15:05.829473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09450","last_updated":"2022-07-19T17:59:59Z","snapshot_observed_at":"2026-08-16T16:44:46.627613Z","submitted_at":"2022-07-19T17:59:59Z","title":"Human-to-Robot Imitation in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09450","snapshot_observed_at":"2026-08-16T12:15:05.834129Z","title":"Human-to-robot imitation in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.834129Z"},"links":{"cited_paper":"/paper/2207.09450","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7e13a98750db4806daf3c606ce0547e2fabbfb65e0e03886e67fdb14a6783faa","observation_id":"1b7c2986-8ea6-40be-ac2a-4df0580fb00d","resolution":{"observed_at":"2026-08-16T12:15:05.834129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:05.838737Z","title":"Affordances from human videos as a versatile representation for robotics,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.838737Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e5712d665268e1879931fd3df02ed5a66c68fdf81ce88d19dd39f7fba0271397","observation_id":"c24c9671-cfc9-4b7a-a0f7-8eda2e820442","resolution":{"observed_at":"2026-08-16T12:15:05.838737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.047116Z","title":"Towards generalizable zero-shot manipulation via translating human interaction plans,","venue":null,"work_id":"0e0f0717-c852-4c6f-93f5-b9894bb083a6","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.843956Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ecafff052b27569e609d288372c1a300418aab9d1b11142e0e1cfa11e9ea5b0d","observation_id":"6566c015-5722-4ca1-9442-d503edf5b012","resolution":{"observed_at":"2026-08-16T12:15:07.051450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.033158Z","title":"Activitynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":"a6b63201-3dc5-473f-b1c8-e00fc93a3201","year":2015},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.849102Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:40f2dc27ac23b008cd6c59142edd0f8afeac2aa3a01f948ee616130b6980aa9d","observation_id":"f66ebc5d-31b3-4d1c-ba56-abeb9bd5b526","resolution":{"observed_at":"2026-08-16T12:15:07.037710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.019220Z","title":"Procedure planning in instructional videos,","venue":null,"work_id":"d7e7c92a-9e16-44d4-b50e-ed54eb527d4c","year":2020},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.854359Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:0aff677114eb14e2d83347d8dd417ee1fb14e1e9e6c18941be847732a8b8c9be","observation_id":"a6de1d3a-4ac8-4cc1-a888-30e335918dbc","resolution":{"observed_at":"2026-08-16T12:15:07.023693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.006048Z","title":"Learning generalizable robotic reward functions from","venue":null,"work_id":"e96f9629-0b06-4d1e-b060-00ec617d1e97","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.858352Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:f6c6c1cd4d61c9413a805a3fb3f31ca3ac03f69b3f002a2d81bec1ec6aa6e8af","observation_id":"d1a7a79a-8866-4e3c-bfaf-b82b29ebe58d","resolution":{"observed_at":"2026-08-16T12:15:07.010164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.991589Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":"2ec9443f-d0d7-40c5-aade-b71718121842","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.862463Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:395efeccb5af45ff4b941499d7b1a7d73a63763c2724f54d4df8db351cbcf141","observation_id":"1ec69fac-60e0-488d-806f-08500ddda4d0","resolution":{"observed_at":"2026-08-16T12:15:06.996361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-08-16T13:35:23.650773Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-16T12:15:05.866636Z","title":"Mobility vla: Multimodal instruc- tion navigation with long-context vlms and topological graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.866636Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:f0ab679a19d1c27138d6cc131259de7cf6a6fd0aee4992db7f44eb50af251557","observation_id":"8e045913-0882-4d8d-a633-ff8ff2c3ea22","resolution":{"observed_at":"2026-08-16T12:15:05.866636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.977092Z","title":"Can foundation models perform zero-shot task specification for robot manipulation?","venue":null,"work_id":"c6b85b98-fc57-45ce-92e8-34f776d3a511","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.871228Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:65f7605cf5c267e2c7e8ed5b1da577f0f9db1c439a73c12a1203ea7e0462036f","observation_id":"562bd8c0-423d-4c76-af4c-4b8d28ab45b8","resolution":{"observed_at":"2026-08-16T12:15:06.981665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.962990Z","title":"Scaling egocentric vision: The epic- kitchens dataset,","venue":null,"work_id":"5b00941b-e441-4c02-9cd8-0d73aa068ed7","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.875734Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b041ebe2a56225449435b2179bfd427f83c645558fffbd925d648d5603da3eaa","observation_id":"51339741-d041-4973-b24c-15288bb4f70f","resolution":{"observed_at":"2026-08-16T12:15:06.967585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.949937Z","title":"Model-based inverse reinforcement learning from visual demonstrations,","venue":null,"work_id":"56e55c55-7e77-49d5-b68a-a874fc79eabe","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.880003Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:aeb74f7451bbf6f0a5380a2734f6ee5259535077ab8a4d1bb3fa594d8cfdbf54","observation_id":"1b415199-27db-4206-a35b-1a90ea1d0228","resolution":{"observed_at":"2026-08-16T12:15:06.954253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07861","last_updated":"2019-05-20T03:59:44Z","snapshot_observed_at":"2026-08-14T16:29:57.064301Z","submitted_at":"2019-05-20T03:59:44Z","title":"Perceptual Values from Observation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07861","snapshot_observed_at":"2026-08-16T12:15:05.884007Z","title":"Perceptual values from observation,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.884007Z"},"links":{"cited_paper":"/paper/1905.07861","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9ce7e80a5d9f80a7d542adb34d18d95d5de3b8bc75fa2cb446b80c2ef8f1581c","observation_id":"07a1c60b-2f91-4c1c-b40c-78ee1eb6c582","resolution":{"observed_at":"2026-08-16T12:15:05.884007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07843","last_updated":"2023-12-13T02:20:42Z","snapshot_observed_at":"2026-08-16T14:35:16.708985Z","submitted_at":"2023-12-13T02:20:42Z","title":"Foundation Models in Robotics: Applications, Challenges, and the Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07843","snapshot_observed_at":"2026-08-16T12:15:05.888688Z","title":"Foundation models in robotics: Applications, challenges, and the future,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.888688Z"},"links":{"cited_paper":"/paper/2312.07843","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7619f415023ac2bd30f3fbd1693c5ab35d7ccdb0eb1a78126009beea2be78b63","observation_id":"2363f667-350e-4d73-98b8-e7f87053b07d","resolution":{"observed_at":"2026-08-16T12:15:05.888688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.936840Z","title":"The” something something","venue":null,"work_id":"3c07d822-7541-4cd9-96cf-fd5c87c57f45","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.893962Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:12c9ed31cadcf854be672279fa9d0db9e02506e42919a28b9a939eea65cd1e8e","observation_id":"73711770-4d0f-494a-ad7c-18cacc6d290a","resolution":{"observed_at":"2026-08-16T12:15:06.940935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.923711Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"79ef5645-311a-4268-9bda-cd2875e0a414","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.898804Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:8c836e03ca7104019259552ad5a08de986b836cbb9e69e58c4eb09f9ffc14889","observation_id":"aba618a8-bbf5-45a9-a975-2baf93792f60","resolution":{"observed_at":"2026-08-16T12:15:06.928077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:05.903048Z","title":"Gu et al., Rt-trajectory: Robotic task generalization via hindsight trajectory sketches , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.903048Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1f1e527d332e6dee37cb8a235346cb192938af7bc4fa5c3fc287538d01515504","observation_id":"332cdff3-e8e4-46a1-a16e-80336f017610","resolution":{"observed_at":"2026-08-16T12:15:05.903048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-08-17T22:45:34.417683Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-16T12:15:05.907167Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.907167Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:4954616723150749039b64186514e45a3422d31b7297772da914df92872de2ca","observation_id":"9df6f5cb-68e4-4f18-ae1b-b25a61b06d3e","resolution":{"observed_at":"2026-08-16T12:15:05.907167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.901725Z","title":"Neural task graphs: Generalizing to unseen tasks from a single video demonstration,","venue":null,"work_id":"62bf0e4b-91da-4557-a5a1-3c7f3ec94889","year":2019},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.911401Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:c12f2a7c65c285ff33aeafb8cc5101c72e0b414488d9d510f40d4763a709e97a","observation_id":"153673ef-0b34-408b-aea2-b7b00219c727","resolution":{"observed_at":"2026-08-16T12:15:06.906112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.888586Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":"61a20113-ad20-4d2e-80d5-d3924514b275","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.915400Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:0becbb89a54446f41e34b7f124c751f8c58496d8a3fc2b9fb4e2c6435924fbad","observation_id":"4e09e530-64a9-4abf-bffc-429cbe81a950","resolution":{"observed_at":"2026-08-16T12:15:06.893030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-16T12:15:05.920527Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.920527Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:acb86cf3f8739ba491ccc747a6c0e9d38601682504df9bbffdec52ff49dac3ab","observation_id":"ad73f741-e752-4740-8e4b-86eedd14fd18","resolution":{"observed_at":"2026-08-16T12:15:05.920527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-16T12:15:05.924813Z","title":"Inner monologue: Embodied reasoning through planning with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.924813Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:bf7fdc029178465f769defd187d508873671665f8d56321f5719d3114c5658e5","observation_id":"626817ea-66c6-4e8f-bc38-27a963ee36c8","resolution":{"observed_at":"2026-08-16T12:15:05.924813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-08-17T12:54:40.193734Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-16T12:15:05.929096Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.929096Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a800fb5de13f1fbe1ece69beff6abc58247dca4a6c3bf7759dc1dd88049de8f0","observation_id":"dea3d730-a29c-4b51-b11c-129b69886541","resolution":{"observed_at":"2026-08-16T12:15:05.929096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.874833Z","title":"Prompting visual-language models for efficient video understanding,","venue":null,"work_id":"56bc0113-1027-4313-a524-e3ebbc96a590","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.933595Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:de69b57677c55f619b4d291314904d7cec66e836e8e4af155b7a3b0b5824b611","observation_id":"ec8b220b-43bd-46c8-8859-31c04e85b903","resolution":{"observed_at":"2026-08-16T12:15:06.879575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.861772Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":"e4640208-9fc2-4266-9f6a-00b9328dd3cf","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.937756Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:078e1d6c0c2f4aa149b2e9d1e0481edba913189106dec60e2174a7f1b308b2b5","observation_id":"0f4db8b3-28f7-406b-9960-8089c67be071","resolution":{"observed_at":"2026-08-16T12:15:06.865923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.849028Z","title":"Anticipating human activities using object affordances for reactive robotic response,","venue":null,"work_id":"5cef0864-72ac-4593-9701-6b22bddf74a7","year":2015},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.941701Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7e64790eebf03e98139fd159eea61b9ac9cb5d4daeef8de297f581866e7c4cde","observation_id":"7ffb5d53-ac82-452c-b8ac-cc0832839844","resolution":{"observed_at":"2026-08-16T12:15:06.853103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.835577Z","title":"Graph inverse reinforcement learning from diverse videos,","venue":null,"work_id":"0127b4c5-ea58-42e4-afea-be63ff2c842d","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.945640Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:f79609377fc9bc776951e9c627b81c3cefeb419718024d122e427bfda9f649eb","observation_id":"edf41b8e-010d-427b-9192-4445b94ad7da","resolution":{"observed_at":"2026-08-16T12:15:06.840008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06539","last_updated":"2019-08-06T12:47:41Z","snapshot_observed_at":"2026-08-14T16:47:05.128810Z","submitted_at":"2019-04-13T12:56:17Z","title":"HAKE: Human Activity Knowledge Engine","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06539","snapshot_observed_at":"2026-08-16T12:15:05.949799Z","title":"Hake: Human activity knowledge engine,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.949799Z"},"links":{"cited_paper":"/paper/1904.06539","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b899287921accdf910cd9d494f7587557f79712308569009817c7af440e14125","observation_id":"524e4606-1f1d-494e-a216-e69ba2bf4290","resolution":{"observed_at":"2026-08-16T12:15:05.949799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.822330Z","title":"Code as policies: Language model programs for embodied control,","venue":null,"work_id":"c0ea16b6-9ad0-40eb-9065-441dcd0e09d0","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.954444Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:eddfb28b986e1f71938cf14223ec2f0b3469120b18e881738ef33f4d0fd18d73","observation_id":"43e694a3-e04c-4a4c-9f6f-834dba6310ba","resolution":{"observed_at":"2026-08-16T12:15:06.826654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11450","last_updated":"2024-05-31T17:25:38Z","snapshot_observed_at":"2026-08-18T13:52:29.623134Z","submitted_at":"2024-02-18T04:16:24Z","title":"Learning to Learn Faster from Human Feedback with Language Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11450","snapshot_observed_at":"2026-08-16T12:15:05.958643Z","title":"Learning to learn faster from human feedback with language model predictive control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.958643Z"},"links":{"cited_paper":"/paper/2402.11450","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:c60fb0a98c3be2d7da632db0229b90759179e136b6166c08abac6a11cef2520b","observation_id":"ddfeea2d-bcaf-4cdb-8549-2177c55fee32","resolution":{"observed_at":"2026-08-16T12:15:05.958643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.809041Z","title":"Text2motion: From natural language instructions to feasible plans,","venue":null,"work_id":"bc5fd075-2ef3-4720-b6c4-752b9e6417af","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.963232Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:48d44bcda32f4ceb010b2f7f7bf28c55204c0d6ce742015760a0874ba88aa748","observation_id":"029c77d3-91c1-44d6-a7fb-7be115bd0f9d","resolution":{"observed_at":"2026-08-16T12:15:06.813390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-16T12:15:05.967780Z","title":"Llm+ p: Empowering large language mod- els with optimal planning proficiency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.967780Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d5b602862ee2189a0b2abc00acb1e366243b18daa7dcf29aafef63dd1b2dacdf","observation_id":"8334d377-0654-4f39-8059-f769e0eaf7d6","resolution":{"observed_at":"2026-08-16T12:15:05.967780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.795110Z","title":"Imitation from observation: Learning to imitate behaviors from raw video via context translation,","venue":null,"work_id":"ee1a9ecd-94e7-44d6-96c2-59a2fa1b3c13","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.972747Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:c774041552cd933e12a9c918313e63cabd5fd44500bb0dce906be431ba169cae","observation_id":"af4a4e74-bada-4530-8546-c78ec375f196","resolution":{"observed_at":"2026-08-16T12:15:06.799915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-16T12:15:05.977805Z","title":"Vip: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.977805Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:3bd58acb19427d5e662834cc648a20566f53aea4eb97c64980dab87a4f86d5a1","observation_id":"62ae18b9-ac15-436c-b5d5-dc9e7809140d","resolution":{"observed_at":"2026-08-16T12:15:05.977805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-16T12:15:05.982335Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.982335Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e1ab4d3afe705be2305bb4d021eff438f68491f3b1d96a94dda480f669eb7f21","observation_id":"ca246feb-1907-4498-abb9-91b4e55c323f","resolution":{"observed_at":"2026-08-16T12:15:05.982335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-08-16T13:33:18.623066Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-08-16T12:15:05.986843Z","title":"R+ x: Retrieval and execution from everyday human videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.986843Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:25af2022c70131d576685d5f813ea4adfa2ec8c506c047056664b7c1c6f7351d","observation_id":"8012cf00-5557-49e5-a3d7-f5eac04cd3be","resolution":{"observed_at":"2026-08-16T12:15:05.986843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.781559Z","title":"Reconstructing hands in 3D with transformers,","venue":null,"work_id":"53ce532e-5da4-4d69-a29f-5fe4aa1693d3","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.991085Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1128c0c1056466845ec9ed408093ffa112a99b8b1b142e533508d9643b7d8dcd","observation_id":"ecf863bd-b2cf-4e7f-92a8-d099dd57f61f","resolution":{"observed_at":"2026-08-16T12:15:06.785927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.766591Z","title":"Planning with large language models via corrective re-prompting,","venue":null,"work_id":"b2ac44ce-3ecc-4d40-bb81-da19930b4977","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.995264Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:0e59dc60f56b87a89f82b33c08fa6a5e771de5c98078059d1c407f0846dc6ff3","observation_id":"3d0306c3-cfbf-44a0-ad5e-08931ec73954","resolution":{"observed_at":"2026-08-16T12:15:06.772228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T12:15:05.999412Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.999412Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b23a2cf2b56cbbb98e6c0651ed2ddad770a9d7e6b756b43eb0dd0efd5d5a30c0","observation_id":"ce308fe6-2918-458c-a391-e35be8176faa","resolution":{"observed_at":"2026-08-16T12:15:05.999412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.752405Z","title":"First-person activity forecasting with online inverse reinforcement learning,","venue":null,"work_id":"a4603f41-bbb4-439e-b861-5195bc4268e4","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.003775Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:82b8d1e0665556b82a640c12cc6c042eaf26783d0055260dde4bcf3a6cac742c","observation_id":"494da36c-0ae1-49eb-b631-6315d0951129","resolution":{"observed_at":"2026-08-16T12:15:06.756810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06507","last_updated":"2021-11-04T20:07:57Z","snapshot_observed_at":"2026-08-16T19:06:16.231226Z","submitted_at":"2020-11-12T17:15:48Z","title":"Reinforcement Learning with Videos: Combining Offline Observations with Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06507","snapshot_observed_at":"2026-08-16T12:15:06.008300Z","title":"Reinforcement learning with videos: Combining offline observations with interaction,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.008300Z"},"links":{"cited_paper":"/paper/2011.06507","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:334b28049b540a54ed903e48001439a026601fc0f51f65d570f825769641aac0","observation_id":"35af371c-7f12-42ac-9df6-63f1efbfe7c0","resolution":{"observed_at":"2026-08-16T12:15:06.008300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.738947Z","title":"Learning predictive models from observation and interaction,","venue":null,"work_id":"9780243e-7c77-423a-99ac-564611529861","year":2020},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.012623Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a23a345ea394bcbd4026fc561d8d8b542577f561b112c7b847bef64fb3d8b796","observation_id":"c017f492-57b7-4e75-bb03-e249e5bd876e","resolution":{"observed_at":"2026-08-16T12:15:06.743315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.725171Z","title":"Time-contrastive networks: Self- supervised learning from video,","venue":null,"work_id":"81ea5786-04b2-4518-8dd1-f4eb61974116","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.016846Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e31d34713892bedd6f56efa902ec1636ba94aa48e85c27c9aa547dd2fb8d5d9d","observation_id":"fbfba823-2a36-4ea3-a700-7213cf749988","resolution":{"observed_at":"2026-08-16T12:15:06.729483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.06699","last_updated":"2017-06-12T21:38:17Z","snapshot_observed_at":"2026-08-18T13:55:02.587631Z","submitted_at":"2016-12-20T15:04:38Z","title":"Unsupervised Perceptual Rewards for Imitation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.06699","snapshot_observed_at":"2026-08-16T12:15:06.020797Z","title":"Unsupervised perceptual rewards for imitation learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.020797Z"},"links":{"cited_paper":"/paper/1612.06699","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1d654904dd3dafda53b534821a64e2aa0e86a168b9e42a41390cab50e935535f","observation_id":"5936cc87-13c4-47de-8a41-75dc2ba438d8","resolution":{"observed_at":"2026-08-16T12:15:06.020797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.711686Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":"8b41850a-82fc-4693-826d-861ebbee6411","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.025092Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9ec2e392692f0d2ff08bab8d6b25d649a3e7093635879c7234138288c778fbd1","observation_id":"5d5cca8d-92fe-425d-bbe4-94d46b2f6314","resolution":{"observed_at":"2026-08-16T12:15:06.716265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.697704Z","title":"Concept2robot: Learning manipulation concepts from instructions and human demonstrations,","venue":null,"work_id":"0520a3e0-f339-477f-bfad-7e9177f56863","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.029196Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9a2e469e4fb43579eab7072c38554c54fe88cd5781c9bb4e5b08dda74de350d3","observation_id":"53ea4167-f4bc-4391-9a69-c5eb279eaa1c","resolution":{"observed_at":"2026-08-16T12:15:06.702427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.033284Z","title":"Third-person visual imitation learning via decoupled hierarchical controller,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.033284Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:fcdac4959d841b218969b2ca722bfc977cd0af3af8254cbc0ac4da3740e42b37","observation_id":"64ac1d08-59bd-40d4-ae6d-1577697185fd","resolution":{"observed_at":"2026-08-16T12:15:06.033284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.675168Z","title":"Videodex: Learning dexterity from internet videos,","venue":null,"work_id":"72ab88e8-85db-4f72-9086-2128b38f0cfb","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.037238Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:32e3b88a9f20731e9d59787471c26ff21b0e716361a8c717ca01961643d4d01d","observation_id":"7fdefc1e-e9de-46d6-b321-ccb76c1d509b","resolution":{"observed_at":"2026-08-16T12:15:06.679337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.661124Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":"9dbe9058-16bc-44ff-9d23-24471e4f9f0c","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.041470Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d27ddcc380eb921f1d51efd5e9fac83b670b37c74b4a7e213b33b995dc44d2db","observation_id":"9cbb0e9d-2e59-4dce-b269-e94561a12242","resolution":{"observed_at":"2026-08-16T12:15:06.666143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.647668Z","title":"Generalized planning in pddl domains with pretrained large language models,","venue":null,"work_id":"8607bfc5-e7e2-4266-9167-09dbbb3cce2d","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.045413Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9257566a72ee4e38c549f5badb981f127639abdbeeb3cfafb5c4584c5c091f5e","observation_id":"b100e8b7-b69d-47f4-8f2b-9c497e515b8d","resolution":{"observed_at":"2026-08-16T12:15:06.652030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.634019Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":"4c914fcd-057a-402e-b1a6-fabc1f61accf","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.049345Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:4cde031decedd9553d15ffab3460618e57f8f5e3d5aa0b7b8f8ba3ba36d8a7e4","observation_id":"c8ce1d2a-f309-4ba7-9fbe-079e8c5f9771","resolution":{"observed_at":"2026-08-16T12:15:06.638380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-07-06T08:43:17.319793Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-08-16T12:15:06.053396Z","title":"Avid: Learning multi-stage tasks via pixel- level translation of human videos,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.053396Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:c61d9b4db59ea95930bf178c7a27d6c661012cc39bb09ed132c1a7c1388640ee","observation_id":"5e08acf3-1ab6-4dbe-b8fb-d79b87d0f243","resolution":{"observed_at":"2026-08-16T12:15:06.053396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.619162Z","title":"Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches,","venue":null,"work_id":"e3d0ed54-202d-49e2-b496-7d2bb1686458","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.058134Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:14cfed533b1c408e9d6f670aa8ec8a64019664dd9c92d404ae8f463486ea4499","observation_id":"bae1268d-aecf-4e21-afd8-befc75498813","resolution":{"observed_at":"2026-08-16T12:15:06.624307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-16T15:53:03.955730Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-16T12:15:06.062178Z","title":"Mimicplay: Long-horizon imitation learning by watching human play,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.062178Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:3974271faa9b741aeb43af482a66e48b3c5f40a3fdedc7ef0bdc7de9ac3ca557","observation_id":"70c2604c-d6d6-4a9b-820f-01e4eaac77c2","resolution":{"observed_at":"2026-08-16T12:15:06.062178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.604595Z","title":"Temporal segment networks for action recognition in videos,","venue":null,"work_id":"9a5584e6-0d56-499b-84e0-84b9abd1ea44","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.066608Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6c48dfc4a105ad0932beacb10250fe4f342d1c89fce0de0a91943d523e9fb579","observation_id":"e029ff48-0892-4c15-ae94-e09bb9b4a6a5","resolution":{"observed_at":"2026-08-16T12:15:06.609454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-16T12:15:06.070735Z","title":"Describe, explain, plan and select: Interactive planning with large language models enables open-world multi- task agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.070735Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:fe166ed9fa598cff0f773e6dc3e5bd26dbe9ad57ee3a845a16081d5e0da22254","observation_id":"ccfc0c3a-e781-4fc8-b1e8-42124a900da9","resolution":{"observed_at":"2026-08-16T12:15:06.070735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12716","last_updated":"2022-05-06T14:46:46Z","snapshot_observed_at":"2026-08-16T17:24:57.800595Z","submitted_at":"2022-01-30T03:59:14Z","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12716","snapshot_observed_at":"2026-08-16T12:15:06.075484Z","title":"You only demonstrate once: Category-level manipulation from single visual demonstration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.075484Z"},"links":{"cited_paper":"/paper/2201.12716","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7749bc0d06b14eebc5c8308a49f2d89d4c1ddd687e24c2b8f8badbfcf3aac16d","observation_id":"9bad7664-3736-4466-96e9-284f630f4666","resolution":{"observed_at":"2026-08-16T12:15:06.075484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-16T12:15:06.080003Z","title":"Wen et al., Any-point trajectory modeling for policy learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.080003Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:56a4e5d3d40859bd75e2fb7b91d496efe54d9160fc9144abe0ef27f31a1b6d97","observation_id":"5a8437c9-a347-4a60-bd11-f753709bfdbd","resolution":{"observed_at":"2026-08-16T12:15:06.080003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.590202Z","title":"Learning by watching: Physical imitation of manipulation skills from human videos,","venue":null,"work_id":"40a8b337-5968-4520-9331-457da1a8d8ad","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.084224Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:68e03c1eb0cccd89113cfc9be6575c4557c1db3271a0b65e57f86282d6f4c5fa","observation_id":"0fc53998-4711-45aa-89a6-21b936be4c15","resolution":{"observed_at":"2026-08-16T12:15:06.594823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.575567Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection,","venue":null,"work_id":"462282f7-78ae-400b-83f3-09a9174fe683","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.088928Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:767f1d69fc873ac886df03ea0f0d2aff0c17bda24277e591a8af74e8e59e5693","observation_id":"c7e02b1c-fd93-45ed-83c9-62b7ff4b66f5","resolution":{"observed_at":"2026-08-16T12:15:06.580137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.561600Z","title":"Xskill: Cross embodiment skill discovery,","venue":null,"work_id":"64638deb-80b8-49f9-9f55-adcb9d469f35","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.092975Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:330ed9f70248b88fadfd5aa367457aceff179df7a01ea2e1ec695119137119f8","observation_id":"543b7814-6507-4f88-a2f9-a6cb528eb278","resolution":{"observed_at":"2026-08-16T12:15:06.566205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-16T12:15:06.097274Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.097274Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ea98e1ecc40f9245f1b195aece50d2b76e8bf2377c2a69b6e5ab6ec252073a60","observation_id":"b81a5940-fb40-436a-aafb-63f13630f2c4","resolution":{"observed_at":"2026-08-16T12:15:06.097274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-17T22:16:17.971851Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-16T12:15:06.101518Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.101518Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:511313672a787648f8897ba301e07a3a995071b3e68ec931c4f292a9f700793b","observation_id":"f5a88b61-30fd-43b7-85df-92a144c2dde7","resolution":{"observed_at":"2026-08-16T12:15:06.101518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.547592Z","title":"Xirl: Cross-embodiment inverse rein- forcement learning,","venue":null,"work_id":"c18997d0-49fe-4703-9eaa-b39d06ceeb98","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.105941Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:eb0caf091860568dd3919eadf502ac7cc89449640ae1860f0b9851715929728b","observation_id":"b4d1615e-b21a-4e42-8b67-7f36d58670b9","resolution":{"observed_at":"2026-08-16T12:15:06.551893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-16T12:15:06.110419Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.110419Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:93d2ed11eb422bc752f53bdd3a9a67d99217546d935fbb963e3c7eb3e6c8fa67","observation_id":"8f7de078-182a-49d8-938e-d4883ebcce9f","resolution":{"observed_at":"2026-08-16T12:15:06.110419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.532121Z","title":"Actionformer: Localizing moments of actions with transformers,","venue":null,"work_id":"b1f7f06a-ba32-4b75-b88b-696a96741e03","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.114777Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:fe3a3832f29e2a2bce9a1cae2c046e1991cf7e4978f8793903cfb0aa1a440903","observation_id":"dda92637-4a19-45f2-bcf8-3250d59a31c1","resolution":{"observed_at":"2026-08-16T12:15:06.538148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20321","last_updated":"2025-09-04T08:23:37Z","snapshot_observed_at":"2026-08-16T13:47:38.229864Z","submitted_at":"2024-05-30T17:56:54Z","title":"Vision-based Manipulation from Single Human Video with Open-World Object Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20321","snapshot_observed_at":"2026-08-16T12:15:06.119010Z","title":"Vision-based manipulation from single human video with open-world object graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.119010Z"},"links":{"cited_paper":"/paper/2405.20321","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:713640fe802e11045877d4fadfaa9108dd67131177320ae0f21963d14df16609","observation_id":"530ccaf9-7f76-4434-9786-94972fb0ade5","resolution":{"observed_at":"2026-08-16T12:15:06.119010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T12:24:38.550451Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2504.13351."}