{"as_of":"2026-08-11T13:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c61e89cbfdd92fbdd533adbefb952b95cf0429dd3c92c9f1ce0e0b9c79967d9","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:41.618867Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:18:04.994485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T04:27:36.264850Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:cceb04e564a58f3c447fd73475d6d21dd30504a55c35bbd14b8e5211f39192a5","observation_id":"35f452a7-6957-459a-b4e1-943cec727dd7","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T18:44:36.636455Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2512.13030"},"observation_digest":"sha256:8846e1bcd8c532df3fd24bb90b5fa466b739605753b1dcf179a16f089f9b07e2","observation_id":"19f51061-b3a8-4216-a741-c974fe8f40c4","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2601.23087","last_updated":"2026-07-03T15:15:42Z","snapshot_observed_at":"2026-08-03T06:18:02.015773Z","submitted_at":"2026-01-30T15:36:43Z","title":"CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T09:21:33.493584Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2601.23087"},"observation_digest":"sha256:ccfdc04a3be2793c274a98b9c7486e9f8e239dea3e66c6e6f5ca379027983c1b","observation_id":"a427a797-0c2d-43fc-9781-c1a7049a7834","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2601.23087","last_updated":"2026-07-03T15:15:42Z","snapshot_observed_at":"2026-08-03T06:18:02.015773Z","submitted_at":"2026-01-30T15:36:43Z","title":"CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T14:39:16.033010Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2601.23087"},"observation_digest":"sha256:103685174d723307724b5ecfbcd6dca4003608d4b1eccb9298b9dc2f455abea5","observation_id":"549380b7-d68b-4b0a-8839-732c98d4436f","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-08-03T06:18:04.994485Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.23087","last_updated":"2026-07-03T15:15:42Z","snapshot_observed_at":"2026-08-03T06:18:02.015773Z","submitted_at":"2026-01-30T15:36:43Z","title":"CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:18:04.994485Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2601.23087"},"observation_digest":"sha256:41cdb1cd96212a64104c420cd8e1e08f4df1948e80b545a88508d51be0d47c0f","observation_id":"43183e4e-38a8-4b78-a3d5-e206e4bcabf8","resolution":{"observed_at":"2026-08-03T06:18:04.994485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:8ff4f6eca40d7d986526bb13bea78106f4d63a6aed7ebd22b94455533f6092f0","observation_id":"92e70c91-9fd9-4a23-ac3a-a09ce17febd5","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2604.01907","last_updated":"2026-04-24T08:02:33Z","snapshot_observed_at":"2026-08-11T12:37:58.076998Z","submitted_at":"2026-04-02T11:26:44Z","title":"Lifting Unlabeled Internet-level Data for 3D Scene Understanding","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:57.890955Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2604.01907"},"observation_digest":"sha256:dbd9e0616e7d9e7bf4fb414a126daf02710c0a7fd8d0cddbab4fd4c16d4c53ff","observation_id":"874a24f2-2312-4959-8be8-c15ee3bce7a9","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-06T16:33:11.467195Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:f330f40760e18e157aaa6d801f6bb93144ce84de3abebddaa475197cc51a3776","observation_id":"7d4a54cc-9250-4d06-aab5-4d96e1867809","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:666b5a53faf0a7a46424feaa5a2f8390ae2fcebb3bdb227c6234d8cb9a99116d","observation_id":"cce587a7-4eac-42e9-8db9-96e6f3b4f7d9","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:da03bfd428805bea1013640aa5d3ea0cc7fa573f7e59f1dbeed983abc74a3728","observation_id":"93a0adec-ef9d-4b4c-b466-8e81a66d6128","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T17:48:06.734816Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2605.13403"},"observation_digest":"sha256:b6fef6dcbfb77a837818bf207e0697f2c5f09ad4845d5478f1a2e4154effe116","observation_id":"c073d9dd-2b6b-4df9-ac19-c5d2dfab073f","resolution":{"observed_at":"2026-06-19T17:11:51.716122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2605.29577","last_updated":"2026-05-28T08:22:49Z","snapshot_observed_at":"2026-08-03T20:05:45.014502Z","submitted_at":"2026-05-28T08:22:49Z","title":"Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T08:28:37.970450Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2605.29577"},"observation_digest":"sha256:44e86e59e86171f97847b07f0d7b25f15971672ddda2f419eb8bcf1386f1bafb","observation_id":"e664ebbc-fe12-4a04-9f07-670aef69ff51","resolution":{"observed_at":"2026-06-29T08:33:15.413551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2606.04130","last_updated":"2026-06-02T18:40:24Z","snapshot_observed_at":"2026-07-06T23:44:19.059079Z","submitted_at":"2026-06-02T18:40:24Z","title":"CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T09:55:00.402411Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2606.04130"},"observation_digest":"sha256:496241747064fb1d5ecaae180ff87c6f36b52790c19d2e9c5823ba74bf1d2633","observation_id":"25fdcd7d-18ab-453b-b234-cf988e341c1f","resolution":{"observed_at":"2026-07-02T03:36:29.609806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":"2505.17006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-03T04:27:36.264850Z","title":"Como: Learning continuous latent motion from internet videos for scalable robot learning","venue":"cs.CV","work_id":"ce06a6eb-701b-4a70-8afc-d576fd9f8fa1","year":2025},"citing_paper":{"arxiv_id":"2606.10517","last_updated":"2026-06-09T07:49:49Z","snapshot_observed_at":"2026-08-09T14:49:21.427975Z","submitted_at":"2026-06-09T07:49:49Z","title":"LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T13:58:21.461547Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2606.10517"},"observation_digest":"sha256:6080b557f6328752be355d0a2d53a908ad7edd96ef7e47bcee5684e796bd006b","observation_id":"8eeb06f6-8fdf-4ad8-b092-c9302b77841a","resolution":{"observed_at":"2026-07-03T04:27:36.266068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-31T09:42:45.914747Z","title":"CoMo: Learning continuous latent motion from in- ternet videos for scalable robot learning.arXiv preprint arXiv:2505.17006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-03T00:11:26.171786Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.914747Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:298d41c1731f4d01029f4e255eacba005bc19410d848e0e299050e387a7a24c3","observation_id":"8baa9522-1109-4440-8095-57ac4bc1d5e1","resolution":{"observed_at":"2026-07-31T09:42:45.914747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17006/citation-record","integrity":"/paper/2505.17006/integrity","json":"/paper/2505.17006/citation-record.json","paper":"/paper/2505.17006"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:56:31.783573Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:31.783573Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:7db33b593e3e7b8a879c5ce77ea1decc227a1bf9e58132a79b6838006f0f7542","observation_id":"22386f00-d9c6-4ada-a704-6328c1c6624a","resolution":{"observed_at":"2026-08-07T14:56:31.783573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:31.830695Z","title":"Learning dexterous in-hand manipulation.The Inter- national Journal of Robotics Research, 39(1):3–20, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:31.830695Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:a3455e6a70f5370372768b4c90dd3ac27b08cbc8c826d1586f4a85faf477b30f","observation_id":"99f1f8fa-9ed1-4a25-945d-2f7e359b8c0b","resolution":{"observed_at":"2026-08-07T14:56:31.830695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:31.950338Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:31.950338Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:e65c934a138e7ddbad44f0cbdf85f9e424076d35eaed82f251c7c7c4c8db7ff6","observation_id":"76ea3cf0-984a-4faa-b96e-7d13b059ff97","resolution":{"observed_at":"2026-08-07T14:56:31.950338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T14:56:32.082618Z","title":"Gen2act: Hu- man video generation in novel scenarios enables generaliz- able robot manipulation.arXiv preprint arXiv:2409.16283,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.082618Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:92e590b4b920dec9f3c3a83d2570b9163565552b9a6c8620f7bbe2a576ab8070","observation_id":"1d7c1656-b81d-498e-b6b0-42b23703f075","resolution":{"observed_at":"2026-08-07T14:56:32.082618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:32.233704Z","title":"Towards generalizable zero-shot manip- ulation via translating human interaction plans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.233704Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:8e21cb683363cb41133b1df6ffdaceee50ed3dccff2c1e4830ae8d1c6b6fc1b3","observation_id":"386ece9e-0e21-4a07-9c8e-8e0413f31b48","resolution":{"observed_at":"2026-08-07T14:56:32.233704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:32.384855Z","title":"Track2act: Predicting point tracks from internet videos enables diverse zero-shot robot manip- ulation.arXiv e-prints, pages arXiv–2405, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.384855Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:136bd68d782b7de777c3cea1b8d42f3d8438d635f1eca3d9a090ee1f7335037f","observation_id":"d3afaf54-fca5-4125-8d64-718bae8d046c","resolution":{"observed_at":"2026-08-07T14:56:32.384855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T14:56:32.499878Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.499878Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:ec76788e9b55a533d17e8e23ddb4c94855b456fc06108f897fbd23ab48724e8a","observation_id":"8f4c2a1b-f6b6-4ac7-94f4-5a4b5aee3c0d","resolution":{"observed_at":"2026-08-07T14:56:32.499878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:32.607048Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.607048Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:8891b709004749861e78315b953536a67d36a3f8880c5e9347f8acc4c520ba3f","observation_id":"1f6a5cbe-014d-4cec-a6da-53216c3957cf","resolution":{"observed_at":"2026-08-07T14:56:32.607048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T14:56:32.612991Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.612991Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:77452086858169f49cf782bf2d2023d59131d176c5d6997fb7ed06658bace096","observation_id":"fbd56a7c-1d17-4f38-96a9-c1913a060f50","resolution":{"observed_at":"2026-08-07T14:56:32.612991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T14:56:32.616203Z","title":"Agibot world colosseo: A large-scale manip- ulation platform for scalable and intelligent embodied sys- tems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.616203Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:0d7e83e581a1df84b37f2d65e9f1f34708b1f2d34e77db218644d347d121eafd","observation_id":"cc155f46-a02e-438c-9f55-e2a452569f54","resolution":{"observed_at":"2026-08-07T14:56:32.616203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T14:56:32.640982Z","title":"Univla: Learning to act anywhere with task-centric latent ac- tions.arXiv preprint arXiv:2505.06111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.640982Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:81a3534d9bf2b59a206e9f4e1ed3aae9cd9c108a05f26deb1e1ef6df82183fe5","observation_id":"7877c53e-9388-40f5-8970-c782b2c0e3f9","resolution":{"observed_at":"2026-08-07T14:56:32.640982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-10T07:22:51.573401Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-07T14:56:32.779945Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.779945Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:dccd344814c483cf21799b6ab2b5ca4ac9c239eb697ed539f4d3708c7ab466ce","observation_id":"1d476429-2f2e-4b3f-a7de-7f7bf0476c35","resolution":{"observed_at":"2026-08-07T14:56:32.779945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T14:56:32.880004Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.880004Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:ec0b7e1347ee992cd4ce8195d33a21203a580b831caa2c6eb7b556d2c3802186","observation_id":"24bbbd95-4594-40e9-8c1b-be99106b09b0","resolution":{"observed_at":"2026-08-07T14:56:32.880004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01103","last_updated":"2025-06-01T17:58:36Z","snapshot_observed_at":"2026-08-07T11:48:19.621062Z","submitted_at":"2025-06-01T17:58:36Z","title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01103","snapshot_observed_at":"2026-08-07T14:56:33.022075Z","title":"Deepverse: 4d autoregres- sive video generation as a world model.arXiv preprint arXiv:2506.01103, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.022075Z"},"links":{"cited_paper":"/paper/2506.01103","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:8f30d0f93dd2f66b4dd9a4ebfe39585ebb8d65e73204edd43bb0375ffe782e2c","observation_id":"7535f42c-d1de-40cb-bfbf-eac6ee1cc129","resolution":{"observed_at":"2026-08-07T14:56:33.022075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-07T14:56:33.139916Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai.arXiv preprint arXiv:2411.00785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.139916Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d50d2df07b99c9fb944692bf70c34333056251c1c55f78335b2b8678aff2f9fb","observation_id":"87d28d03-a0ad-4bca-a374-5a7b333b7764","resolution":{"observed_at":"2026-08-07T14:56:33.139916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-08-07T14:56:33.228796Z","title":"Villa-x: enhancing latent action modeling in vision-language-action models.arXiv preprint arXiv:2507.23682, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.228796Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:736a0c8587aa938a2e2194c164002e353954cf98a6a47bb0fbae414f148e1f25","observation_id":"890bf866-5c44-4517-8078-2936bd53db35","resolution":{"observed_at":"2026-08-07T14:56:33.228796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:33.344464Z","title":"Moto: Latent mo- tion token as the bridging language for learning robot ma- nipulation from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.344464Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:b9bff028ffa1073bf71d58ce36177dfebd6f842dd9675255be9d778ccec15baa","observation_id":"d8314d15-f6de-4d58-99b1-a3cc8eea7fce","resolution":{"observed_at":"2026-08-07T14:56:33.344464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.766653Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":"6e94b346-59ec-4437-b57b-e1deb1fc7412","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.467736Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:377628029cea9d61d2c215afc9da1f2900a388a1307122274810d21773f59434","observation_id":"b25bcbbb-f9ed-4986-9757-a39fa3f72be2","resolution":{"observed_at":"2026-08-07T14:56:49.850891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.515411Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion.The International Journal of Robotics Research, 44 (10-11):1684–1704, 2025","venue":null,"work_id":"c3147aaf-8359-4ffa-afb9-ab77120377cc","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.594230Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:1ef4c0e49d0e363eb8df0e8d75bec20efdfb18193df91bcb2c1805d24e418c2a","observation_id":"e57e62d6-09f1-4b6e-a4f5-1baea46075bb","resolution":{"observed_at":"2026-08-07T14:56:49.659069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.278810Z","title":"Dynamo: In-domain dynamics pretraining for visuo-motor control","venue":null,"work_id":"879a8900-786b-435e-b938-2e505fabeff6","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.657199Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:91f61e5bc3a9884912be6c355a91b594da84e2d8a008e21f5a783db29e6a802a","observation_id":"8ec858f1-e571-4441-a762-6b4c3f6b9520","resolution":{"observed_at":"2026-08-07T14:56:49.424023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:49.096321Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"67d57551-b188-4233-a66d-a1bc4df828c4","year":2019},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.803862Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d766ec996ddb984d1ef1c6919d81aa66ab3e533989c0c6fe41eaf8a15621b1fe","observation_id":"dc50e3be-39b8-4711-8ce8-e63e5b8da00d","resolution":{"observed_at":"2026-08-07T14:56:49.183135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:33.961506Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:33.961506Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:ea05666b145852cfdb8bd0160ba03986a704a87f42e33918e005ae6e10fb84ab","observation_id":"017c1337-9fed-4e00-869e-2ad12297b903","resolution":{"observed_at":"2026-08-07T14:56:33.961506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-07T12:37:05.162590Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-08-07T14:56:34.138568Z","title":"Knowl- edge insulating vision-language-action models: Train fast, run fast, generalize better.arXiv preprint arXiv:2505.23705,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.138568Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:7e8b6ecfa20d530deff73084d66f01abe8df3b6ab6e9cc4ab83518df5c12be65","observation_id":"b8b988ff-16c2-4c2b-81a9-b914a0bf0585","resolution":{"observed_at":"2026-08-07T14:56:34.138568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:34.230249Z","title":"Learning universal policies via text-guided video genera- tion.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.230249Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:baf743110685b2dbc179f597ed30ff5718ec1d439834e60b8044f280a35e7cfd","observation_id":"ae624b62-179a-41cd-83ef-ce0090126007","resolution":{"observed_at":"2026-08-07T14:56:34.230249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-10T18:55:01.793769Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-07T14:56:34.349931Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens.arXiv preprint arXiv:2410.13863, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.349931Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:aa1db1cfbe0f6f75d99df8f31f542851d905d3152c23b3debdda361e3f2681e4","observation_id":"63b67dff-4f12-45d7-a84c-d065bb2cc811","resolution":{"observed_at":"2026-08-07T14:56:34.349931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.624616Z","title":"RH20T: A comprehensive robotic dataset for learning di- verse skills in one-shot","venue":null,"work_id":"0149e624-7b17-442d-8b1c-76644aab953e","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.499860Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:b24f4314c761dc852cebeb5b9a11c015fd51511bf8f5eedce162499b4a727fcb","observation_id":"f23f9dd9-7973-42a6-a4de-bf8c67503b65","resolution":{"observed_at":"2026-08-07T14:56:48.737146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.449241Z","title":"Adaworld: Learning adaptable world models with latent actions","venue":null,"work_id":"1fd210d3-2f95-46a4-bc7e-ad282142f8ae","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.636543Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:912a74445013e7a08f996b288118d4ecb37a0cdca76f28608217ac05e0effed2","observation_id":"71c825b4-9aa3-4f05-98b7-4c0bee54a48f","resolution":{"observed_at":"2026-08-07T14:56:48.544160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-07T14:56:34.733788Z","title":"Dreamdojo: A generalist robot world model from large-scale human videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.733788Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:2b0dd85d1ccaaf9f2e45898426c84f710cb2183f64c60d7c4128f1713a64f0fe","observation_id":"87530bff-c61e-4481-80ef-73a7fec925b7","resolution":{"observed_at":"2026-08-07T14:56:34.733788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-11T03:40:37.164575Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-07T14:56:34.869860Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.869860Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:9dd72eaaa5134e8802e7265916ef8b5adbeb78dcc705aca98e7804eab621ccb4","observation_id":"fe736a04-2a99-4177-9d95-354fab74729e","resolution":{"observed_at":"2026-08-07T14:56:34.869860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.241901Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"96da5f46-7dcd-488b-8e27-2693398563b1","year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.045813Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:31098262b26389837e5f5352338036799b0454e557234d0b68ce282e1d970ccc","observation_id":"7da0c5f5-ca0f-4650-b360-6dfc8ec8397c","resolution":{"observed_at":"2026-08-07T14:56:48.345966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.989321Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"88a0fa7e-83f7-4b4e-be57-b075e95f2f20","year":2020},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.187942Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:11d4acb94d6fabb0c91c743c699f3374370255dbfdf597330ebde76284ea29e7","observation_id":"6b7d3554-622b-4b2d-93f3-c35a46291c63","resolution":{"observed_at":"2026-08-07T14:56:48.099286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.685854Z","title":null,"venue":null,"work_id":"cb7953d9-2887-4bb6-988d-45ba4a027390","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.348426Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:e141d982c7a550aaca4696ff463f781527b600f23b5c318d00cedbad2ac57e70","observation_id":"531f0619-ed63-4ac3-820a-5e320462fff8","resolution":{"observed_at":"2026-08-07T14:56:47.821498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.455831Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"70d1aef8-fbed-4dd2-aed5-66be4b6f0b65","year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.506709Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:3555ff5b2194c0b061370abbf29c411495b71b4d5547ab0f6ec68c4ffee8a4b0","observation_id":"d6229945-444b-4ae4-90a0-d372e6214676","resolution":{"observed_at":"2026-08-07T14:56:47.631415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.305061Z","title":"Robotic grasp- ing using deep reinforcement learning","venue":null,"work_id":"112ff7e2-c4bb-41a5-85a0-84d9b846cc1a","year":2020},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.676679Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:735a56830e21ef6bdd0d677ea994cf4c5c19431767d493eb5175128f62e3dbfa","observation_id":"b628af0f-f625-4924-acc0-de9089218dee","resolution":{"observed_at":"2026-08-07T14:56:47.412144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-07T14:56:35.821488Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:35.821488Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:9e27a3ca6d55bb7e5dbeadd4873a62ab236ba29c118d271db378833463d61084","observation_id":"aecd2f10-6cbe-4424-907c-b452be976e7c","resolution":{"observed_at":"2026-08-07T14:56:35.821488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:56:36.012538Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.012538Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:1eaea2f7c71a9e47d467bd6b98d1d763a0d36bcdcd8c6af7bf8d006b6af6d001","observation_id":"6c8673aa-da7b-4db7-9ce5-7368e1f1a93b","resolution":{"observed_at":"2026-08-07T14:56:36.012538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T14:56:36.108597Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.108597Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:bc446763f06cf4d5595e72c772a46ee2275dc508d5a21db9efecfa11e809c249","observation_id":"17b4b429-82bc-484c-81d9-fa312b1c1061","resolution":{"observed_at":"2026-08-07T14:56:36.108597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-07T14:56:36.234503Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning.arXiv preprint arXiv:2601.16163, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.234503Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:70a094e21bdd503d8287afadeced9ec331e0f25f1c7a2a90a75db3ff2c43508a","observation_id":"da172c2c-1e2f-4231-9fb0-4479243c419b","resolution":{"observed_at":"2026-08-07T14:56:36.234503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:56:36.351989Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.351989Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:f60bad60890506e7d8116238dbe8d4c44be5a2f111fc3da6b52e04e844f1676b","observation_id":"5e549f1e-a20d-4ea7-bd54-3d9136d0b7d7","resolution":{"observed_at":"2026-08-07T14:56:36.351989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:36.485659Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.485659Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:a38d78e4999f05c0ed6263cc90b368d6b70ef4bc7ce6f4e5bb5d1bf814a44685","observation_id":"897fb361-f246-4069-8dda-9c61961e321c","resolution":{"observed_at":"2026-08-07T14:56:36.485659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:47.000946Z","title":"Tenenbaum","venue":null,"work_id":"2fca8c04-c180-4bd0-a72c-829005a0d0d1","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.637966Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:a3ddc305e18a336d99ab3f70e144f57a31384ccae8016bd5e1077f264aaa183e","observation_id":"b90f2d53-e0af-4fc1-b1d3-47ac69419831","resolution":{"observed_at":"2026-08-07T14:56:47.173564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T14:56:36.734418Z","title":"Cogact: A foundational vision- language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.734418Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:bf536386cb744d26f992778961ca3b386ae666750fa703c2cb319d05e910e2ac","observation_id":"e4f746b1-ce77-4f22-86d7-f8a30e27c75c","resolution":{"observed_at":"2026-08-07T14:56:36.734418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:36.858251Z","title":"Autoregressive image generation without vec- tor quantization.Advances in Neural Information Processing Systems, 37:56424–56445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.858251Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:0ac7e1a4cdd8b9c68bb4b84f105c63dd02e9ed52abed7b7b9f98fe270553b3ff","observation_id":"766028de-d46f-4126-9775-ffe1bf942bad","resolution":{"observed_at":"2026-08-07T14:56:36.858251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04999","last_updated":"2026-07-30T01:04:01Z","snapshot_observed_at":"2026-08-07T15:48:54.327194Z","submitted_at":"2025-05-08T07:07:58Z","title":"CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04999","snapshot_observed_at":"2026-08-07T14:56:36.948592Z","title":"Clam: Continuous latent ac- tion models for robot learning from unlabeled demonstra- tions.arXiv preprint arXiv:2505.04999, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:36.948592Z"},"links":{"cited_paper":"/paper/2505.04999","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:c50ecb243a1127f74cc8f6ce8fad369b66e78b8756523c7070be6ede9000fdda","observation_id":"e06d4802-c6bb-46fa-89b9-e32f33860c88","resolution":{"observed_at":"2026-08-07T14:56:36.948592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:56:37.093066Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.093066Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:44dc0eddeffa658ae239439527e8c0d2854aa90b4123562b13edf6a377182552","observation_id":"1e14667b-ea42-4bdb-bd57-940576f72a41","resolution":{"observed_at":"2026-08-07T14:56:37.093066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.752532Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":"141f1235-c0d9-41e8-a093-1f563773e7bc","year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.223855Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d93013b7caeecbbcfdce4765abc798ed257b936ae1683de3ddae9971e42c5c43","observation_id":"c1d3d381-2afc-4eae-bf5f-f94e1466912e","resolution":{"observed_at":"2026-08-07T14:56:46.867371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-07T14:56:37.346550Z","title":"Hybridvla: Collaborative diffu- sion and autoregression in a unified vision-language-action model.arXiv preprint arXiv:2503.10631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.346550Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:936df0521c974b81b750d1dab196947ec17d958f44073bc69f646dba944b0b0e","observation_id":"b3a16e09-5265-4fce-a8f6-d80b1e4528fb","resolution":{"observed_at":"2026-08-07T14:56:37.346550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-07T23:47:17.083775Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-07T14:56:37.435792Z","title":"Rectified flow: A marginal preserving approach to optimal transport.arXiv preprint arXiv:2209.14577, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.435792Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:55f3d6fbc498a917ca2ba7ae1bf2be5839e53c900de9c6c473da3cc928b16e88","observation_id":"91454c3f-fe8c-4128-9e8e-488ef8d54ee9","resolution":{"observed_at":"2026-08-07T14:56:37.435792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.542961Z","title":"RDT-1B: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":"86878814-cc53-4dd0-8ee7-c3be3795c3fa","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.514294Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:6e9212b24ac98861f2b68b0d8e161d46621d640e9e44d2fee10a6a615d292d55","observation_id":"c016224b-a916-47ad-9b5a-5fbde84adce8","resolution":{"observed_at":"2026-08-07T14:56:46.639358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-08T10:23:37.779496Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24125","snapshot_observed_at":"2026-08-07T14:56:37.623412Z","title":"Unified embodied vlm reason- ing with robotic action via autoregressive discretized pre- training.arXiv preprint arXiv:2512.24125, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.623412Z"},"links":{"cited_paper":"/paper/2512.24125","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:97699112873d1cbb0204e1a3513d2ca4a5d5be3fb9ae0d258f288ac0bc8a598b","observation_id":"11329dda-5725-4c35-8729-918d64d90a99","resolution":{"observed_at":"2026-08-07T14:56:37.623412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-07T14:56:37.727000Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models.arXiv preprint arXiv:2211.01095, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.727000Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:8cf26df6cb24f10e245c9f593ec6210523e5b418ff56cfdf20b7f1820fa92441","observation_id":"4395234a-2a81-4578-aa68-10a761eca08c","resolution":{"observed_at":"2026-08-07T14:56:37.727000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:37.804009Z","title":"Being-h0","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.804009Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d31a6409f947944e1db3cfc7457878498cffd05ac9ecba674323e3c848985e07","observation_id":"69206639-e4b1-4a57-8de2-3699a78412ce","resolution":{"observed_at":"2026-08-07T14:56:37.804009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.380394Z","title":"Towards generalist robot learning from in- ternet video: A survey.Journal of Artificial Intelligence Re- search, 83, 2025","venue":null,"work_id":"e9642468-014f-46b4-ad0c-d1ee3d896bf4","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.898574Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:183f945e01fb4c636d82f1657bed5f7ea3ef849fe2468350d6f25a78c3b06a1c","observation_id":"22292ca0-7802-4340-b494-99ad30100678","resolution":{"observed_at":"2026-08-07T14:56:46.438453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.200628Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks.IEEE Robotics and Automation Letters, 7(3): 7327–7334, 2022","venue":null,"work_id":"f6aa6260-0ae1-487c-b258-d4cc2c329b83","year":2022},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:37.995839Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:3f64d4edf3b8af494f6bd90e7d4630003fc16352ac1034fb0e496b9f1fc93ca0","observation_id":"dd0e4a18-9733-4229-b570-dc9ec7d1cc63","resolution":{"observed_at":"2026-08-07T14:56:46.271265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:46.006071Z","title":"Struc- tured world models from human videos","venue":null,"work_id":"cd003b29-ab82-4fd7-a898-c7a1b2aef064","year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.233877Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:24acb26ffc0bd3d1279b6124380ad032d5a5254452bf5677cb76eb827f4c57dc","observation_id":"4291300b-7f8b-49c4-a2ec-2e7e5d431785","resolution":{"observed_at":"2026-08-07T14:56:46.080304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:45.839655Z","title":"Robotwin: Dual-arm robot benchmark with generative digi- tal twins (early version)","venue":null,"work_id":"4ee259cd-dbc8-4f81-a75e-fedeb6f791f4","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.388917Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:52b7a4574d0d2588454200b038738f64480d8fe86a1c819e2c121dc255a60bab","observation_id":"7162bf4f-ba51-4eb7-b278-ec4863ab93ea","resolution":{"observed_at":"2026-08-07T14:56:45.919268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:38.520931Z","title":"Rt-affordance: Affordances are versatile intermediate rep- resentations for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.520931Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:09a4389477576035d749da23a5560c9edd0942480f147f41c8d25a04fdb2c932","observation_id":"e8016e64-0167-46c4-b1b3-4fb732abbfaa","resolution":{"observed_at":"2026-08-07T14:56:38.520931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:45.660578Z","title":"Latent action learning requires supervision in the presence of distractors","venue":null,"work_id":"52b2493e-a23f-4799-8c05-29f2a58d07a2","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.635605Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:f6d1e89c63f932a3e083412e80686f80d26154611e8a795256ae4c3033c62d6f","observation_id":"5ca2bb9f-76df-4146-ae5d-e1b022300281","resolution":{"observed_at":"2026-08-07T14:56:45.739469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:56:38.805706Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.805706Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:eda97258ce36a7ead731f0db0549214baeb7cffb688c32251c935f4590876b86","observation_id":"fc1438ea-4827-47a5-8a27-a5bf2bb2572e","resolution":{"observed_at":"2026-08-07T14:56:38.805706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T14:56:38.957643Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:38.957643Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:b33394030821491ed89ae5a2a7a07a3133f245995dc928854b933228fb40561a","observation_id":"e49b0b75-e49c-426a-98da-b2e5372db460","resolution":{"observed_at":"2026-08-07T14:56:38.957643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:39.094879Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.094879Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:8e616a1492b5c2d938f44c48c53e133bc5e244e9d7e083005e557c5dc12bf4d4","observation_id":"403e9781-c3ab-46e6-b8ac-a526f42e6337","resolution":{"observed_at":"2026-08-07T14:56:39.094879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:39.260337Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.260337Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:902388a53ef1ccf32d520a01fe75cbddacf879fa06d7b3313868006759f936e5","observation_id":"20f02a57-d5b0-434b-8332-99e9539a6eda","resolution":{"observed_at":"2026-08-07T14:56:39.260337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T14:56:39.356562Z","title":"Fast: Efficient action tokenization for vision- language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.356562Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d0d138212e5e442db40c2b10810bd086abbb007d4904542db22c4c8dc9e96c78","observation_id":"132fd4aa-6801-4824-b057-cf858f0030ee","resolution":{"observed_at":"2026-08-07T14:56:39.356562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:45.439959Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":"3fdb64d9-3ccb-4a64-a2fb-98a91d4c8f03","year":2018},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.414860Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:bc163f8b67bc19a8cecee32afd659c8014674a5838e40b3d57fbe0816e36c636","observation_id":"2150779b-75d6-473c-a549-582a5500ee0a","resolution":{"observed_at":"2026-08-07T14:56:45.548114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:45.247072Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":"e500d723-9b54-4a16-8f79-ab71bda988d5","year":2020},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.519643Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:2fa042022049c31d714c41748c1d4a7b07b82a1b26b2db088c5aa5a7f384ca57","observation_id":"7e1295c6-1dfe-4e3a-a64b-7d6e3b861745","resolution":{"observed_at":"2026-08-07T14:56:45.360652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T14:56:39.602403Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.602403Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:2666a7c961c7645c232e51ee7228dfee6620b7e8a1fea9c66c2798b9874f5069","observation_id":"d429a206-3785-4eba-9fd5-4058e2f94591","resolution":{"observed_at":"2026-08-07T14:56:39.602403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:45.053057Z","title":"Motion before action: Diffusing object mo- tion as manipulation condition.IEEE Robotics and Automa- tion Letters, 2025","venue":null,"work_id":"3a0a7b8b-cbbd-4f12-8078-b2ff1f48faa5","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.692573Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:78eb620a9f44cf978a99f8c337ac5226ae5fd0bb27d043c67bb006dab9cc5c33","observation_id":"ffea3315-c38c-4bc2-b5ef-c2902e437bf7","resolution":{"observed_at":"2026-08-07T14:56:45.152200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01954","last_updated":"2018-05-11T21:48:52Z","snapshot_observed_at":"2026-08-06T03:56:45.024415Z","submitted_at":"2018-05-04T22:36:58Z","title":"Behavioral Cloning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.01954","snapshot_observed_at":"2026-08-07T14:56:39.807343Z","title":"Behavioral cloning from observation.arXiv preprint arXiv:1805.01954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.807343Z"},"links":{"cited_paper":"/paper/1805.01954","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:5284c0ac13e573b47c428879155376288c937c1e6da0ba5159726f2aec3d8940","observation_id":"da5bdcaf-fb0d-4d2f-bc55-8f2b6902ab6f","resolution":{"observed_at":"2026-08-07T14:56:39.807343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:44.808643Z","title":"Neural discrete representation learning.Advances in neural information pro- cessing systems, 30, 2017","venue":null,"work_id":"5b4dcbc7-6b4f-4f8b-901a-aa0827b93baa","year":2017},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:39.942079Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:f3eadbc6d2ed1ca131adb9e09d811043d89cbab1be4ac25c9ac938cf472ea26e","observation_id":"212b802a-5dfc-419d-8d5f-70d5c9340082","resolution":{"observed_at":"2026-08-07T14:56:44.948701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-08T02:25:42.905263Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-07T14:56:40.019748Z","title":"Mim- icplay: Long-horizon imitation learning by watching human play.arXiv preprint arXiv:2302.12422, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.019748Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:9429cbea3ba534d73e653d7c8e36ffc20d8f6c7accec292dd37bb3f9d2720502","observation_id":"f3cb3cee-3432-4b29-9d12-c3803e41c8d9","resolution":{"observed_at":"2026-08-07T14:56:40.019748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:44.563585Z","title":"Tdn: Temporal difference networks for efficient action recog- nition","venue":null,"work_id":"318e85e7-76c9-4722-9e8d-d5602569de1c","year":1904},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.119419Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:4dc96508937880a5390a56cb9b571e82829702a0315af0f89f8479ccd336249a","observation_id":"0e1ebdec-0fea-4c11-b809-ce33c88a7903","resolution":{"observed_at":"2026-08-07T14:56:44.715870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-10T17:00:55.300999Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-07T14:56:40.227298Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation.arXiv preprint arXiv:2411.08380, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.227298Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:d454db30d48e6b0910c4d27816f66d38f9e9da8dbd4957dd6825a30d1d81ea5f","observation_id":"eba3de72-db0f-477b-ac34-c9d316dc5fd1","resolution":{"observed_at":"2026-08-07T14:56:40.227298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:44.280909Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized action tokenizers","venue":null,"work_id":"f4441e96-00f9-4b50-b65c-2030a9f17c2d","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.322261Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:929d2cd1781a464e4d7d8356b7b000177b7217f615a9639b155219b1c7332849","observation_id":"93929ffa-5587-4763-b82f-b365ee5c494e","resolution":{"observed_at":"2026-08-07T14:56:44.384737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:43.854045Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":"58a7d9ba-ae07-4f68-9627-b270ff95334c","year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.493789Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:bebf05539b61ef76dbf322cba3cfb9b876a1b63af04fc17c55f69854a16a75f5","observation_id":"809b10e5-0f56-49df-b2f3-4c54e5a820d1","resolution":{"observed_at":"2026-08-07T14:56:44.125895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:43.619861Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation.RAL,","venue":null,"work_id":"a87c717f-f662-4346-b78a-4d37559e1f68","year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.593389Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:929786858205f17cc7c401c03e97a02947b4bcd08014b26d0e648905154396cf","observation_id":"38ddd823-3fd4-46c9-9381-1891ed181075","resolution":{"observed_at":"2026-08-07T14:56:43.749630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-08-11T00:35:07.722340Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-08-07T14:56:40.706078Z","title":"Flow as the cross-domain manipulation interface.arXiv preprint arXiv:2407.15208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.706078Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:47eccb5fa9af88217d32cc1982a5d44725cc7b9eb5a456eecf84233d381d7263","observation_id":"b2761b91-1784-4d90-a111-4e3178c92092","resolution":{"observed_at":"2026-08-07T14:56:40.706078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05304","last_updated":"2024-11-21T17:45:43Z","snapshot_observed_at":"2026-07-06T17:41:34.856417Z","submitted_at":"2024-03-08T13:33:00Z","title":"Spatiotemporal Predictive Pre-training for Robotic Motor Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05304","snapshot_observed_at":"2026-08-07T14:56:40.813754Z","title":"Spatiotemporal predictive pre-training for robotic motor control.arXiv preprint arXiv:2403.05304,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.813754Z"},"links":{"cited_paper":"/paper/2403.05304","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:37888c74b588f0bb2ac39d0a665dcc8a7290a5d77bdfa4cd3556af217c66c7c7","observation_id":"b8f439d0-6dd7-44b8-bde8-42a8b0dc0497","resolution":{"observed_at":"2026-08-07T14:56:40.813754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:43.336415Z","title":"Transferring foundation models for generalizable robotic manipulation","venue":null,"work_id":"f10d7025-778f-4365-bffb-c4b2505ea6e9","year":1999},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:40.920821Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:cfdb35233f3b41bacd1db3ab6e063c0208f8c3b231f98ea3f141765121b661d4","observation_id":"c0221f6b-e15c-432a-a62d-c6e879b1df20","resolution":{"observed_at":"2026-08-07T14:56:43.492257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:43.052699Z","title":"Tra-moe: Learning trajectory pre- diction model from multiple domains for adaptive policy conditioning","venue":null,"work_id":"599f3e62-6b4b-4d8c-8fbc-a1aa0d49dba4","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.000514Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:2b33ffcbdda7aa0f0ef8f81e8a63aada28203b0724b7bf41a9e4f250a51263a1","observation_id":"d992746c-b945-4f62-992a-34970f393fc3","resolution":{"observed_at":"2026-08-07T14:56:43.165878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-07T14:56:41.108636Z","title":"Egovla: Learning vision-language- action models from egocentric human videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.108636Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:5b1621d91957b39cb08b2ad4338c5876eeadfb26b278eb8b8faa6b3fa79131af","observation_id":"29df59bc-d9fd-4b6d-a80c-b8269c34710f","resolution":{"observed_at":"2026-08-07T14:56:41.108636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:42.805643Z","title":"Latent action pretraining from videos","venue":null,"work_id":"e859b771-c74a-40b4-97e2-c7a45020d31c","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.199862Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:5542d0e96d587f1b4d88cdecb7ed0f35fa45f1480840ba372eba73bad3284f96","observation_id":"1a45bc75-9667-4dc9-a453-5efb935d7ec5","resolution":{"observed_at":"2026-08-07T14:56:42.917516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-07T14:56:41.284332Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge.arXiv preprint arXiv:2507.04447, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.284332Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:66f93e944c9f8fb9daca1294b9e7f02fdb58e9ecc06d13dffd02c15277ab9cb9","observation_id":"cdba56e2-5111-4ee8-a30b-44de3eb6b082","resolution":{"observed_at":"2026-08-07T14:56:41.284332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:42.576702Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":"c8bdfb35-930b-48b5-b6c1-5005483c833b","year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.422555Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:526ac7509a7efe0ec7a29ab57b6ccdfbcf555d3fe04d3ad62a523048b93776bb","observation_id":"2c8ad561-3481-4112-965a-8bd66644f316","resolution":{"observed_at":"2026-08-07T14:56:42.668221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:42.369580Z","title":"Aether: Geometric-aware unified world modeling","venue":null,"work_id":"e90b6040-03ae-4e0d-9197-c116c3bf796a","year":2025},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.529797Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:89e0943b1db250b4674deb530d745bb06ee230303555499ce20124326627242c","observation_id":"d6f515ff-3bb3-4c0f-8819-ccb3a23225c0","resolution":{"observed_at":"2026-08-07T14:56:42.479526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:42.186489Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"ce087353-7d9d-4d48-826f-876d471fb5b6","year":2023},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:41.618867Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:51d4049938964a2ed1b114d342d5f038040e9bb29207af01889a269bd5863a80","observation_id":"a90562a2-a51c-4ed5-b952-f6c52278bd2a","resolution":{"observed_at":"2026-08-07T14:56:42.262283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:48.875618Z","title":"3, 9, 10, 12, 13","venue":null,"work_id":"cb93e5d8-4e2c-4be4-b273-ee4b376a240f","year":2021},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:34.058846Z"},"links":{"citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:9227999a20621599b1fe6b22ecc4a49bb6dc9287603b91234e9b36023342b01f","observation_id":"b6588c65-327e-4d39-85c5-d9660e10c3ad","resolution":{"observed_at":"2026-08-07T14:56:48.952101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 15 inbound Pith citation observations for arXiv:2505.17006."}