{"as_of":"2026-08-05T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f55e870b405eb9cf33ecae47f6db47d2021c6e0d269c28a2deb6c0de00f4281e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:04:25.672157Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:50:30.610634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:39:17.463881Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":"2604.19734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-04T00:39:17.463881Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","venue":"cs.RO","work_id":"4863d8dd-bf80-4d6c-b996-5240e8eece85","year":2026},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:8f9e4dfb31dbf0a45ed5cfb6c831aaf62e7c3c1958f6ac97ca96958d40d60a96","observation_id":"4cb49f2a-9a8f-4fcf-b07f-9534e50ccb4a","resolution":{"observed_at":"2026-07-01T19:26:00.412175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":"2604.19734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-04T00:39:17.463881Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","venue":"cs.RO","work_id":"4863d8dd-bf80-4d6c-b996-5240e8eece85","year":2026},"citing_paper":{"arxiv_id":"2606.14752","last_updated":"2026-06-28T06:47:31Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-07T09:39:39Z","title":"X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T11:23:36.941801Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2606.14752"},"observation_digest":"sha256:efe812cd1fd297f7bf49383936cc5527c72dbace7149285df5d105c0578e9a68","observation_id":"219b068e-1897-4389-84bd-0826d65f2e5b","resolution":{"observed_at":"2026-06-30T11:24:37.844827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":"2604.19734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-04T00:39:17.463881Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","venue":"cs.RO","work_id":"4863d8dd-bf80-4d6c-b996-5240e8eece85","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:075b322f0868498181b4d7e8abb7ff717a8e887dc9221939685c333f21b789aa","observation_id":"4ff1ec73-74e3-4a7d-b10c-126d3e147026","resolution":{"observed_at":"2026-07-04T00:39:17.465109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Unit: Toward a unified physical language for human-to-humanoid policy learning and world modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:c74a54018b3197761766a711a7cfe41235eda10891bd514675c9c3c286101ffc","observation_id":"0882fa01-a819-42df-8335-27a82fc14cfd","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-31T01:50:30.610634Z","title":"Unit: Toward a unified physical language for human-to-humanoid policy learning and world modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28624","last_updated":"2026-07-30T17:59:46Z","snapshot_observed_at":"2026-08-03T00:12:51.051086Z","submitted_at":"2026-07-30T17:59:46Z","title":"PhiZero: A World Model Built Around Physical Language","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T01:50:30.610634Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2607.28624"},"observation_digest":"sha256:b5a6fbacc98305c267aaf3585731fbff9b3eec88cf52ae556e2b49e217ec2fdf","observation_id":"78cd12f2-d3a7-4b6c-97bc-b35a2338b83c","resolution":{"observed_at":"2026-07-31T01:50:30.610634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19734/citation-record","integrity":"/paper/2604.19734/integrity","json":"/paper/2604.19734/citation-record.json","paper":"/paper/2604.19734"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.650823Z","title":"In- n-on: Scaling egocentric manipulation with in-the-wild and on-task data","venue":null,"work_id":"cce6bd4b-86b8-4542-9eca-d09f4c0da1cf","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:c1ec28b2dea0ba7814d099a580558afa14b453636aef119e4ed8568a5c0d1ac6","observation_id":"a973eb9f-1233-4a48-8e77-fc944b4d138a","resolution":{"observed_at":"2026-05-11T13:16:07.069885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07813","last_updated":"2026-05-17T22:14:58Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T17:59:05Z","title":"DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies","version":2},"cited_work":{"arxiv_id":"2505.07813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07813","snapshot_observed_at":"2026-07-04T15:59:56.301977Z","title":"Dexwild: Dexterous human interactions for in-the-wild robot policies","venue":"cs.RO","work_id":"4ce8f03a-3616-4e4a-ba23-d5487f2484dd","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2505.07813","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:0956ab4e31b9edcfb50b36ecb6088cfe13055cbecdfa3c20da4499c344781881","observation_id":"e3b7a60c-b7ce-434f-a270-822252b5a70c","resolution":{"observed_at":"2026-05-20T00:04:09.359682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-07-06T21:58:13.740929Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:e4729676f05113a564217357bbed35e846c014e3b6515c339cf32c007e323e82","observation_id":"ab2236a3-384b-4c1e-a969-5621dad563a7","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-08-04T18:59:25.456993Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":"2403.03181","doi":"10.48550/arxiv.2403.03181","metadata_source":"pith","pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior generation with latent actions","venue":"cs.LG","work_id":"859887e2-2079-408c-b000-3aad886b3387","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:163c7763a98960696a9460fd025e9239390c7f6229d8bcaafc7c6f4564f13fe2","observation_id":"75b4f3c8-4c02-4681-bcad-d0af74f734fd","resolution":{"observed_at":"2026-05-11T13:16:07.355825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:b906201e0a081a1492d8cc96fd2577d1696f74860473eed1b20eb4a941931f90","observation_id":"645cf03f-ddf0-4a7d-94bc-f70080252baa","resolution":{"observed_at":"2026-05-11T13:16:07.545351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action tokenizer matters in in-context imitation learning","venue":null,"work_id":"1305e866-1cae-4a17-bfde-9f002884cfa2","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:563b06a0a80706fe61375380b69a7fbf13c037789064c379286aaba6be4d2699","observation_id":"41e53dba-561b-448e-973a-90ae610e2b42","resolution":{"observed_at":"2026-05-23T00:55:16.263751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15840","last_updated":"2024-09-11T13:02:48Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:57:59Z","title":"QueST: Self-Supervised Skill Abstractions for Learning Continuous Control","version":3},"cited_work":{"arxiv_id":"2407.15840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quest: Self- supervised skill abstractions for learning continuous control","venue":null,"work_id":"8993d238-97af-451b-b546-dd3e2bf4f73f","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2407.15840","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:f806fb303d5646ebc10ad6c263025763c29d3426962422d181d02ea7a6648f44","observation_id":"b2aa3951-a4e0-4330-91d2-252a445b1731","resolution":{"observed_at":"2026-05-11T13:16:06.362356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers","venue":null,"work_id":"7a84e364-fe9f-4810-85b0-3f87dad5243c","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:f85f139178e7e2934204a69279aded3e5740c4a94ab32df81ca30333e32b7b56","observation_id":"db95a951-fa5a-4999-98ed-5e6db56dcb61","resolution":{"observed_at":"2026-05-23T00:55:16.319068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos","venue":null,"work_id":"22f668ad-db4e-407d-9f98-efbc73a18dd0","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:1abe9cfebd9b83646d24dc1d2cbf7d7841e25c8f3af6e5a59178227d1db2465d","observation_id":"8f959f8e-6413-4c88-b62e-9975e0a3ec3c","resolution":{"observed_at":"2026-05-23T00:55:16.304786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:6f523da01fbc9c07f7b241a3afe3df4cc641ba73e0e851571e450601cd79bbba","observation_id":"95635ea6-2ab6-4671-aa50-56262d2d12c1","resolution":{"observed_at":"2026-05-11T13:16:06.498105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:53c5cf797ae42913e635af42a36ec3802a99fad5a440439bef3f56d2dff94a06","observation_id":"df7082f5-8fe4-4cca-bd08-3fcbd2e4688c","resolution":{"observed_at":"2026-05-12T15:28:07.265740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:36:10.622960Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":"97cb9551-0b69-4ee0-b933-9bac7247a27b","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:964b777e38f16ef03cb53fbe661965fae22fdb0ba671c12ae5aba54034f68f2a","observation_id":"89b23afc-c48a-4fca-a059-d31719795408","resolution":{"observed_at":"2026-05-23T00:55:16.284312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.17366","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.712729Z","title":"Metis: Multi-source egocentric training for integrated dexterous vision-language-action model","venue":null,"work_id":"54ab097c-305b-44d5-92ef-62784ab516a5","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:edbf0eaf72df63efbbaa34655bf0715d828c9d300f401d8843934a630098256d","observation_id":"f4a4f155-46c1-4ee6-9bf2-eb8fa6d002b3","resolution":{"observed_at":"2026-05-11T13:16:07.895852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:116c8aee88c3c4d635c10c9485d8620956f13dcd23087c2c903f2fac0d62b9d8","observation_id":"88382b62-eee2-4c01-a937-a729d25940fb","resolution":{"observed_at":"2026-05-15T13:26:54.148999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":"2210.00030","doi":"10.48550/arxiv.2210.00030","metadata_source":"pith","pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","venue":"cs.RO","work_id":"022de141-49ac-43d5-9667-e36913ec1950","year":2022},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:1899567b1c1ba4b7de37f68d4740ce54abc0f1d3cdbf4a3cea26c7e2f613be41","observation_id":"2b782146-c469-4fe9-bf1e-17d6da41e161","resolution":{"observed_at":"2026-05-15T04:42:52.948246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"1da962bd-02c1-4b86-85b1-2fb0008ff248","year":2023},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:170297da9f9f0289e685f6f126fbd0667d8ac5ecc8931dbe26a74ddbf2a5aebc","observation_id":"c89d3def-6f17-4399-b948-96b57dd4cdd2","resolution":{"observed_at":"2026-05-23T00:55:16.312441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers.Advances in neural information processing systems, 37:124420– 124450","venue":null,"work_id":"025329fd-bbc3-42ba-a7fc-53f02d1b0c00","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:3a9b90565a97e0b6caa63d62503c8a55a0ad479cd6df903f17c42f7464599c88","observation_id":"cb79a703-0f18-4f42-98a1-aeeb83a394c8","resolution":{"observed_at":"2026-05-23T00:55:16.288434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.13441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.558223Z","title":"Yoon, Ryan Hoque, Lars Paulsen, Ge Yang, Jian Zhang, Sha Yi, Guanya Shi, and Xiaolong Wang","venue":null,"work_id":"5105d696-60c7-4b64-97d8-a65aa9cebde8","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:31cf6867d414f797684b0b821fd9da783fc69b97f0ce9d960391cb4a10362577","observation_id":"3d50fd9d-5e3b-4cb0-952a-97be883392f7","resolution":{"observed_at":"2026-05-11T13:16:08.396355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.670608Z","title":"Motiontrans: Human vr data enable motion-level learning for robotic manipulation policies","venue":null,"work_id":"bb3cd721-89ee-428d-a8eb-5fb9a8370219","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:0e68ad862302ea27f8718417e38dfeb245e9db34227b11d57c5fc4a4037b3b68","observation_id":"4755cc97-5708-49e9-8dca-17168b62fd32","resolution":{"observed_at":"2026-05-11T13:16:06.429467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T20:34:10.334821Z","title":"Egomimic: Scaling imitation learning via egocentric video","venue":null,"work_id":"e45a770a-2ff6-4cf1-a00d-2f5b3984399b","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:9d517c44b9b26f64fa09a0c0a44bab5ab8f7906da85b424d1591bed4396acd28","observation_id":"7937b644-b941-4356-bcd2-df922e597fe2","resolution":{"observed_at":"2026-05-23T00:55:16.331702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H-rdt: Human manipulation enhanced bimanual robotic manipulation","venue":null,"work_id":"fa379101-50ed-4521-b10f-f58efdcccf75","year":2026},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:9635b3c6615bfa39738f79fd6245148b651ad3333fdac5bc820184b83fb2340c","observation_id":"8d4a2651-15f4-42bc-a1eb-04dee57e9bbc","resolution":{"observed_at":"2026-05-23T00:55:16.294669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.689903Z","title":"Emergence of human to robot transfer in vision-language-action models.arXiv preprint arXiv:2512.22414","venue":null,"work_id":"88fc3778-faad-4626-887f-92a4c4e91800","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:a7aa3dd5343929656adfd6481afc1746192b47a4c6889b915709a682fc8f12f4","observation_id":"6d8fb046-556c-46e9-be0a-b1fbe130e3ea","resolution":{"observed_at":"2026-05-11T13:16:07.236383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2507.23682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-04T17:30:00.529444Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","venue":"cs.RO","work_id":"e4e687d7-64db-4ff4-8ddf-752b58365e0f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:cddf1ba47e39157ee5b9be2fbe643a000d4a7ffedd0f2f9f326ed437ccca750f","observation_id":"3f745101-a823-4be5-83b9-cdb676698249","resolution":{"observed_at":"2026-05-15T21:52:03.356882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-04T00:09:53.037371Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:c5d279e282f73ad8bad1ae8c9f0831a87c65fe3daf54f78aa40fbbe997cf8eeb","observation_id":"917c4e4a-4397-44a5-b114-89a12a9de230","resolution":{"observed_at":"2026-05-15T02:43:08.181865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668","venue":null,"work_id":"b6f952af-037e-4a7c-a21d-7c1e13f31862","year":2023},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:1958a8d4a3070c7483d6f0a5534c14d6fa7bef82f0ece9dd412ef602b40855b8","observation_id":"f1890f36-d6ec-4c7a-9d83-af517677c567","resolution":{"observed_at":"2026-05-23T00:55:16.301450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GR00T N1: An open foundation model for generalist humanoid robots","venue":null,"work_id":"0a3b42a7-580c-4c41-8bdf-d05fe57e42b3","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:b7e0287a2ddd8940683753491c19d33ecb1e4f15bfa25a2603ba0bdfde319cfb","observation_id":"3dd320a0-2997-49e8-9237-c029383ec624","resolution":{"observed_at":"2026-05-23T00:55:16.301691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:292fbfd342b7346c7b58d01e4d4ee166e3245cff056a51eff7d6fc39924c8b85","observation_id":"85c630be-2264-4386-b992-0b90a654b087","resolution":{"observed_at":"2026-05-11T13:16:06.332546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:122c2c8491f934ac897d18bc4d46acf769cace51ad4f027409e050ba327315ea","observation_id":"f28de25c-0206-48f6-b027-dd0c3d50928f","resolution":{"observed_at":"2026-05-11T13:16:08.135075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"02ce4a6d-75bd-4f12-b49d-0a1381c0e2ac","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:3484089080128cc18a1b41a5cc3797422af777ea217fb08ad76e803aef68c649","observation_id":"40814b7f-80a3-4c01-8466-ef1977bb4886","resolution":{"observed_at":"2026-05-23T00:55:16.307861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:b50c24ea599adb38d1a7ed3432bef24c829af33829ad80db1ca3eba4020d8c21","observation_id":"f790fcdb-cfdb-4753-b383-041c3fc6cb6f","resolution":{"observed_at":"2026-05-11T13:16:06.411602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Irasim: A fine-grained world model for robot manipulation","venue":null,"work_id":"176b8922-4600-4f1b-b56b-7a655199722f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:a111949975ec1c8812b8521d1602d8f34d9afcf900480e30db33d2681a5fa381","observation_id":"a8b0ca93-bf2d-49ce-b21d-07d8e659db62","resolution":{"observed_at":"2026-05-23T00:55:16.316014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2510.10125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-07-09T03:05:55.293884Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","venue":"cs.RO","work_id":"60c6a353-4bc6-4c87-8c39-372fcddd6ac0","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:1806267c3ee5738b632ae59547657a9059e965caaf2d7db0a90f51af6e8a67eb","observation_id":"a3352610-2cd9-448b-ac7b-882311ec358c","resolution":{"observed_at":"2026-05-16T01:14:10.607102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating robot policies in a world model.arXiv e-prints, pages arXiv–2506","venue":null,"work_id":"85629dea-ea7b-4f2d-a0d7-0e1eef4d1fbd","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:e1a9936fe35fa323559f6bbbce6726e9252a6e7127a339a3daab444f2e05e08b","observation_id":"688d63ad-e467-4662-87ba-7d9336c69662","resolution":{"observed_at":"2026-05-23T00:55:16.288026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"553e0a24-5cff-4f17-83b7-f499fb6319cd","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:b5187eed9aa42d3c2da1bd8603b472bad15069c0637ab082a1eae5236e7d5348","observation_id":"8f1363ec-75f8-4c22-9654-d09248753e68","resolution":{"observed_at":"2026-05-23T00:55:16.297728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:80d06834c2af84f3b3900c36cfb5ae4b4dd9dbc0c22764344fdea7eb26f7b971","observation_id":"492bfc13-402e-479b-9fa7-bb8c9ab1f003","resolution":{"observed_at":"2026-05-11T13:16:06.381674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:d4059add1e74657c2dc4938003e10e3d9c3419d1d059675b608b73e37128b226","observation_id":"5540b4c6-69d3-4d25-ae99-7d8fedacc510","resolution":{"observed_at":"2026-05-11T13:16:06.635328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":"9ece093d-6825-4648-b857-18f7bf80ab30","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:cb1733e4b0d853b2606cd77af44dcaf7a5d8e0d392278a3685d907243cfa665b","observation_id":"d4307745-7156-4dce-963d-bf98539f465a","resolution":{"observed_at":"2026-05-23T00:55:16.291557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":"2505.11709","doi":"10.48550/arxiv.2505.11709","metadata_source":"pith","pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","venue":"cs.CV","work_id":"4190fb9c-70e0-4388-aa0b-516589489047","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:331de210f2b00bceb59345767c40ba9d8af98717abb35bea28cb83f7d51145ac","observation_id":"9b86e82b-6ba4-45b0-829e-992564c61c39","resolution":{"observed_at":"2026-05-15T15:40:29.471447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1babd61d-95f8-44a8-a115-5e786fe8a1dd","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:be31e7b0675a855fc6dd7c07b4a40e30bd08e8e32a50d48ed4196f1fcc4ea672","observation_id":"fbb87755-cbc0-4eca-9280-e3e130407600","resolution":{"observed_at":"2026-05-23T00:55:16.304452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":"2503.00200","doi":"10.48550/arxiv.2503.00200","metadata_source":"pith","pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified Video Action Model","venue":"cs.RO","work_id":"fb4cc512-d1d9-40f4-8854-d35950ad20b3","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:20e84797ebcba9a6e4f71c337bdaea9f9e5ba0907dc323143b487a2cfb1c10ca","observation_id":"bc86a0b5-7eea-4a21-93c0-d2fff2ce05bb","resolution":{"observed_at":"2026-05-13T17:50:29.857677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:81fe3c2650e9ddb208034f17d4bb87b7b8f375610ac162e9b939c133b6c1af9f","observation_id":"7dc2e050-210e-461b-b4fd-77560b2a8d9b","resolution":{"observed_at":"2026-05-17T15:59:09.111136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gr00t n1.6: An improved open foundation model for generalist humanoid robots","venue":null,"work_id":"a4a62a4a-4f10-41a7-b8c7-06b20b1c0e7d","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:e5492b04e633d598490dd9e398a6765873aa542150b1e0fb9013778bec3defb2","observation_id":"164c6f60-bc90-4179-9ea1-e0f34c947305","resolution":{"observed_at":"2026-05-23T00:55:16.322223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.568638Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"ffd7b63b-f3e1-48da-bdd1-24909a005ca5","year":2018},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:6562bb3c4d5af29beb6664568f9a3dc794c21507d8e0b427f309cb0a3f679eba","observation_id":"c87f46d5-739c-4bba-8a25-2c8e01b52247","resolution":{"observed_at":"2026-05-23T00:55:16.325358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.823088Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"bff3762d-6c6a-4b69-a92b-f3cdc2df44be","year":2019},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:0cdc1f940a613fc3f58f1a1ff4a6d4582009d9a33d419d56251d57f57c8392ae","observation_id":"a6d71584-fc36-4343-9429-1f1be4752512","resolution":{"observed_at":"2026-05-23T00:55:16.328324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using t-sne.Journal of Machine Learning Research, 9(86):2579–2605","venue":null,"work_id":"b5df6a63-14ea-4573-9777-582d0001b120","year":2008},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:1573111e514180dc4938b91783155c2196efb4a7c56424bf888361eabd980ab6","observation_id":"066c18cf-7214-4859-9f6d-68137d998ca8","resolution":{"observed_at":"2026-05-23T00:55:16.309048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":24,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2604.19734."}