{"as_of":"2026-08-11T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f7bcf8b48840e7b7105ffcff987329eb1e87e0a2e622dfe51c6aeed9e84f652","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:09:33.761708Z","state":"measured"},{"denominator":171,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":171,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":169,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:45:08.187972Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:49f4795fb1e3176c4364b3ce53f12df66ae0e53d593e2f44ff76ff4129a24b87","observation_id":"939f2fcf-40a1-4df2-8026-e1512e961037","resolution":{"observed_at":"2026-05-12T07:33:25.455226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-11T16:45:08.187972Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09858","last_updated":"2024-12-13T04:57:55Z","snapshot_observed_at":"2026-08-11T16:36:38.291286Z","submitted_at":"2024-12-13T04:57:55Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:08.187972Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2412.09858"},"observation_digest":"sha256:f1b7dbd23734b4bd63652631ef347e8f1e8d51a2f1587a5e57f07659079fb531","observation_id":"71da2607-7bd9-4001-9cb3-c3a03890cc6a","resolution":{"observed_at":"2026-08-11T16:45:08.187972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T22:14:17.798964Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2412.13877"},"observation_digest":"sha256:94df9a4680e9352c59af7bf899db57fdd20a97e5c82998c0632a158a75cb7a90","observation_id":"fa15a85a-a35c-42c0-844f-70c1165c7a25","resolution":{"observed_at":"2026-05-15T22:14:17.902796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:f48b1018947deded85b2c77baf5561b4218ba850a3ef54372b34c6d601866adf","observation_id":"9418149c-13e5-4fdc-84d4-6477d619c478","resolution":{"observed_at":"2026-05-17T21:37:50.712601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:251918ae9d6351ada04568381089e3f4a3c86b525bb5c2d6433e1503e115f444","observation_id":"0d1d4298-c3d0-4f38-b305-c9920570d619","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:3f1b7e3b9cfc14cda4021ca402442e1cf32a0d1dda403e00f3f53800a4aaefee","observation_id":"fc482c4c-3273-44e8-85fd-cce4d26bac5b","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-10T19:29:39.712076Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-11T00:27:34.812297Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:39.712076Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.10105"},"observation_digest":"sha256:067597cf97b0afe93fdc4260f6ec1db9fad9eae259f758b4977f9c349e3cadbd","observation_id":"604bd5dc-71fd-48c2-8d4b-e9ac1705d730","resolution":{"observed_at":"2026-08-10T19:29:39.712076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-10T18:53:00.991440Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.991440Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:ff9d0c6c8e8dc4d2403a99ab78d0127d6df905764283d111535ce8b8219ec425","observation_id":"bbe0baee-a21d-480a-ba10-a40440c467dc","resolution":{"observed_at":"2026-08-10T18:53:00.991440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:19d225049f4724faf1774acb84f1ccc0fd0a341ce68fe49a7777fabc33c55669","observation_id":"a654762b-eda9-4afb-b248-92a2a0f8a95a","resolution":{"observed_at":"2026-05-12T06:12:19.883534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-09T15:36:48.634944Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01366","last_updated":"2025-06-09T11:09:01Z","snapshot_observed_at":"2026-08-10T17:47:42.273196Z","submitted_at":"2025-02-03T13:59:08Z","title":"Trajectory World Models for Heterogeneous Environments","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T15:36:48.634944Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2502.01366"},"observation_digest":"sha256:7557ae8233b437239df82f81927ab9a3704d7bcc76123fe8f2bff201bdee78a8","observation_id":"a6ddb56b-d85b-4a29-a34b-bd2e55e2a666","resolution":{"observed_at":"2026-08-09T15:36:48.634944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-09T10:56:57.571437Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02853","last_updated":"2025-05-13T03:02:42Z","snapshot_observed_at":"2026-08-09T21:37:24.641188Z","submitted_at":"2025-02-05T03:13:04Z","title":"Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T10:56:57.571437Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2502.02853"},"observation_digest":"sha256:9f954187a6360fe5d8f8c3b045b16aceff286f9d525a04f78865b990a4de5897","observation_id":"eb92019f-2fa3-4549-9c74-070073dbd8d9","resolution":{"observed_at":"2026-08-09T10:56:57.571437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-08T13:35:17.892459Z","title":"Cheang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-10T09:13:42.731986Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.892459Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:3de78805655f2f6edaa5057f430ebe50551add374508dccead046f39be3b8b96","observation_id":"d8444895-aa39-440a-81df-09e0df18a715","resolution":{"observed_at":"2026-08-08T13:35:17.892459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-08T00:05:05.608402Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08645","last_updated":"2025-02-16T12:14:53Z","snapshot_observed_at":"2026-08-07T23:54:52.248553Z","submitted_at":"2025-02-12T18:59:04Z","title":"Re$^3$Sim: Generating High-Fidelity Simulation Data via 3D-Photorealistic Real-to-Sim for Robotic Manipulation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:05:05.608402Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2502.08645"},"observation_digest":"sha256:07e36740f6f9828b9a0214a3dcc163f236b408c58e26a30a4ef72ded7531d12f","observation_id":"02dd43f7-c83b-4d07-8567-a89caba4d63b","resolution":{"observed_at":"2026-08-08T00:05:05.608402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:e10ab8450f2ac677200d839cdeae6d05bee909c702bbb3dbeff8be683cfda81f","observation_id":"c2325beb-aeb7-41bb-ad5d-4ed4d96d3e51","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:6f0097da4112f7a9db9b16bb293cd826f63b333d2552369b4dff1a173ce98e52","observation_id":"49d0c939-2b4a-4ed6-a0f2-31cb3d6ca508","resolution":{"observed_at":"2026-05-16T05:21:45.217988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:fd7d7a5e86ff5398964b181da37e5370350e4449520d6ab97011ad2e4aee44e7","observation_id":"c6e23427-a530-41bb-980a-4fb7e5c805d6","resolution":{"observed_at":"2026-05-17T20:55:52.341346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:cc52f219a71c12244e4db9303ff487801b36df2ebee6a5655b06150dcddef193","observation_id":"c98000b6-9851-4c6b-b8eb-892195b29495","resolution":{"observed_at":"2026-05-15T23:50:45.527387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T15:42:07.249927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14235","last_updated":"2025-05-20T11:42:26Z","snapshot_observed_at":"2026-08-09T06:17:38.740164Z","submitted_at":"2025-05-20T11:42:26Z","title":"Toward Embodied AGI: A Review of Embodied AI and the Road Ahead","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:07.249927Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.14235"},"observation_digest":"sha256:7f7f0f75e4d7268fa0a0781a6d01de830b8200e2df1fcbabdb4896944848aabe","observation_id":"371321d0-6505-4559-9a2d-8c866389aa0a","resolution":{"observed_at":"2026-08-07T15:42:07.249927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-08-10T09:12:51.490663Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:2144c5b042de89991d9a5eba0cbd7b1d523fc2f0d669b4c60546803e50e361e7","observation_id":"dd1f52a4-92e0-4d3f-9706-7bd8a79e4e69","resolution":{"observed_at":"2026-05-17T15:59:09.002921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T14:56:32.880004Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-10T19:26:19.974283Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.880004Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:ec0b7e1347ee992cd4ce8195d33a21203a580b831caa2c6eb7b556d2c3802186","observation_id":"24bbbd95-4594-40e9-8c1b-be99106b09b0","resolution":{"observed_at":"2026-08-07T14:56:32.880004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T13:42:59.173764Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.173764Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:ba2aadac867627a2c8830166aac34f6266d5804bd86d6a1d19120046dd087a9f","observation_id":"b38532cb-ba0d-403a-a6c3-4d68fef0db36","resolution":{"observed_at":"2026-08-07T13:42:59.173764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T12:11:50.945418Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-11T17:52:28.036411Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.945418Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ec58aa723b9522cec3c07dfce92a9c42ad1df72d35139bc1e9662cf0014603d4","observation_id":"95e8f96c-6bd4-4f52-ad50-8481b3b626d0","resolution":{"observed_at":"2026-08-07T12:11:50.945418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T11:05:37.624131Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03574","last_updated":"2025-06-04T04:45:24Z","snapshot_observed_at":"2026-08-10T01:28:05.565563Z","submitted_at":"2025-06-04T04:45:24Z","title":"SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:37.624131Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.03574"},"observation_digest":"sha256:84959d09048728fccc8240273751f753aa3ba8c3fe897fabb285ec69094db80d","observation_id":"46dac9a9-e6ef-4c9b-9cad-84e4d1079bce","resolution":{"observed_at":"2026-08-07T11:05:37.624131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:45cbb0cd25c2ef1f4ad6f1c71cea5c40cc00f8e6bb43335aa101de0b2ea4002e","observation_id":"01f3c103-744e-4601-8a31-d7da21894728","resolution":{"observed_at":"2026-05-15T14:18:51.785756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T05:23:30.399877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08228","last_updated":"2025-09-08T00:53:59Z","snapshot_observed_at":"2026-08-08T23:02:54.953752Z","submitted_at":"2025-06-09T20:54:23Z","title":"Scaling Laws of Motion Forecasting and Planning -- Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:23:30.399877Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.08228"},"observation_digest":"sha256:1701f6ef1f894476afe43a7b978158cbc3db1bbf751853b38cc8e8752fd18657","observation_id":"6be3951c-9154-4f5b-a981-bf788e1bd5ae","resolution":{"observed_at":"2026-08-07T05:23:30.399877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T04:50:52.057995Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09623","last_updated":"2025-06-11T11:28:14Z","snapshot_observed_at":"2026-08-10T03:18:10.561885Z","submitted_at":"2025-06-11T11:28:14Z","title":"Analytic Task Scheduler: Recursive Least Squares Based Method for Continual Learning in Embodied Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:50:52.057995Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.09623"},"observation_digest":"sha256:a1b920cd058da03698092612dc3e2ed31ebe2547494b7936ec6e9303fe6d1e82","observation_id":"9d7ab69f-7459-4c38-8c22-54fbacc7952c","resolution":{"observed_at":"2026-08-07T04:50:52.057995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2506.09981","last_updated":"2026-04-28T09:28:14Z","snapshot_observed_at":"2026-08-02T12:46:46.614409Z","submitted_at":"2025-06-11T17:55:05Z","title":"ReSim: Reliable World Simulation for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T09:28:00.597160Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.09981"},"observation_digest":"sha256:b15e71b8658d05621fc28a0b61a2ad65776b0671c4fde824ac8c87dee77c72d4","observation_id":"bfe90d72-9fec-4ea2-9b31-73ae96cec333","resolution":{"observed_at":"2026-05-19T09:32:16.666959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T23:11:17.292943Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19269","last_updated":"2025-06-25T05:10:04Z","snapshot_observed_at":"2026-08-06T23:04:37.298588Z","submitted_at":"2025-06-24T03:03:26Z","title":"AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:17.292943Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.19269"},"observation_digest":"sha256:a135d09b044ec1ff5e0695ee0a6137e1f2678b181f0bfe0ace94161f64dfaf35","observation_id":"7ec13d52-da31-4ccb-9917-c8efb31e6db8","resolution":{"observed_at":"2026-08-06T23:11:17.292943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T23:12:05.111915Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.111915Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a69f3852dfbdd6aba4a0b7b081a6962963d39266a2cba442eed5799034176302","observation_id":"74e98e85-7c9f-4150-862e-1c6478143aa8","resolution":{"observed_at":"2026-08-06T23:12:05.111915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-10T07:22:51.573401Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:3923c9615e2615f08f4fcfc000dc42a0e204d8c90aa271ecd4763c3d2f5317a8","observation_id":"326aedce-c969-49eb-a43f-14627f5503f2","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T21:09:05.729636Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00917","last_updated":"2025-09-03T01:44:58Z","snapshot_observed_at":"2026-08-06T21:00:05.983801Z","submitted_at":"2025-07-01T16:23:00Z","title":"A Survey: Learning Embodied Intelligence from Physical Simulators and World Models","version":3},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-08-06T21:09:05.729636Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.00917"},"observation_digest":"sha256:69ddb989168f82ac18796a84e0db7da0f93a29bf17b54beaaaf0a77ee24eb590","observation_id":"c5e4d021-8b86-4a0f-91c0-7a05e508d76b","resolution":{"observed_at":"2026-08-06T21:09:05.729636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T21:07:22.569402Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-09T23:56:27.855428Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.569402Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6a0d7cfcdaec29541fab2ed268c5c2da416d139ebdc78414def9fdc93ff83d80","observation_id":"d43c688d-cb8a-4c24-815a-9141f9a3bea3","resolution":{"observed_at":"2026-08-06T21:07:22.569402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:4cf16f0c49cb94b7bf5a44822b91aef022f42d300267a8c2d41fcfd8dfb887ca","observation_id":"88eee43d-281d-4d61-b201-fb9be1880757","resolution":{"observed_at":"2026-05-17T14:08:35.273510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T20:45:30.281065Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01961","last_updated":"2025-07-05T04:00:38Z","snapshot_observed_at":"2026-08-10T01:55:43.777323Z","submitted_at":"2025-07-02T17:59:54Z","title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:30.281065Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.01961"},"observation_digest":"sha256:64aa337a527ed2d958a87d307a726c74b05b3b5279a1798e6886014bc7537b4e","observation_id":"8eeac56f-b0ab-46a0-ac26-360dd6c6c23f","resolution":{"observed_at":"2026-08-06T20:45:30.281065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:e67c4945a51c0e955347df11aea53e3a8ecfa8546a0d81a393ef32bcba42c6fb","observation_id":"53ce3f98-e0ed-4b1c-8840-5b64511bde7f","resolution":{"observed_at":"2026-05-16T15:42:41.436739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T19:17:10.940685Z","title":"GR-2: A generative video-language-action model with web-scale knowledge for robot manipulation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06219","last_updated":"2026-06-04T12:51:16Z","snapshot_observed_at":"2026-08-06T19:05:59.771681Z","submitted_at":"2025-07-08T17:52:44Z","title":"Is Diversity All You Need for Scalable Robotic Manipulation?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:17:10.940685Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.06219"},"observation_digest":"sha256:4a8662d2d84a86c26aff9d9fa4b6472e5a82aa34f06c12b13d9ba3c234c9d6b5","observation_id":"0f6cb723-6265-49bd-96ab-e3c0fb3182a9","resolution":{"observed_at":"2026-08-06T19:17:10.940685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T19:14:30.472359Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06224","last_updated":"2025-07-08T17:57:03Z","snapshot_observed_at":"2026-08-10T09:34:20.444155Z","submitted_at":"2025-07-08T17:57:03Z","title":"EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric Flow","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:30.472359Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.06224"},"observation_digest":"sha256:28872351724dc70312c7cf09adec69f5b5511edbf684d608c15f6b8aa3e810f5","observation_id":"127bd5ac-8728-4d62-8040-0de9ecd378db","resolution":{"observed_at":"2026-08-06T19:14:30.472359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-11T02:06:57.830766Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:90a53dd69384b680c7e901e4cacb07f8bf0d3e10d37d354ff410b62e15ec77aa","observation_id":"410b8cb8-e57d-4839-9281-21db122a0a85","resolution":{"observed_at":"2026-05-19T03:52:57.544944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:490383c2189b09e85b08e66bbcb15d859296b45f08930e05bba8ff42cb53513f","observation_id":"3fd71bcd-4126-4639-a489-df9b1984b346","resolution":{"observed_at":"2026-05-17T08:04:12.687590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T14:57:34.079434Z","title":"Cheang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17294","last_updated":"2025-07-29T12:31:26Z","snapshot_observed_at":"2026-08-11T12:41:19.946326Z","submitted_at":"2025-07-23T07:54:10Z","title":"VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:34.079434Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.17294"},"observation_digest":"sha256:2f3a3be8a982d6eff25fa327cb0df96e7a079fb5c2fcd90ac1579a3dab1c97dc","observation_id":"368ff7d1-664b-4688-9812-1998d46451f2","resolution":{"observed_at":"2026-08-06T14:57:34.079434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T12:39:37.917854Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-07T04:25:49.997139Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:37.917854Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:801d83f0af5d26b415739c3e9a4f7646ff80db14b4273d1ea8e8487be5aafa4c","observation_id":"586916b1-9c11-4d27-9b30-2cb73d4aff15","resolution":{"observed_at":"2026-08-06T12:39:37.917854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T21:43:37.162870Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.00795"},"observation_digest":"sha256:9b88563e4a2c39ecb6f51be3800df13590afd51d23e02694f3efdfb6b6ddcd0d","observation_id":"a754cb24-dfa2-4b2d-a1d8-0a9e118bdbbc","resolution":{"observed_at":"2026-05-15T21:43:37.301332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T21:59:01.047936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-05T21:58:58.897913Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.047936Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:44ba83a12784b4e86776f96558e1b737526ee8fe81a22f5f5fd944bb2015c4ca","observation_id":"c99be82a-8dec-4b14-9ead-6d31a1e9b659","resolution":{"observed_at":"2026-08-05T21:59:01.047936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T20:50:28.898609Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09827","last_updated":"2025-08-13T14:03:10Z","snapshot_observed_at":"2026-08-10T02:26:33.673702Z","submitted_at":"2025-08-13T14:03:10Z","title":"Time delay as the origin of oscillations in anodic Si electrodissolution","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:28.898609Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.09827"},"observation_digest":"sha256:99dcc3a177839cce882dcca07e7d1a9c6fc18416f861ed93cfb1b3d4bac168c6","observation_id":"b7bcd2b4-7d39-453c-8bd1-836226b29e87","resolution":{"observed_at":"2026-08-05T20:50:28.898609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T14:42:32.575554Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.575554Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:7b0919604efaebf7e199c22c0798f4245e8a93345d3cdb66c7e16e4dcf36671c","observation_id":"1f28b881-4803-4a69-a153-860e9e1cc6ee","resolution":{"observed_at":"2026-08-05T14:42:32.575554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T13:46:42.481513Z","title":"Cheang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00361","last_updated":"2025-08-30T04:53:32Z","snapshot_observed_at":"2026-08-09T09:27:18.513708Z","submitted_at":"2025-08-30T04:53:32Z","title":"Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:42.481513Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2509.00361"},"observation_digest":"sha256:a92419ca457651c9a48a33d5b06153eb0f78128f45939ab2feca234bc424eef9","observation_id":"b69a492f-c3ad-4efd-8d90-333674e1472f","resolution":{"observed_at":"2026-08-05T13:46:42.481513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T11:41:25.735930Z","title":"Gr-2: A generative video-language-action model with web- scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02322","last_updated":"2025-09-02T13:47:54Z","snapshot_observed_at":"2026-08-09T22:49:23.672160Z","submitted_at":"2025-09-02T13:47:54Z","title":"OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T11:41:25.735930Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2509.02322"},"observation_digest":"sha256:9d9e734b916dcca8cd77dbafc5caff239a6052036a69a4674ca7320b8e964013","observation_id":"80d21dc2-8b78-46d1-acae-9c4e192cad86","resolution":{"observed_at":"2026-08-05T11:41:25.735930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T11:00:38.085472Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03383","last_updated":"2025-09-03T15:00:28Z","snapshot_observed_at":"2026-08-08T06:25:51.743398Z","submitted_at":"2025-09-03T15:00:28Z","title":"ANNIE: Be Careful of Your Robots","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:00:38.085472Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2509.03383"},"observation_digest":"sha256:26f59e84a3b8682332ec8d2766c1f9465aaa5c28ecc86873136a997473b27129","observation_id":"e07360b3-d48d-48bb-ada4-0936878f2ed4","resolution":{"observed_at":"2026-08-05T11:00:38.085472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T11:38:11.692188Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-09T06:57:01.817389Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.692188Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:29ff78ff70118e1453ce38e628c614bd10470f21e0d4c9003d3599e1c5b9c30d","observation_id":"05fd20a6-dd03-4bbc-9684-6b345a15f7fa","resolution":{"observed_at":"2026-08-04T11:38:11.692188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2510.08547","last_updated":"2026-04-29T08:33:26Z","snapshot_observed_at":"2026-08-02T09:22:46.822482Z","submitted_at":"2025-10-09T17:55:44Z","title":"R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T08:46:51.278024Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.08547"},"observation_digest":"sha256:3f8a6ae7fe19d83bd6646d1ffad82635308cc5a620b780343cf77cce6fb7f85e","observation_id":"9a6b3d53-f35f-4db1-94f0-717918725f95","resolution":{"observed_at":"2026-05-18T08:51:09.094307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T09:34:41.373666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-10T16:19:25.458359Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:41.373666Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:0645faa9b4c8d97231e27e4bad94c149b5dc979f7cb3221fb96189f7e82e51e7","observation_id":"c303c05a-5946-46f5-9ef9-266b8c1e57c2","resolution":{"observed_at":"2026-08-04T09:34:41.373666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T09:08:08.084135Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:08.084135Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:119703a253593412c55fa085005a6784d5c1056efebcaa8633eabd9ba2956c95","observation_id":"b5eee9cb-bc7b-4867-aa39-3256c67d8e44","resolution":{"observed_at":"2026-08-04T09:08:08.084135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T07:00:45.901236Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:45.901236Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:35a214d4694cd373e23820b9ad3e63ee0aa869138a75382c51515c1ae001e909","observation_id":"6df8e2d7-5b34-4efc-bbd4-3b7d601b151c","resolution":{"observed_at":"2026-08-04T07:00:45.901236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-11T16:36:50.457486Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T01:05:01.553811Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:fcfbd0a52cea456284e5936deee376c879d2a752b1e9f7c16ba372e00a4c39ec","observation_id":"29b1e0fd-6614-488a-87d7-1198111f46ab","resolution":{"observed_at":"2026-05-18T01:05:33.801038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T00:10:02.038513Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-11T16:36:50.457486Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.038513Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:dbcff6d49b1452e95a87981f6828fc57668e46df349067c4b59fdb39f19ac0a9","observation_id":"a6b38cc4-616c-4007-9599-7213a9cbc1d7","resolution":{"observed_at":"2026-08-04T00:10:02.038513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-03T20:59:50.487718Z","title":"GR-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:50.487718Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:e0cea239bc5852cc87859da75a837eefb445a3333d352052cb86f838fa1067ee","observation_id":"9cc3191a-57ef-440e-928c-cd04e9b565ed","resolution":{"observed_at":"2026-08-03T20:59:50.487718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-03T19:11:42.853298Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01715","last_updated":"2026-07-01T14:29:04Z","snapshot_observed_at":"2026-08-11T01:23:42.659830Z","submitted_at":"2025-12-01T14:21:15Z","title":"Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:42.853298Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2512.01715"},"observation_digest":"sha256:fc6e350cb031828b7008d9b7875e3d82c3f7491e0028033944a091339c443cab","observation_id":"9a048972-d77f-4733-99e5-186f1e0bdedc","resolution":{"observed_at":"2026-08-03T19:11:42.853298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-08-11T00:28:59.148492Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:a082b7cea9965abf38724d99942f89d9cad18651982fb37e4f29b99f8b60eb37","observation_id":"9f5a139d-437e-4269-8eae-14788252d343","resolution":{"observed_at":"2026-05-16T23:01:20.391335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:30e4d79436d24297f872eb9c2acf41e45ba30f0c16a71d860600261d2ec6ea11","observation_id":"d4dd7a13-477e-4674-b918-b269d633eca4","resolution":{"observed_at":"2026-05-16T19:28:20.760419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:19ebf6bf441429817c61b0d73243885f4cf99c240ec057487d9b74f2951a3eb0","observation_id":"485c0a13-a128-414f-a4cd-726f972065b4","resolution":{"observed_at":"2026-05-16T15:08:01.714240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:9a4ef388a4b7d5bde3763ba79546b86d8b4a8f77afe7f7e531211f4fafa0d39a","observation_id":"e838f07f-1b58-47ff-8154-a40dfbe6f4d1","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:412e13830ec2c840005de152ee63c24b69e65c339ebe73186264494b09da3f5b","observation_id":"1473e9a7-a850-4d5e-9eb7-2eabd6112025","resolution":{"observed_at":"2026-05-15T20:20:17.653988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T20:18:04.300469Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-11T03:44:58.958471Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.300469Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:9f9ebe2dbecc92ef008cfb0a14cda5bb780dc9566333d41f0ac2c2d438304c9c","observation_id":"f064819c-76c3-44ea-82c3-1336c4c75be5","resolution":{"observed_at":"2026-08-02T20:18:04.300469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-08-10T22:29:48.430468Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:0349bc28180969a49e09fac6cc14c655c32f6b47be32c2e698b52d8b84c27360","observation_id":"ea1abddc-40df-49e0-a190-6f5c6410a8b7","resolution":{"observed_at":"2026-05-15T21:30:20.887158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:694d1ce3e9df07b789ec8f086a079c3338ca226a04610e95dfcacc9f0007571d","observation_id":"525b26c0-04ae-4b24-aa52-120a0c2d6713","resolution":{"observed_at":"2026-05-15T09:49:54.536283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T01:57:29.753735Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2603.16666"},"observation_digest":"sha256:9f1839f7c6cc52ac08122c80505994c58b4318d70c85b01517fbc6088e9ee88b","observation_id":"224bb51b-4ca3-4e17-b486-7da2341838a3","resolution":{"observed_at":"2026-05-14T01:57:30.135077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T17:54:04.264928Z","title":"arXiv preprint arXiv:2410.06158 (2024) 2 16 X.Wu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-10T00:39:51.221084Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T17:54:04.264928Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2603.19235"},"observation_digest":"sha256:f52b2ee2daabe338fd52b0f2767b5292b44bc07c5f520992a73601216df8ee99","observation_id":"31c6fc7b-9d62-4de1-92cf-f095e6b3c5cc","resolution":{"observed_at":"2026-08-02T17:54:04.264928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-07-13T14:05:26.303000Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01985","last_updated":"2026-05-29T16:27:50Z","snapshot_observed_at":"2026-07-13T14:05:19.455452Z","submitted_at":"2026-04-02T12:48:36Z","title":"World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T14:05:26.303000Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.01985"},"observation_digest":"sha256:b6cae128b6f5f2674792978d42d6e8cfe53e37516ca55302e3b6fc6939377249","observation_id":"2c92e281-012e-4baf-8358-cc1ca07863d0","resolution":{"observed_at":"2026-07-13T14:05:26.303000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.03181","last_updated":"2026-04-03T16:57:06Z","snapshot_observed_at":"2026-08-11T12:51:27.052380Z","submitted_at":"2026-04-03T16:57:06Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T18:54:07.081457Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.03181"},"observation_digest":"sha256:2fc2adb0865f1e7828b24bf6ebf1d1ac088c0ca6f0c9a994ea0eeafd40d4e95f","observation_id":"64aca153-c709-4421-8759-fe5fe7bc754a","resolution":{"observed_at":"2026-05-13T18:58:08.868507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.04974","last_updated":"2026-06-03T17:05:28Z","snapshot_observed_at":"2026-08-05T03:49:14.637609Z","submitted_at":"2026-04-04T15:37:11Z","title":"From Video to Control: A Survey of Learning Manipulation Interfaces from Temporal Visual Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T17:02:18.358675Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.04974"},"observation_digest":"sha256:4c51fb091602bb2e57c54c680ae685c85ec60944b1136c9434bed866999143ec","observation_id":"8a7c097c-feda-44a4-949d-af339ece0be9","resolution":{"observed_at":"2026-05-13T17:03:01.191166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-08-11T06:36:11.033845Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:db52d8a0b52dcd26fc6473c98e3821cd6cebed111e6e730eb06d42b26c424f0d","observation_id":"0b05b596-6a27-44ba-9aa9-ca3441554943","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-07T08:51:57.871195Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:ef6c810762d583e890448df2fa20f5c09b6470d0f5bd8c84aa1eb4b20b0a8f63","observation_id":"1b020702-8eba-4d81-97f0-0122d24b5898","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.08544","last_updated":"2026-04-10T10:13:54Z","snapshot_observed_at":"2026-08-11T15:34:36.916366Z","submitted_at":"2026-04-09T17:59:52Z","title":"SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T17:13:04.878923Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.08544"},"observation_digest":"sha256:94b6075df306aa109012a6054b9255f1fd0d53b50ad0d5d8a7727433631c1f88","observation_id":"3af0af38-378a-4cf0-9628-184a4d5cc607","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.09330","last_updated":"2026-04-10T13:59:54Z","snapshot_observed_at":"2026-08-11T07:36:40.695017Z","submitted_at":"2026-04-10T13:59:54Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:31.378588Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.09330"},"observation_digest":"sha256:a2557465e63f56b9046616cc50680a5602236ed4b53a77e1abfb5607ec384a49","observation_id":"9da4db36-6c76-4929-b26a-199d50fa8edf","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.10170","last_updated":"2026-04-11T11:36:16Z","snapshot_observed_at":"2026-08-11T09:37:01.255223Z","submitted_at":"2026-04-11T11:36:16Z","title":"Device-Conditioned Neural Architecture Search for Efficient Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:17.595703Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.10170"},"observation_digest":"sha256:ea01998c5954aeb0539962beb898530a876a7cddd1db1b839b98bf0ee2ba6562","observation_id":"467ae8fd-660d-4e7d-921a-f3becf43a469","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.11386","last_updated":"2026-04-13T12:25:45Z","snapshot_observed_at":"2026-07-06T22:59:49.614780Z","submitted_at":"2026-04-13T12:25:45Z","title":"ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:29.558490Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.11386"},"observation_digest":"sha256:02a7bbfe5e559774cf64e82b6fd0abad0b999a3a72f79994218b48b873916fbf","observation_id":"7745e842-42d2-4364-8def-827e50012805","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:d59734d23ad9e4c2c26870e79c692bb05bd5e12e3b27060bed3288356fc17f37","observation_id":"bd0a1c43-44db-47e6-97de-f46d4502d24d","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:cfafc3c1c17e369edfc4ea205a6e0492bda2f0ccdafbbfdb806b5dbb994a84c8","observation_id":"c96b2652-88f5-40c4-ba0c-abfc23f58041","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:7613f6aff76666ab20f4270f5e2ba18e27bfb64943c70f6c877b25dcaf7e1080","observation_id":"a0b35e68-5302-41bf-9c25-4a6ca57c5e99","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.17862","last_updated":"2026-04-20T06:19:30Z","snapshot_observed_at":"2026-08-11T14:50:36.714474Z","submitted_at":"2026-04-20T06:19:30Z","title":"M100: An Orchestrated Dataflow Architecture Powering General AI Computing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:50:06.986471Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.17862"},"observation_digest":"sha256:7d3f05b5aded1f32734b5ab5b8397c67f60c96ffbb231c81471310e8d7a8a353","observation_id":"5e9a00a5-00b6-481e-b19c-fb0b53e84d95","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.17887","last_updated":"2026-04-20T06:57:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T06:57:55Z","title":"StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:45.903419Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.17887"},"observation_digest":"sha256:7beec7ed4965636bd76b8b5478a409d23e81ec4f0180a8697b4e468f03b8be7c","observation_id":"0c50f298-35b7-4fca-bdd2-a363c430bc6a","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.20246","last_updated":"2026-04-22T06:49:12Z","snapshot_observed_at":"2026-08-11T12:43:05.147977Z","submitted_at":"2026-04-22T06:49:12Z","title":"Cortex 2.0: Grounding World Models in Real-World Industrial Deployment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T00:52:05.348704Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.20246"},"observation_digest":"sha256:a66e6362865011f1539699ec5950fcc9f76428f61b67b78e3a7081e25359178f","observation_id":"5f4596ca-8680-4a9a-9359-7e116c10c0c4","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:8d7f3260155c11ca778a5a877dde0fa3c8abe679800b2720febc203cee2a1ed7","observation_id":"dca35df8-43a5-4d03-a98c-fdff7984f6d8","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:484871b78c6e7c2545f08fbee2abe0589f201e30bf02743c7af790774e4b168a","observation_id":"7a9cd68f-5c53-44dd-97c5-3e1e97644997","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-11T14:08:07.800301Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:005245f91cb2a1ba28c24c683b8435e23bdd314032d3343c2ea0a531ae3710ee","observation_id":"d41e0369-b592-467f-9508-0e51d3ae119a","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:1eae7f637c4e00e1d4103a8959a4caf0ee5d4fb73312143a606e1b500325516c","observation_id":"4d3ac599-5a6f-4ecd-ade8-ec4dfe477813","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:79be0d67e3769da67fe78dabbef76214cbef914c156ab8a5df8c4714b2028371","observation_id":"33dcb4f0-4aaf-445b-bc5c-634516bcc4b5","resolution":{"observed_at":"2026-05-22T11:21:29.167222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.25859","last_updated":"2026-05-02T20:40:07Z","snapshot_observed_at":"2026-08-11T10:33:33.290444Z","submitted_at":"2026-04-28T16:58:52Z","title":"Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T15:42:10.954090Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.25859"},"observation_digest":"sha256:46d43546768369233ebc274d149ae9ba4f68251cb11db470c459980148e41401","observation_id":"125432a8-ce2d-4373-83d4-7786ef498517","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2604.26565","last_updated":"2026-04-29T11:51:35Z","snapshot_observed_at":"2026-08-10T21:10:06.962801Z","submitted_at":"2026-04-29T11:51:35Z","title":"DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T13:50:23.835653Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2604.26565"},"observation_digest":"sha256:069f9d10ee2b1eb7a9eb0c8f5e46d17bf21bf5a44aaa56e0ede1c9a15edd0d53","observation_id":"af2fc661-27fc-46ad-96db-31a4c56b5248","resolution":{"observed_at":"2026-05-12T08:46:26.015629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:07a1202442388726ac98c5351768f0e175148646ad24ec895230f5bc21ceb462","observation_id":"d58a3187-12f5-46a6-a5a5-36cb28827e9f","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.02130","last_updated":"2026-05-04T01:19:36Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T01:19:36Z","title":"From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T17:01:38.481471Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.02130"},"observation_digest":"sha256:e6332bf21f3baf0e89b051a1c895b027de9471194918f36c941bb7f191b713fe","observation_id":"511d6429-44c9-434d-8bfc-5dc5c18018df","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:10.595164Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:b0b646a116b50e2ba23015c739791d43345517bf76f4ed1121782d4a1c75d91c","observation_id":"677de21c-38e8-4801-8e43-6609a3c233cc","resolution":{"observed_at":"2026-05-12T10:51:30.705838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T19:02:19.756092Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:bf912ed9dea4257281ad7d582f961ffac60f7f0c8589cf101e5890fa9ac172c8","observation_id":"5722ee95-773c-44ba-ac19-8edaaad46dfc","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.07794","last_updated":"2026-05-08T14:31:52Z","snapshot_observed_at":"2026-08-11T18:05:41.289003Z","submitted_at":"2026-05-08T14:31:52Z","title":"NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:57:03.927659Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.07794"},"observation_digest":"sha256:efedcd82819b22477075bf7dc232db454053b5315422690fb93d69b4b9ec4d83","observation_id":"e192821e-1e3a-4637-bea8-c83f788243d8","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T03:39:41.090350Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:215d14a921d224d6aa44dfe6cd2c5c233accf3c44ff731d33baad779db8ab670","observation_id":"12c7b0d7-79ca-4ce5-8bc5-8cab853b66d4","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:53:54.608425Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:811b93b3675a839d0cc118a88de7ae51a557cf56d00c14e41621879aba286c80","observation_id":"257ef8f8-8173-4a0a-a913-448483894112","resolution":{"observed_at":"2026-05-12T07:26:29.149977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T06:16:48.180290Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:cb45fae1a6aa8efdef867e97b2cf10df02021632029a65ccae48417ed7b18116","observation_id":"a244e96d-25a2-4338-b7c4-95d901b66493","resolution":{"observed_at":"2026-05-15T06:19:49.716782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.09948","last_updated":"2026-05-11T03:51:22Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T03:51:22Z","title":"LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:07:17.590690Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.09948"},"observation_digest":"sha256:6cfe3e39742a92639b17d2fd7aa4d0a2d568167ee0e92d72f371069a70b16e46","observation_id":"704d9921-473c-491f-9ffc-c523aa957017","resolution":{"observed_at":"2026-05-12T06:36:27.577339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:54.885244Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:e4faad1fdc4b02bae00101cc841ed625bcaa0b310dce1a535df5603e0865790d","observation_id":"02e5f680-6634-470e-b1a3-2165d8d2bdfb","resolution":{"observed_at":"2026-05-12T06:26:27.035564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:14:56.501485Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:98e96653383c4892eba54ef3a81fe1dbac467d4f7b8d869a42ed5d8bcfcce396","observation_id":"081ecbda-fb28-4cec-a851-fbb5a04d2201","resolution":{"observed_at":"2026-05-14T21:17:59.644023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.06158/citation-record","integrity":"/paper/2410.06158/integrity","json":"/paper/2410.06158/citation-record.json","paper":"/paper/2410.06158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:95be07a03dcb551feff3f3e5372478fe625c057a1165b5e9ab271830be885478","observation_id":"1681862c-8797-498e-ab03-0e708c0f6962","resolution":{"observed_at":"2026-05-12T01:09:34.019586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:386d909556cc2ce01a92ec0d954681b52a407171b4c59434cd975ae4c72a8a27","observation_id":"16ce52d4-f074-4d00-a845-28a55ebe854a","resolution":{"observed_at":"2026-05-12T01:09:33.820856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"d274a5e4-174c-445f-b42d-b4f55cdfb2f5","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6c06aa1a8afd7859a3417f12aebac23f5ea722fc1399df0acf68fd5e298c8a4c","observation_id":"2aa8cec0-f7f5-43ac-8f02-7564bad2625c","resolution":{"observed_at":"2026-05-12T01:09:34.081547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:9f516c85cc503dbf132d4bc8893121bd8a32406113a067fa0cbdff31302051e6","observation_id":"3cd5f690-4395-4629-83e9-e783e58ebc25","resolution":{"observed_at":"2026-05-12T01:09:33.849058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2312.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-07-04T21:00:09.556391Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","venue":"cs.RO","work_id":"e92c2c13-4330-45fe-8231-34a6002626bd","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:1d8ac0f9120e7f9ff14383befd05e17ef8c1128524201d94d6a4a74dac503451","observation_id":"6a447728-a6e8-4d22-a898-b8a063f217b3","resolution":{"observed_at":"2026-05-13T16:32:05.974462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.814697Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"311419a3-c410-4617-b43d-114cfd5498bf","year":2021},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:2878b17c49785d05d3de25f6f2278f94fb32a97428c8cbc1b0a7e12a9282388d","observation_id":"0e737ffb-8f5f-4b6f-b9fe-5826499686e2","resolution":{"observed_at":"2026-05-12T01:09:34.085913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"ea8b603e-ed80-4147-b719-3db159aa51f2","year":2021},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:8b83339bd7b55b07b9657885446f78bc2a301b5f0e1aa3265388d0c570079fc1","observation_id":"441ec216-e095-4645-8a32-b697ef14b739","resolution":{"observed_at":"2026-05-12T01:09:34.092286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"ab8623e1-a715-4be5-90d7-c00626366b64","year":2019},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6258bd2fb52e9bb7f806ee49ba9b58adf4ebd51986358544a3f1fb1c841ed47c","observation_id":"89f8363d-7a4f-4465-b62a-7aa8f8e927b2","resolution":{"observed_at":"2026-05-12T01:09:34.098267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"66df0167-4a8a-4b90-b60a-3e88dc2abf45","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:04459b9f393442dd860c26e915afa67d7a56b2e7f5eed4bd2d69bb444eb42864","observation_id":"3a38fe7a-fa78-497a-a924-d4d98fc45e07","resolution":{"observed_at":"2026-05-12T01:09:34.103362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"something something","venue":null,"work_id":"f5b01af3-47b7-4237-8a74-7503dca96c95","year":2017},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:f9f00bcded092461c2a3a7c14c601fbf459c7eb00542f6af2e3737f7a76ea9ab","observation_id":"49508fdd-42b0-4dbd-a2c8-22c579393ce0","resolution":{"observed_at":"2026-05-12T01:09:34.110280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"6a117305-9d5b-4d78-abcf-b520d6c55705","year":2018},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:39619152fbe23573345e7432ff083f2efaa3a8c493e55b19e9a2966dd0c92105","observation_id":"62463d2e-1f17-4f8e-83a2-9a55965958c6","resolution":{"observed_at":"2026-05-12T01:09:34.115219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":"1907.06987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-07-04T09:49:44.399575Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":"6eaebe96-5819-4220-84d5-dd888c79b8f4","year":1907},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:c40146225d4c8c535cc9ed873153a2fe15593f02927ff8231813e4914b7e7717","observation_id":"5ad23283-0ada-4c2a-8427-860ad863e79b","resolution":{"observed_at":"2026-05-12T01:09:33.954658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":"1906.08172","doi":"10.48550/arxiv.1906.08172","metadata_source":"pith","pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MediaPipe: A Framework for Building Perception Pipelines","venue":"cs.DC","work_id":"2bd783dc-e285-4c2f-b0e8-fd023e4bc1c0","year":2019},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:bd95e36ea25b6feb7a5974ee30462ff1dff208abdf79164aa716a1deaa720407","observation_id":"58c428cc-2796-450b-87ae-949709600d7d","resolution":{"observed_at":"2026-05-12T13:14:23.315480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-Sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":"4def963f-5012-4b29-8b56-28e92229f805","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:9efa13e132688099c62be2592d21063a76c1e16c1ddcc191954895a75a5b10b5","observation_id":"69dab474-df5c-42f4-b93d-986272b955b6","resolution":{"observed_at":"2026-05-12T01:09:34.119558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:40aa6ed81ddc0f221bf392bd3fe1b078ac4d2751b5ecdaf07ce0759b9a637a04","observation_id":"7ae26f0a-6d32-4375-a17a-a4d574c2675a","resolution":{"observed_at":"2026-05-12T01:09:33.831021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"130b7652-e676-44e6-9696-524372cfe135","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:0a1d8ac580b7301268682aeee6a5433651afc9ff11722820e9ad6fc843dee37b","observation_id":"1dd81452-8926-44e4-bfac-7b938c8fb77e","resolution":{"observed_at":"2026-05-12T01:09:34.125337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":"8b4b9631-1677-4599-9d4b-77bc753bd1bd","year":2015},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:96e1797bba8324a25d869fcedf641baf2f2e97b798499d88bc6c7871d6a615a6","observation_id":"8e5054e3-9deb-4a16-b147-42a3735798a1","resolution":{"observed_at":"2026-05-12T01:09:34.132704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:1ff6222e5a8c585f91a96f54c6a59a9e23a8d9d0abb807c97d4a2ea136438f5c","observation_id":"8af91c3b-b87b-4a5f-ad58-80efcb4a903b","resolution":{"observed_at":"2026-05-12T01:09:33.940957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:297d190c2b3b139fa04d4bcd5bfb46b0ce9ae75eda68828837d6a6310da3a755","observation_id":"c69ba143-c4b4-43bb-a989-26311cd4081d","resolution":{"observed_at":"2026-05-12T01:09:33.945626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MOMA-Force: Visual-force imitation for real-world mobile manipulation","venue":null,"work_id":"6b77fff6-a638-4192-b34e-d52726416254","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:a99661b5b2ab792a5ecd8fad2aa57595df469e56705acb4574030e2e8bde0698","observation_id":"0736680e-b7f6-4c5e-ab8c-d16a24b5d3b5","resolution":{"observed_at":"2026-05-12T01:09:34.136176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CALVIN: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"09e986c8-657b-4d28-8aab-82189eb3dcbe","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:30eeb51cbd4a03aef7643ea91b402f4936c8e0372976956ff3ca0cf68893b9da","observation_id":"30f4e127-9ee0-4025-b01f-6237c9b772de","resolution":{"observed_at":"2026-05-12T01:09:34.139669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.388480Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"80d27c68-54aa-49bf-b4e5-f94cb73ea612","year":2020},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6ad4ea0cbf087023e28e85114f0f0374cb5c6c4c4cac47584eb3af72bc24e8ae","observation_id":"a84e9232-eb80-4d27-8f98-29d337ffe866","resolution":{"observed_at":"2026-05-12T01:09:34.143091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"d2b39bf3-0b65-431a-a94d-e7394f9d1177","year":1956},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:d9706a4aef45adf00605cad65ca94d08d86432d4e4159994e70dbec8bfdea010","observation_id":"7bd6f53c-6754-4429-8698-0fc0cd3a90f2","resolution":{"observed_at":"2026-05-12T01:09:34.147499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"0b8e50c3-0e98-4872-999f-cb8094bb98fd","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6b6580133e225edefe883332e1d69a47d56e7ef033a07aa8632cfff9fa95cf78","observation_id":"ceb5b34c-6da8-4628-be1b-a4342c81dea2","resolution":{"observed_at":"2026-05-12T01:09:34.152913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":"2401.03048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-10T01:46:41.160163Z","title":"Latte: Latent Diffusion Transformer for Video Generation","venue":"cs.CV","work_id":"5328e907-7278-4781-a2bb-c5ef40dc87fb","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:dc4809b9aceb0108b79c482fd5a2641009435b184d471fc5a7941a4caacf5317","observation_id":"a85f75e1-5a6a-4787-b844-1042c2ff57bd","resolution":{"observed_at":"2026-05-13T21:45:35.835056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01918","last_updated":"2023-09-05T03:14:39Z","snapshot_observed_at":"2026-07-06T16:14:17.621050Z","submitted_at":"2023-09-05T03:14:39Z","title":"RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking","version":1},"cited_work":{"arxiv_id":"2309.01918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01918","snapshot_observed_at":"2026-07-04T04:09:35.398816Z","title":"arXiv preprint arXiv:2309.01918 (2023) 1, 2","venue":null,"work_id":"e2d9c6d8-696d-41ac-9192-932c001b1b2c","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2309.01918","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:fdb420ecfe11d575c6d7e35f47e44fdd91df8d51b637bcfd301af886ee5d18be","observation_id":"2b89f9b8-447e-4a74-9298-61be67248f89","resolution":{"observed_at":"2026-05-12T01:09:33.866487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in language conditioned robotic imitation learning over unstructured data","venue":null,"work_id":"884ea72d-193a-4d3e-9605-9301735a1c7d","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:a61c916a08ba74697e67411fd44fe967d15ebbfdc4b99bbf6b3b910bc7ea7d81","observation_id":"68e95ac0-7a3f-4dc2-8a90-d819b0095180","resolution":{"observed_at":"2026-05-12T01:09:34.160186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:2b4e94ca4afad118bc2c2bd86a9dcbb50b4904bc86276c7a6789543674a7134c","observation_id":"826d4c58-8d89-4f86-a768-72cedeec22af","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:86afebb1b005758ae51fc58f68f66c60ea48c1d7e755c3d258319fd7e575a357","observation_id":"cb94fd1d-303c-4ee1-8144-d70b041977cc","resolution":{"observed_at":"2026-05-12T01:09:33.896519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2210.03094","doi":"10.48550/arxiv.2210.03094","metadata_source":"pith","pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jiang, A","venue":"cs.RO","work_id":"7b5f6cce-bbaa-40ed-8b09-7330832dd736","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:031910e7cdf1777642528e3d3cebefd70c329f0129af7e5a7d9228db820f5080","observation_id":"7510ea83-c361-43ef-86c2-79f0af46a2b1","resolution":{"observed_at":"2026-05-12T01:09:33.914168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-05T04:07:39.705365Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":"2005.07648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-07-03T04:57:38.593923Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":"3b4e2803-5a69-4c23-a3b7-86047624e46e","year":2005},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:ed8dabdd9315936ce7795a7bbd040da47152c1faf5e95a65e664b87ba3a966eb","observation_id":"c8908412-3de5-4aca-b777-a135c72f5127","resolution":{"observed_at":"2026-05-12T01:09:33.936383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BC-Z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"655b5093-cd2a-4acb-be8e-5ecd419283fd","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:96df5cc396bfc3e22a199e8c556bdce709c7ef5a5fa66688899ed64159d1ba31","observation_id":"c4364eba-7c13-4166-a29e-4b2e0a3cd779","resolution":{"observed_at":"2026-05-12T01:09:34.164295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"3b27f18e-efc9-4060-9c31-3ab2b58b46cf","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:c8ef43cb170d7e7eb7e54f80874b1ff41d918a12f451a4d11caa5e4bd388265b","observation_id":"2a989c10-d26a-4ea3-9150-3cca8f4962e5","resolution":{"observed_at":"2026-05-12T01:09:34.167537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up and distilling down: Language-guided robot skill acquisition","venue":null,"work_id":"b1ce7337-e0d2-4a16-b282-9727d11fffb3","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:129d5ea15f58d17c59f195fc69e44253b1d4cd59944afcd0cfca47347f94b147","observation_id":"d10340df-1f50-49c3-94d8-33acd6fe79f8","resolution":{"observed_at":"2026-05-12T01:09:34.174033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIPort: What and where pathways for robotic manipulation","venue":null,"work_id":"44a7077e-bc65-436c-8fa3-ad0984a6107b","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:100cdbf3c9b93d476788242088093961483c14c7f632e7ae7f54d5b9833583de","observation_id":"2cb7219b-d27a-4c9f-a5b5-672bc7919744","resolution":{"observed_at":"2026-05-12T01:09:34.177773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:00c8a038c74a2bfef4d341b4b5846521a99bd057b7bec00843514055a48bfc0a","observation_id":"cd9a79bb-4583-43f2-836b-b93cbef79ce4","resolution":{"observed_at":"2026-05-12T01:09:33.977111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":"2310.10639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-07-08T02:04:26.192438Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","venue":"cs.RO","work_id":"954b4359-f4ed-4c73-ae5b-f75d486b6fc8","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:4de5350872d72cc4072c962b865110859234dda9a1aa67e60bcd90527f5fbe18","observation_id":"e1489ac1-b3cd-4d82-9466-25100e2a6139","resolution":{"observed_at":"2026-05-16T05:54:59.300665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-11T05:34:32.208314Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:411d5eaa9053556e90458e19524e58a538c083f78053d14f6559c99e1fa8c5b0","observation_id":"48865a7a-ac69-4281-9795-6bd3731ce0a6","resolution":{"observed_at":"2026-05-12T01:09:34.000529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":"2205.06175","doi":"10.48550/arxiv.2205.06175","metadata_source":"pith","pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Generalist Agent","venue":"cs.AI","work_id":"4b0a87cd-8d54-4abc-9698-c4cb20995600","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:285d5fa82ab81b8c698e2e15c11cd5eee5af44476b240a44ae973a502d5afa0a","observation_id":"c3716f0a-25b9-4000-a3aa-11cb4b2ea967","resolution":{"observed_at":"2026-05-13T06:24:50.082909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:59f84da7f24660d5512e41fbadf72d9e584dbfb07d6118f2206e76373b93f238","observation_id":"bc03956f-270b-43af-ad25-83488161bcde","resolution":{"observed_at":"2026-05-12T01:09:33.815304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"f89b942b-d92d-46e1-9550-9744c6b67709","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:e1d48e48a9fb2fd57d064af640f327f67435c20bdde8c45718763973281ce9f4","observation_id":"a3139217-4873-46d5-a46d-7d0d627c9184","resolution":{"observed_at":"2026-05-12T01:09:34.180949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chained- diffuser: Unifying trajectory diffusion and keypose prediction for robotic manipulation","venue":null,"work_id":"66afb432-be9e-4f53-ac56-6d952f1ace3c","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:58442cad981b1833ad1fb555a29a4ee86e9a017fdbc681a75ae4b6c5541e97b1","observation_id":"ba602364-84f6-4aae-b4a4-dd2fe0a72f88","resolution":{"observed_at":"2026-05-12T01:09:34.184083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":"2402.10885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-07-10T14:37:15.931790Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","venue":"cs.RO","work_id":"68b58508-d209-4c82-b5da-88ed1178eaaa","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:8a2288d09ec544b738b29a06586be16acb49e03ebf09e887caf1337e33418852","observation_id":"5515dcbf-7e13-45eb-b594-7229737c80da","resolution":{"observed_at":"2026-05-17T22:00:05.246520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Act3D: 3d feature field transformers for multi-task robotic manipulation","venue":null,"work_id":"693a1472-8cea-49dd-ad4b-adeb8a6bcebb","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:aa3a088d4b39f82351ae2d52cb16d1f5da83bcd0f7030c465b76c8aa2240a7e9","observation_id":"2d56cbc6-9735-45cf-b5fc-ff4a9e50c181","resolution":{"observed_at":"2026-05-12T01:09:34.186857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-09T11:58:54.163697Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2306.11706","doi":"10.48550/arxiv.2306.11706","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":"arXiv (Cornell University)","work_id":"143e7731-0488-4088-8e23-63f9d4140118","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6fc52e297accc64090b5fbc508e0937e299281bbbdfb755087e5abbe83ebca26","observation_id":"3ebd26d9-a903-4019-9991-e3adf16ae4ab","resolution":{"observed_at":"2026-05-12T01:09:33.855141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transporters with visual foresight for solving unseen rearrangement tasks","venue":null,"work_id":"91a316b6-d89e-40c0-b350-d71e726633fb","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:0a49f3c29b056e70362ea30cd18127a90d74e1acb81640efd638429f9b73296f","observation_id":"26de1763-2ed0-4fb5-b271-f593569bf819","resolution":{"observed_at":"2026-05-12T01:09:34.190351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to rearrange deformable cables, fabrics, and bags with goal-conditioned transporter networks","venue":null,"work_id":"665ed2c7-117a-47de-994d-7c0e551a0a7c","year":2021},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:11817761a995e3cd42d3d805febc2ba18eb1ffab919f7741fe00a13adaeeeaa9","observation_id":"fbdcaae4-5cf7-4f00-8db8-9ed792447446","resolution":{"observed_at":"2026-05-12T01:09:34.193652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goal-conditioned end-to-end visuomotor control for versatile skill primitives","venue":null,"work_id":"5aebb53c-0b27-4c10-9ee2-24f52d08a9b4","year":2021},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:c93362a7a3682295e75a66551691b545e5e649dc65ff582773e19e564564dca2","observation_id":"8a22ef28-6291-4268-bfac-2d71b9463da4","resolution":{"observed_at":"2026-05-12T01:09:34.197390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00597","last_updated":"2022-03-22T10:14:14Z","snapshot_observed_at":"2026-08-02T19:26:55.644557Z","submitted_at":"2021-12-01T16:12:32Z","title":"Wish you were here: Hindsight Goal Selection for long-horizon dexterous manipulation","version":3},"cited_work":{"arxiv_id":"2112.00597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.00597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wish you were here: Hindsight goal selection for long-horizon dexterous manipulation","venue":null,"work_id":"c166a74b-ed32-402c-bea3-17f0a84d0fbd","year":2021},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2112.00597","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:75c4df17dcae4948b8b865fecef93d2996ae25ebe3bcf13639e39808dd8d91c2","observation_id":"f082fad4-1c65-4480-92dc-e973cfee7a05","resolution":{"observed_at":"2026-05-12T01:09:33.888003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoen- coders are scalable vision learners","venue":null,"work_id":"f81c3ac6-04e6-4c15-b3c4-bb5c04bc183b","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:644e551df00f43ace0ddf3ed2786337e2ea4fea7cb093ba7005c03da1c9e68ea","observation_id":"74d8fc61-c806-4f7b-b7ed-78afa32c4953","resolution":{"observed_at":"2026-05-12T01:09:34.200372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"3eba433d-e6de-4e72-a543-d3e56a0f365f","year":2020},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:b1343424d679594659fc865b44b36da4581f71d7005e41859f88a9c66796a1c1","observation_id":"6f82857e-191b-41d7-aa8e-df746ffaef48","resolution":{"observed_at":"2026-05-12T01:09:34.203484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:cacb931f3626e2e9e201ed2a48080fc37b80c904a2f09b33ccbf5f0bb7134e89","observation_id":"3401a4f1-c1f1-4fbe-8cb2-3e8106ed70f5","resolution":{"observed_at":"2026-05-12T01:09:33.901022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-09T00:25:43.898202Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":"2302.12766","doi":"10.48550/arxiv.2302.12766","metadata_source":"pith","pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Karamcheti, S","venue":"cs.RO","work_id":"5bd4457e-dc56-4b1e-ac07-f14764ba597e","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:4188082ffc60c403885f53c65b55c35ca05f1405ea993edab804892af384f925","observation_id":"98f0a839-81df-4218-8816-f37ed5680be1","resolution":{"observed_at":"2026-05-12T01:09:33.906792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:0c8fa038ae0c82f8962bbc7dceb9ff018355a71a458f5e68c07042360bd6578e","observation_id":"268d886d-ad23-4abc-8dc6-ac4a19ae3005","resolution":{"observed_at":"2026-05-15T13:26:54.148999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot learning with sensorimotor pre-training","venue":null,"work_id":"7e89c622-92ef-4403-acb4-5a1dbfb29806","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:59efbe36f8c6fc35b126c3c90a0c45825aa6d0eec2d1648149e11c63cfb8e315","observation_id":"db68736c-cf24-4b92-af13-937ee2d967f4","resolution":{"observed_at":"2026-05-12T01:09:34.206954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6e0690adf6e6d181c51350ebbc51b7fa9b58e2a32c040d97cf5134563cf4e5ed","observation_id":"c2841de8-36dc-4eb0-b673-db594337255f","resolution":{"observed_at":"2026-05-12T01:09:33.918442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":"2401.00025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-07-10T18:47:31.639635Z","title":"Any-point Trajectory Modeling for Policy Learning","venue":"cs.RO","work_id":"0c843c6a-ce05-4ca4-992b-e25516f490db","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:70110bad8b57b4f8b3a4d721570d20b7f86526a1896b8b005d863714aa6473c3","observation_id":"a5371c3c-0c55-465e-93e9-6f5bcb0331eb","resolution":{"observed_at":"2026-05-16T23:32:51.209901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":"2310.06114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-07-04T17:09:59.117795Z","title":"Learning Interactive Real-World Simulators","venue":"cs.AI","work_id":"16f38691-7ab6-4e23-bba5-6b656579e579","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:f6ba1d2d8be250800f96604921c8b1ce47a678c7e0eee8f47552f19bfbb2fdbf","observation_id":"a9f476a2-de5b-4155-a0e9-025b556cc244","resolution":{"observed_at":"2026-05-16T02:15:18.951679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked world models for visual control","venue":null,"work_id":"723dca25-721c-4f7d-b0d1-0a379ae0443f","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:50cf8c99df7a47b6af7627c9d3ab86a85a690c3ffdf997f5f975803aed8e8deb","observation_id":"ce25e3f6-fcc5-4004-9897-dfd748bb997c","resolution":{"observed_at":"2026-05-12T01:09:34.210241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real- world robot learning with masked visual pre-training","venue":null,"work_id":"f82350a4-a31f-41c1-882f-7a9dee51563d","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:6d5855416d3f694f26de8d9d0a4a7c7a170b094b218f7191c62fb532e738a5ff","observation_id":"34b07f7d-af36-4ccb-a4ee-5b8e2d31a340","resolution":{"observed_at":"2026-05-12T01:09:34.213940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring vi- sual pre-training for robot manipulation: Datasets, models and methods","venue":null,"work_id":"97620254-dda0-4996-9872-7ca8c82de130","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:dcade542c74b3f1bc8065849326d6d623e93d77eb7388945653d757d7fcfd2a1","observation_id":"9847743c-6f68-4f7f-bec6-8fc2151c589f","resolution":{"observed_at":"2026-05-12T01:09:34.028783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"e4053060-e108-4207-84f8-20d0e7396f62","year":2020},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:276f34423de58415ab1fc1e7ed8369416e27002247058079579d5fed35282e25","observation_id":"aa706a92-cc41-4c30-aafa-6693eed27395","resolution":{"observed_at":"2026-05-12T01:09:34.038585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Time-contrastive networks: Self-supervised learning from video","venue":null,"work_id":"f2e716be-a470-4281-b090-d0bb1f61da84","year":2018},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:9fcc11944ea5de0f7ac3f9979f6122330e2accf715db98fa5aa378249bd50ca0","observation_id":"e4ba7868-7030-4311-b156-befb91c8dc81","resolution":{"observed_at":"2026-05-12T01:09:34.045549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:344aac23c51b6fa2c842489c5d332c3dcb2b8ec38c149b763f9681e77409f70e","observation_id":"575ad86d-0aed-44c6-8388-5c8a5117ae7d","resolution":{"observed_at":"2026-05-12T01:09:33.964061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video prediction models as rewards for reinforcement learning","venue":null,"work_id":"84fa6f23-8c73-4755-bbfb-61c03b594a5d","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:14570e0eb6a02c462414455eba8777edf08b96466d6de006c513b28b34bba270","observation_id":"c5c33d96-5d94-4782-952a-f1ce9fb841e4","resolution":{"observed_at":"2026-05-12T01:09:34.052219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"d094b087-4a9f-42ed-bfcc-349691b572de","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:353ea1b7041d7ce1d8c43cda6cd47f6acfab94b64a37cac1120fe27c2ebf6abc","observation_id":"c46571f0-e670-4d3e-82dd-85e9c7d8cb3c","resolution":{"observed_at":"2026-05-12T01:09:34.059156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-09T12:57:58.196865Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":"2310.10625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-07-08T03:14:31.687294Z","title":"arXiv preprint arXiv:2310.10625 (2023)","venue":"cs.CV","work_id":"9736ca18-78ad-4d25-ac93-df8f2295a1f8","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:440c5292d4a2636dd3ec38289ed1fd7d01f13d4ba8a778c1d996d8c506f43e9e","observation_id":"8b5e8a73-9bd0-4b75-8a42-e95b0725678f","resolution":{"observed_at":"2026-05-12T01:09:33.995353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep visual foresight for planning robot motion","venue":null,"work_id":"00929551-4d34-4a2d-895d-52ff35a67ea4","year":2017},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:57ba054dbc7cc4655448281715182353eefe66d8ec3c102624f77f135aafcca2","observation_id":"17551b90-c5e5-4645-bbab-33b1f217ad9d","resolution":{"observed_at":"2026-05-12T01:09:34.063399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-09T08:50:52.153302Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":"2206.11894","doi":"10.48550/arxiv.2206.11894","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gupta, S","venue":"arXiv (Cornell University)","work_id":"e5efab6e-7f7e-485c-83f5-1f69f77d39d9","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:53b366c045bbdab5ef32baac205ab541288aa27a49db65a6da7ca18ba6c327c4","observation_id":"d20b0b42-f77d-4a59-96a1-a9d30b90dd33","resolution":{"observed_at":"2026-05-12T01:09:34.008304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":"8791fba2-3b4c-4358-bba5-ae454e771d6d","year":2022},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:e82015505c96312e89be4365db59d8d3759d5da43a7aabf7d6468e31c325ac47","observation_id":"90527fe9-f2ea-4b38-ac1c-f7fe7b9e5a1b","resolution":{"observed_at":"2026-05-12T01:09:34.071744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpawnNet: Learning generalizable visuomotor skills from pre-trained network","venue":null,"work_id":"85e05aa1-b7e7-4ddf-bb1e-c44e527f8cd2","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:ee7b814e33097b661da9cff2cdba159675fbdafbd432e5d059b4897f6ee9d4d8","observation_id":"0ddd4cde-02bf-444a-94e3-b5646e55156b","resolution":{"observed_at":"2026-05-12T01:09:34.076330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":27,"verified_fuzzy":39},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 100 inbound Pith citation observations for arXiv:2410.06158."}