{"as_of":"2026-08-06T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1657339bd042558f168dc37d9ad1f4008f793b19df1b17d66b5faeb2974fd7b8","coverage":[{"denominator":102,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:38:27.263726Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:39:40.704498Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T07:14:45.365277Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"cited_work":{"arxiv_id":"2605.28548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28548","snapshot_observed_at":"2026-07-08T07:14:45.365277Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","venue":"cs.CV","work_id":"8cbd1bec-4e45-408e-8d75-d09023d50911","year":2026},"citing_paper":{"arxiv_id":"2606.23686","last_updated":"2026-06-26T07:29:00Z","snapshot_observed_at":"2026-08-02T07:49:25.392809Z","submitted_at":"2026-06-22T17:59:53Z","title":"LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T04:41:28.564104Z"},"links":{"cited_paper":"/paper/2605.28548","citing_paper":"/paper/2606.23686"},"observation_digest":"sha256:251a160c68f52b057f9d33264d10eb7dbb327f41100fda8844fee67bd433b070","observation_id":"994de202-8e44-4e4a-8417-b3dd6f3266d0","resolution":{"observed_at":"2026-06-29T19:33:54.716433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"cited_work":{"arxiv_id":"2605.28548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28548","snapshot_observed_at":"2026-07-08T07:14:45.365277Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","venue":"cs.CV","work_id":"8cbd1bec-4e45-408e-8d75-d09023d50911","year":2026},"citing_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-08-05T06:31:41.321063Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T07:06:13.473493Z"},"links":{"cited_paper":"/paper/2605.28548","citing_paper":"/paper/2607.06403"},"observation_digest":"sha256:7a5c49a9dc301f4768b68437a76c06ea856c4a54a003d8ff545e2fbdc602c10f","observation_id":"5f4a89b6-e6f7-4190-8252-542136a69e98","resolution":{"observed_at":"2026-07-08T07:14:45.366955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28548","snapshot_observed_at":"2026-08-01T08:39:40.704498Z","title":"Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.704498Z"},"links":{"cited_paper":"/paper/2605.28548","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:ebd2a55a4de58b9b5f1f4de16b1f7f3a3dcc27e98d6e74a7759d744a36f9c7ab","observation_id":"9a094702-8da5-4b8d-b8e7-8868f3660ee5","resolution":{"observed_at":"2026-08-01T08:39:40.704498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.28548/citation-record","integrity":"/paper/2605.28548/integrity","json":"/paper/2605.28548/citation-record.json","paper":"/paper/2605.28548"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:10f99f2e56e931b044cb6d1021c4d45ce431429ad13ff3be74212313649f95b4","observation_id":"d149a499-859e-4355-865e-1ae78eac85b5","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":"2503.15558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-07-05T11:41:02.557688Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","venue":"cs.AI","work_id":"09215448-e68a-4168-89b7-9d9a83a0e51f","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:d3112acf44f576d529dc35bad1c934a4d6107315d2b34c09604c8d8bdfd43c6d","observation_id":"cce4394d-aa34-44a0-9a72-ee1efba4bc1b","resolution":{"observed_at":"2026-06-29T13:43:28.951334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:d384d38ade02213ead7f5fe1cdeeff654a2573abd826fe8fd0db5cc45ff1585f","observation_id":"d2c07c8c-e579-45ae-a33b-f17058acbf10","resolution":{"observed_at":"2026-06-29T13:43:28.946776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":"2111.08897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-07-04T06:19:37.435697Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","venue":"cs.CV","work_id":"0ce910be-ca1c-44c7-b7b1-c5353759d85e","year":2021},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:83a41cbbe4cf77163966fe7c135378f8ac48a7a32ada3db768ab4353a64244b8","observation_id":"51404052-19ab-47d6-8d16-ab7e07d4cbd9","resolution":{"observed_at":"2026-06-29T13:43:28.804096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:5eac79b8a256bd832a7cf7078c0654432de8a387de922067645710782c8fe048","observation_id":"f3327a7f-ee00-4e74-aa6b-7bc6423df2ea","resolution":{"observed_at":"2026-06-29T13:43:28.793790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:9620524254b9feb96761d2892d104ca535cb1ccf8975c55f0f9f6f9a43e5e86e","observation_id":"c46c33a2-bf7f-4032-9c7d-164324bdf8bf","resolution":{"observed_at":"2026-06-29T13:43:28.921818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:134de99cab09f3f8e506edca974f3132f6e6b0eaa25710cf221ad4df78ba04bb","observation_id":"b18ed60c-d513-41b6-a475-f2592cdaa16f","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13719","doi":"10.48550/arxiv.2511.13719","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":"arXiv (Cornell University)","work_id":"ceb84861-8bdb-4822-864c-8e2d0ae4d322","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:252bdd8f869fb8bbedf4f6637f6ca468ab098b895c1c0d534df0f97bcad00488","observation_id":"dd2c1c0c-3251-4f5f-ac73-e9c70abd3172","resolution":{"observed_at":"2026-06-29T13:43:28.949546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:6e5f1e184d3b60a0c782d8a7d0279a9fe4a98fbe5727eeac64fe57afeaf228f7","observation_id":"8d3e1211-b1f8-489c-8ced-33474cd2eabf","resolution":{"observed_at":"2026-06-29T13:43:28.876255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-06T05:50:28.186700Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0b1680078826e78613cb87d0c5d3245010ee458207dcda412244dc236012e09e","observation_id":"4f799f29-9b9b-4aa7-be31-067e8ecb854f","resolution":{"observed_at":"2026-06-29T13:43:28.924772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":"2507.15493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-07-10T04:16:48.751910Z","title":"GR-3 Technical Report","venue":"cs.RO","work_id":"7f3b800b-0146-4c37-b178-0801cd4270db","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:f1e3b17ac0b40d85dacce2660716945696482e5abc9574f50511fc2033dadee0","observation_id":"aab9c73a-15fd-4a9c-8148-179cb121f737","resolution":{"observed_at":"2026-06-29T13:43:28.764033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T16:51:14.299739Z","title":"Blip3o-next: Next frontier of native image generation","venue":null,"work_id":"b51bf787-a19b-47bb-9114-1a1a29263297","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:7d545e5397b2d97801a40e8a72422a22f7b25d890f704703565760e6f2a8ee72","observation_id":"c92fe02a-1a3d-4205-8329-bffe61f6edda","resolution":{"observed_at":"2026-06-29T13:43:28.792569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-07-06T21:27:51.964897Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:00692bd55961cdadf5dd0f9ed65378604b2454da7891924de918509026d58529","observation_id":"78ecdf25-e94e-4225-b0d2-a12583a15c8c","resolution":{"observed_at":"2026-06-29T13:43:28.939856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:b3e9ea06467d5498795e2b91d35e1442bd1227ec1a3762aee91aca8446d12669","observation_id":"3580ea63-40f7-4af6-bebd-f53a390412f7","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:82d7f09624ee66d25acbe123e64c3390884715082f8417cfb44332050cd1d291","observation_id":"a8b5c485-6f35-45d2-a448-feb30664d723","resolution":{"observed_at":"2026-06-29T13:43:28.927253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8404c422460183c85f5dc0a42688cd537bba95d74fb12be9b5fe457cff00835a","observation_id":"aaaee761-e61f-4c03-b94c-22b714a04762","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:29:51.440693Z","title":"Rynnbrain: Open embodied foundation models","venue":null,"work_id":"443a7950-489d-487d-a50b-8076ce0dfd48","year":2026},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e7f093d18fdfd5c11670d76150563e6614ccd157e78aeabea88b0d0722631273","observation_id":"ad7f14f4-521a-46a0-89d9-5dc61ec3a577","resolution":{"observed_at":"2026-06-29T13:43:28.777758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0340025686595667ddf2ea4a01cfa9205b5355fc96c3b86bfd586965901b69ba","observation_id":"9ba5e188-954c-4619-a305-f0fa0f162471","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:fdc7c955e462e71228abf1072583f80785223487664d75ab5bbc3786ef5dba66","observation_id":"5ad13a23-9cba-4100-a90f-dd043cf2f2db","resolution":{"observed_at":"2026-06-29T13:43:28.785956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12312","last_updated":"2025-09-09T09:48:14Z","snapshot_observed_at":"2026-07-06T21:25:46.964896Z","submitted_at":"2025-05-18T08:55:02Z","title":"Visuospatial Cognitive Assistant","version":4},"cited_work":{"arxiv_id":"2505.12312","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12312","snapshot_observed_at":"2026-07-11T01:37:43.767721Z","title":"Visuospatial Cognitive Assistant","venue":"cs.CV","work_id":"edaff53d-f774-4c36-92b2-b6c973281d09","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.12312","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e6782dc91c1b7451517a2819a0ef07b74482c8fcb48e653d7ea2351b525ffe21","observation_id":"c74c67d6-8a92-4a42-9dd2-cd7b5946ed9c","resolution":{"observed_at":"2026-06-29T13:43:28.944298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:07:41.256835Z","title":"Roboafford++: A generative ai-enhanced dataset for multimodal affordance learning in robotic manipulation and navigation","venue":null,"work_id":"4f34c0bf-7647-4732-ba40-6ceafc32ea7c","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:9376bce714d211e8226a3da9fefa0334dded8f10db12116f4e305ab32128a1a4","observation_id":"45701357-72f3-4fe9-8998-35f72aa9c7b5","resolution":{"observed_at":"2026-06-29T13:43:28.954054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":"2511.16518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-07-05T11:41:02.521274Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","venue":"cs.RO","work_id":"d195ae66-288b-40f6-9dc0-c6a4c02fc03d","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:b1f47a73241086a48a4ca558d59463db46569eea3b5a28dfe66bd79811bfc828","observation_id":"5b6cf150-4ea8-42a7-b59e-46072d6ddae4","resolution":{"observed_at":"2026-06-29T13:43:28.934583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:708deba76b0c315e56c3d0e3795e7b6d3cb0e8f2f6524a931a874f134c0c730b","observation_id":"0dfcbdc7-a68a-4b8e-a4bf-32a0476fa631","resolution":{"observed_at":"2026-06-29T13:43:28.944572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":"2507.16815","doi":"10.48550/arxiv.2507.16815","metadata_source":"pith","pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","venue":"cs.CV","work_id":"a5c17d1f-5739-41bd-bd90-0faf9424af13","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:6d1628da29fcd4c1a78db243ac38290aaab7550c7170b354da9a9c9890e9607e","observation_id":"1896c951-cbf5-49ad-868c-2121fd568b56","resolution":{"observed_at":"2026-06-29T13:43:28.917162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:636d0b861576ea9f4f1ee48d7a7fcdc761689ab8dbda8a5339a2cf768bb0cde7","observation_id":"89ad9c6d-6cf2-4437-a452-ea8ef2027d7a","resolution":{"observed_at":"2026-06-29T13:43:28.914189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:9b68828788606121a67289ebdefd121a098b523a4d42e49e4bb42fee76ac4617","observation_id":"8ec73933-0dda-4e21-b120-cb70c1d9a08a","resolution":{"observed_at":"2026-06-29T13:43:28.908931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-07-06T20:44:31.199648Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":"2502.21257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-07-04T10:39:45.381569Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":"80a52809-7280-487f-875b-4ced1c97fd0f","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8afd2608a0bb781d5f2363ffc57d89b8f99efa8024eca61a86b31b7ab76baf7a","observation_id":"9fe3db1d-6a66-423e-87de-c84b1baa9d07","resolution":{"observed_at":"2026-06-29T13:43:28.926574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:39:46.280004Z","title":"RynnVLA-001: Using human demonstrations to improve robot manipulation","venue":null,"work_id":"50d73fe4-0fa1-43bc-ac8e-e05dc7f9a1d7","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:64dd2818b2a597da47681260d2e1f7d701a6b4671b65a883cbb8bdbc06901dfb","observation_id":"ed181f75-1356-4880-aaa9-4b5863f53358","resolution":{"observed_at":"2026-06-29T13:43:28.929111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:356a254fa9d71d433544939fbb91e1284fd17459f0d47fa959826921cccc45f3","observation_id":"f0a74d72-77bf-4c37-8041-1b363cbf9d68","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8ba8e22d0479e9e2fcd591ab562f9e9f664970d5c4f162bf042ad96617e4a793","observation_id":"22f5facc-aa40-4113-923e-9cfb0b8ea02c","resolution":{"observed_at":"2026-06-29T13:43:28.951915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:1b35718977a11170ffb78ac667615dc9ca22021dfe38258a44648aeaa43d911b","observation_id":"d3ef739d-bc24-4664-9722-4212ff047edc","resolution":{"observed_at":"2026-06-29T13:43:28.924107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:85e58af605a0ba241c4fb195ca9981b11e2f49435fe5001e846d9cd4dc4e099a","observation_id":"cae21675-b328-41cd-ae0b-ac355fa4d93f","resolution":{"observed_at":"2026-06-29T13:43:28.895201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:d29b016320b8a693f6ff8d874bd76becb5c7a362af1e05e847231880e37902ae","observation_id":"24a59ded-67bd-4f9f-b8ef-40577202b133","resolution":{"observed_at":"2026-06-29T13:43:28.954255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:9c4e2563e3db02cf7e067e0815eb8f36c32b0f25d62b908768a3e88152c2f703","observation_id":"aea6106e-fbe8-4c8f-ac8b-7c57f1422c16","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.394965Z","title":"Spatial forcing: Implicit spatial representation alignment for vision- language-action model","venue":null,"work_id":"0de0fc11-052f-4fee-af32-850d60b54a52","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:570b0697c80db5e1a36f6992478c17ab15fc30fd8c4e3fbe31db463e92e6a765","observation_id":"f29ec315-13fb-4534-8dc7-ca5e719354a8","resolution":{"observed_at":"2026-06-29T13:43:28.936462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"3ds-vla: A 3d spatial-aware vision language action model for robust multi-task manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:02988521a02da82c2676860e92bdd62325077a0b48d6de42fe411bc4db72d987","observation_id":"7638faef-1280-4847-bdcb-39420c9c4093","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:490354f0a55b8c46d304bbd1a8e7f55ea57680e66b76c200f55485f98c62c0ec","observation_id":"32c9a440-5ccd-4b66-8b71-731a5e88279d","resolution":{"observed_at":"2026-06-29T13:43:28.884284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":"2405.05941","doi":"10.48550/arxiv.2405.05941","metadata_source":"pith","pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","venue":"cs.RO","work_id":"7f4ca6cb-1b94-454c-9623-b52441b74b61","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:d27e8db592b7ebcb14b16647eeac5145efd652e3248eebe1a94e77c11c48b108","observation_id":"420d55aa-e54b-4445-a22b-2486fb8596f8","resolution":{"observed_at":"2026-06-29T13:43:28.901126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:fa988096734889652a88a49a3c46799795545fb2137de02fc8475561153580bf","observation_id":"63fa33e6-d0df-481d-aac7-8cbcefdcc2cf","resolution":{"observed_at":"2026-06-29T13:43:28.933921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":"2511.10647","doi":"10.48550/arxiv.2511.10647","metadata_source":"pith","pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","venue":"cs.CV","work_id":"0a54b500-1e9d-46c2-85eb-8e16cbac8461","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:4d5d5d67e289f12c7ba20a657f73d2aae2409740e86b87378ee13cd2a02b6667","observation_id":"8316b8f0-9ee0-41c0-8158-a3d2f1a04e95","resolution":{"observed_at":"2026-06-29T13:43:28.849859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:4eb97624e334d6b9149b32c7edc47c048e89dac17e831ab0795973ea58605b05","observation_id":"e06f79e8-75bb-4d92-a64f-e90d4b851b1b","resolution":{"observed_at":"2026-06-29T13:43:28.941625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:1b0246ebb456cecb75880f1458d98f709b74471b1b2a5c2ddf336ada15088139","observation_id":"ed31c78d-0064-421b-a293-ca77b70ef5a4","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0633c0717ca28af4c725b0dd9d117a598b8de9252ccd6b2e40292a3c6e274863","observation_id":"9bf277dd-3037-4213-8f4a-cc6cbbf0e714","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:5c96cd6b98ae205c84762e26866e03f0cb61e2a24c531f706a146af1447e0b45","observation_id":"f4134f73-13cc-4725-a6e5-1fcc1a83f232","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2503.10631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-07-10T23:07:48.060771Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","venue":"cs.CV","work_id":"ecac5f06-a68f-4fff-a89a-a89358afb649","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:7a42b597dadf7c3e9d83566f3c38d958ce8a8e996243534e7b1d869ea470fc6d","observation_id":"bda20188-d9fd-4f43-a762-7b0433f1aecf","resolution":{"observed_at":"2026-06-29T13:43:28.798947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.626180Z","title":"arXiv preprint arXiv:2602.03310 (2026)","venue":null,"work_id":"b6e4f1b5-a3f4-4a50-9580-39fae754adcc","year":2026},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:6838a56ebdf5abeee05ec4c950f41ee2918f0014eae04eba2a9c53a184613bd3","observation_id":"011333c3-bc43-4a5e-92f2-0153eb018680","resolution":{"observed_at":"2026-06-29T13:43:28.795239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Vl-grasp: a 6-dof interactive grasp policy for language-oriented objects in cluttered indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:9445fcf009ac1f03b56a5840b36d0779b1aa666719331d982b9501ee2c57858c","observation_id":"0396a53c-9495-4734-841d-a9f0cd4f4001","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-07-06T21:34:00.849404Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8e8605529016f4c7335da5e93b80f9ecdec640df8ece545177f3573f98eb37e6","observation_id":"b4b13735-5d8f-4332-935e-4cce4db729cf","resolution":{"observed_at":"2026-06-29T13:43:28.937015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8f01037ef403d2d20cbb493c9da24ca667694af9f2aa1cf09a9c513191ba72b5","observation_id":"a8ae2393-4e79-48f5-9916-c6b8ee7bc8ee","resolution":{"observed_at":"2026-06-29T13:43:28.946603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2504.01805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-07-05T11:41:02.483857Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","venue":"cs.CV","work_id":"df3c8f70-c0d0-469a-b74b-b32ceb50d29d","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e023e2653eeec559f164aa51198be0c0bebfc5e24feae864bb5aab1136a7b15f","observation_id":"6b80c074-06b8-4843-ba0a-74075e53344d","resolution":{"observed_at":"2026-06-29T13:43:28.881710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:887de6e25ab357a55eb9d94830365c32210108694f7fb37401e37cf7b3f0e762","observation_id":"7443e8b9-874b-4ec0-beb1-b359a0d40b0a","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:cd5580ec86628a684102268eb4e8e3d8107cda4a5d3012edade4c500ced251d3","observation_id":"757facc2-130e-43c5-9987-6323a51dced0","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:f9d990d4141d8248ad3e80e788e00ddf617fec9a4a6f27e432f0f89de4ead902","observation_id":"23c0f6ae-9ec2-43f2-a155-ee34fd3bed08","resolution":{"observed_at":"2026-06-29T13:43:28.893229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.897588Z","title":"Eo-1: Interleaved vision- text-action pretraining for general robot control","venue":null,"work_id":"b512941f-aa42-401d-9e2e-c336dbb630ef","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:ea8f176abfd19af4c9a58355f8fb233d95fa03ad732793b5978ca741c6b176f1","observation_id":"0a39b032-3823-4d47-af39-e073a2dd5721","resolution":{"observed_at":"2026-06-29T13:43:28.922358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:7582527cc2c30bd04cf2dae5dc86d700c3b628a3ba2d85dc3eca2f68dd7fb61c","observation_id":"8e88c1db-c1f0-4e51-91bc-3de251b11927","resolution":{"observed_at":"2026-06-29T13:43:28.867061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:7d0bbd5237da078c11bf01a29b234020b87891d06591d269ba9f2ed12c21d962","observation_id":"0ec6e0d1-103e-464c-bff1-b5be53ddfba4","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e32d2aad963c9571b0a6c4e0b37828fe3d3185f707c8b7736835b91f58c576e5","observation_id":"2c21c9b8-9b0e-4001-ab59-24bdc7c3523a","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e45f78ad66b5c8bb89253c2391cfca561eae1d3b30e0b9bf36e7eccef232731e","observation_id":"3676bcb4-76ed-49c6-b56f-5cf19048cee2","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:a2dc05306054396bec3590bb7a4f33e38d204a63c8d425aaf1a5075ff84804d0","observation_id":"e491a828-d36f-47ab-96ef-c40910d87bdf","resolution":{"observed_at":"2026-06-29T13:43:28.861506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0feb6caebcebfb97dd282f598493db2be1f73214c57b74515180431610b123cf","observation_id":"bf9b9fd9-d1c2-42f6-b1a6-247efb96cba1","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:2da43115a39c082b7b30e6b4ba5feb558bfa7b75b13285e47d95fbdde9891d34","observation_id":"9fb6d44f-2a71-4c89-bed3-bc563272dbff","resolution":{"observed_at":"2026-06-29T13:43:28.942277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Starvla: A lego-like codebase for vision-language-action model developing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:bd3eb5ff73e1fafa3ee30ce20f92ad3e1731a5fdd4632f88d6fc1a468fa24aae","observation_id":"59befd15-bfbc-4da6-859e-0d76b8179f58","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:5173abe5ac40b9fc780b6fee946314ea7e76b4f9b70c88c8c98b43d6f4033bd8","observation_id":"477cffff-638c-47d8-b17e-458e07374898","resolution":{"observed_at":"2026-06-29T13:43:28.869499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:7d2095424813ecb83f11648815dde1b8d00a62387f46b6ed6e229ab0585c6c5a","observation_id":"00e6adc2-62a9-43ec-9b09-071d2d2a4756","resolution":{"observed_at":"2026-06-29T13:43:28.874260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:b83074448d237c84dc62893b05198561fc343ce0b346eddc9e0292319411a5c7","observation_id":"cf16ddec-9cb7-43db-97d2-1bb8a77c7e27","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:f41fd63648da5007fefea642b3cb04ef82817c28857bbaac4d7e005cc930149b","observation_id":"77592b1e-6166-47b0-805a-2b002ec7e1d4","resolution":{"observed_at":"2026-06-29T13:43:28.914029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-04T07:40:05.703158Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:ec96d0b06fd3e9f0515a45e64a39b75531eb404a63f8482db2ecd1e3307ef738","observation_id":"c087c14f-7309-451f-ab3e-31e832e2427d","resolution":{"observed_at":"2026-06-29T13:43:28.871097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:186897a2aa13dfa7f6f4cf7e5c704c72ed5558eb7b57e0320a3cbde07b59dc55","observation_id":"cf21edbb-3892-4a0a-94ef-bd6f289db748","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:d6b9035dcd8d06e4779aede263a23fbf2237bf674b21f190908a080bebbc12b2","observation_id":"7749cdb2-e03e-48d6-b7d8-fec1d4aade5c","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:fad174f14dc66802297f505b3f1e698923a2d5f7ac32d12181ab9f42117cd164","observation_id":"882414c5-d819-46f9-98bd-130c6ef31df2","resolution":{"observed_at":"2026-06-29T13:43:28.850081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2412.13877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-07-08T02:04:26.240460Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","venue":"cs.RO","work_id":"86320616-05fa-4c08-8bc0-4377e53bdba5","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:a9a2c044c7754c4f090e78f498f1c5d031ea6093ac6603a32918ed61a3716a90","observation_id":"c9c7379b-66ff-4fa3-b08d-7033d905fc6e","resolution":{"observed_at":"2026-06-29T13:43:28.858519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17441","last_updated":"2026-04-13T12:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:39:22Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","version":3},"cited_work":{"arxiv_id":"2511.17441","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.17441","snapshot_observed_at":"2026-07-10T04:16:48.642593Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","venue":"cs.RO","work_id":"bb5f869d-fc3a-4506-949c-65ae53321631","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.17441","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:a3ecdcc8cd3b073b8af4133f0b50bb8fc0f93db1ec955f285e4fa0959bbacea5","observation_id":"0f6dca17-7b46-466b-b44b-f633467122c8","resolution":{"observed_at":"2026-06-29T13:43:28.949108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:764178b062ac7c57fd765cf76d3e2afd1496f3c14527426e7c0cf718776b3648","observation_id":"4481ce55-7ea7-476b-b11e-eadcdd9f5432","resolution":{"observed_at":"2026-06-29T13:43:28.845036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07430","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-03T21:39:13.921814Z","submitted_at":"2026-04-08T17:59:48Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","version":1},"cited_work":{"arxiv_id":"2604.07430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07430","snapshot_observed_at":"2026-07-04T00:39:17.447258Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","venue":"cs.CV","work_id":"886be7b5-70f5-462c-a757-e44686e6e0db","year":2026},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2604.07430","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:6966dea3e127b899f6e9f25673fc51f70544bb38d7c98478d1ccf4a131401c86","observation_id":"690dcfed-bd83-4f91-9d08-52d4b0bdc4a9","resolution":{"observed_at":"2026-06-29T13:43:28.847594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2410.10629","doi":"10.48550/arxiv.2410.10629","metadata_source":"pith","pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","venue":"cs.CV","work_id":"c53bf282-3c74-4c37-a7bd-6531aee212b8","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:af0c22d375c5566e816dc5a95bfb6a62f98f5e4db17232a6223b748035761a3e","observation_id":"fef89dcd-5141-4252-aef4-4732d826f87f","resolution":{"observed_at":"2026-06-29T13:43:28.852429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8328a06966ce27c0b1453be312572ef93f467fda23f06e8be8859354dfacaaf7","observation_id":"1ebaed09-99d6-469e-9d12-4cdbcbef8e66","resolution":{"observed_at":"2026-06-29T13:43:28.855673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.017025Z","title":"Vlaser: Vision-language-action model with synergistic embodied reasoning.arXiv preprint arXiv:2510.11027, 2025b","venue":null,"work_id":"967c9002-b47c-4738-86de-c706820dfd2b","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e4d178bfbe548167cc21dbce620994c8d6d545244e2dfa364d180a923b1f623b","observation_id":"2841ee5a-1afe-4dee-b816-c0eceeb941d2","resolution":{"observed_at":"2026-06-29T13:43:28.842607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:daa47eafa8ab7dcc1ffb47b2ca6c56ac9ebd84e32962fc63bb547a23fc12c110","observation_id":"2a47a3e9-d31b-4b46-bae8-a1979ec1f024","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":"2412.14171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-07-04T06:29:37.915954Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","venue":"cs.CV","work_id":"bbaf0f51-258a-4d79-b5a4-5b1e9120b2c0","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:fb8990c73a2bfabf7320bf07a8ac1c35d634b6980428687af23bbb0a3d28904d","observation_id":"901bbc8e-98cc-4570-a9e3-b2c672d4005b","resolution":{"observed_at":"2026-06-29T13:43:28.855009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05491","doi":"10.48550/arxiv.2511.05491","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":"arXiv (Cornell University)","work_id":"98823083-5573-413f-a371-f50911725458","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0d35a55061cd1edd48e797aff69c8e79be68a692d7304ab1cbcc8bfe5d3c63c2","observation_id":"2a18153b-99ac-4dbf-9a69-f2b2503746d5","resolution":{"observed_at":"2026-06-29T13:43:28.873798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":"2511.04670","doi":"10.48550/arxiv.2511.04670","metadata_source":"pith","pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","venue":"cs.CV","work_id":"f715ecad-ad1d-4060-9a4c-bdb41257ef61","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:089cdfce66b89a049518f481a19afd494acd54995343087bd0d84a3eadc06a1e","observation_id":"9e1f3388-9e16-4361-bcd6-c0826a546caf","resolution":{"observed_at":"2026-06-29T13:43:28.833403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.23764","doi":"10.48550/arxiv.2505.23764","metadata_source":"pith","pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":"cs.CV","work_id":"3c86b01a-2b7e-4a70-94c5-92bf4d05ad52","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:1cc69d3c77846b5aa53b506a9ae21ff6d2e0135a680ed5720c1da0857753ce77","observation_id":"cc10bdb9-2a05-4871-bab4-2bd054ce30db","resolution":{"observed_at":"2026-06-29T13:43:28.844628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-05T14:54:25.138860Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:c7810d5a1cdf121cfdcdae36df2e2960d55380f66281a0dff22a01eec359afc3","observation_id":"34de4d10-d593-4454-b3e4-34752fbae90a","resolution":{"observed_at":"2026-06-29T13:43:28.911677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0be9ba99b5287d7112f42b767a22763bec92c0c6a363e59b215e3e4815cf97e9","observation_id":"18754250-5f34-488e-bf35-4046fb1c6787","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Spatial mental modeling from limited views","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:267589a2daf7794e2d8071d30bad4794ca2676deb866aa5eadc9de16bf20922f","observation_id":"bd951bdd-e0a6-4387-9914-8c31179266e7","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.350063Z","title":"Depthvla: Enhancing vision-language-action models with depth-aware spatial reasoning","venue":null,"work_id":"16c300ae-4c10-4266-aa06-0541694dec38","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:624d53f030c04778e527eafe70b1200f1d2c9a370d728b02d43b3c7d170ab692","observation_id":"4fe380c9-921a-40f9-a01a-1e5fbc9e33eb","resolution":{"observed_at":"2026-06-29T13:43:28.837226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:54f037a4c01c7de9bb2c0aba3d15a1157429dae9b5e582b3c8117fcfed8bd186","observation_id":"16fc1a9d-0a96-405d-833a-d9b5e6981623","resolution":{"observed_at":"2026-06-29T13:43:28.820593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-03T11:31:47.613184Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.13998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13998","snapshot_observed_at":"2026-07-05T11:41:02.552079Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","venue":"cs.RO","work_id":"f05e0aa4-cd13-45c4-ac8f-a4c25dcdd0ee","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.13998","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:4a0260c3d38ad0e163395e135dddbbf5f4c32634902aeaff6880361653ad916a","observation_id":"ac05f819-a2e2-4e5f-a106-eb4f53d22e91","resolution":{"observed_at":"2026-06-29T13:43:28.817755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":"2403.03954","doi":"10.48550/arxiv.2403.03954","metadata_source":"pith","pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","venue":"cs.RO","work_id":"bded01e1-c070-4537-a75a-ace4c75d0c95","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:3484e3a7368fa18fa06c462aef81cfdee572131b0c0e4e0f036a8cdea6995f55","observation_id":"d81748c7-be38-4348-8b05-e7dd10731347","resolution":{"observed_at":"2026-06-29T13:43:28.815179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.22976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:08:55.623773Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d","venue":null,"work_id":"60222cd1-f5cd-4823-b69a-7b3fe8bc87a2","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:87cd75561c320fb5c34170e8696e1c3de3c5dfa61c0e55f56d659cc09bee2718","observation_id":"f39df5ec-2370-4c23-ad8f-fc59df839686","resolution":{"observed_at":"2026-06-29T13:43:28.791564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:716d3b14d13d5d3fdc498d48a7e8f0d7a026596e73ff8130e16d661615c49983","observation_id":"0e610237-103c-4e29-85ab-bfb040883cc3","resolution":{"observed_at":"2026-06-29T13:43:28.812492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":"2507.04447","doi":"10.48550/arxiv.2507.04447","metadata_source":"pith","pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","venue":"cs.CV","work_id":"830b1108-8122-404f-a791-f926fbc48669","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:f9565ad573a776daebe3498ed6d1ccbfe63f98b1e97227372bc330b2e223ddda","observation_id":"a51b2dcf-2af1-4390-b5cb-3398cac4ac65","resolution":{"observed_at":"2026-06-29T13:43:28.138463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:29:35.705946Z","title":"Zhang, C","venue":null,"work_id":"85394d33-ff7b-47d5-8364-05cfa3406920","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:5460ee272770af6819435d91b079dc9afbf6d573ec1160db38e51f6944be13c4","observation_id":"0df22255-3ef6-4892-a4ba-11ee48feff11","resolution":{"observed_at":"2026-06-29T13:43:28.820997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:2c1b6b603f484cf6b643c3893087878a64d8ee4bf41dac0c8386701795616c92","observation_id":"fe4372dc-fa7b-47b5-8963-6475ddf37df7","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00987","last_updated":"2024-05-27T09:51:37Z","snapshot_observed_at":"2026-07-06T17:53:51.988186Z","submitted_at":"2024-04-01T08:20:18Z","title":"FlexiDreamer: Single Image-to-3D Generation with FlexiCubes","version":2},"cited_work":{"arxiv_id":"2404.00987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00987","snapshot_observed_at":"2026-06-29T13:43:28.807484Z","title":"Flexidreamer: Single image-to-3d generation with flexicubes","venue":null,"work_id":"35263b62-ec1f-4555-971b-7b9bc524fd61","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2404.00987","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:a6d666082fa623121099c164f295058530bacc175680df36cdb4cb109e629efc","observation_id":"fe1324de-d757-4bcd-8f4d-16d37117c13d","resolution":{"observed_at":"2026-06-29T13:43:28.809289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:38:27.263726Z","title":"Deepmesh: Auto-regressive artist-mesh creation with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:3ef45db1bb1b25d9a8aa0ad07bf86993f6dc3d24546b4d967a510d3750f88f2d","observation_id":"87a8e034-e975-4b8f-a6ad-596d92d895fe","resolution":{"observed_at":"2026-06-29T13:38:27.263726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8aacbdb995e342b1f098c1f9287350a276665559e44c6fd37cb5ecec3bdc7fcf","observation_id":"cedfbd86-02c0-40c5-8fa6-fba9b19e4bdc","resolution":{"observed_at":"2026-06-29T13:43:28.812321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:84349d160b47846d2d738f5fa3e787351865944ae935e1afdcf0dc238a1f4752","observation_id":"50c0f55d-bc2f-4a19-807f-bc9bcee0951a","resolution":{"observed_at":"2026-06-29T13:43:28.803323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.026359Z","title":"RoboRefer: Towards spatial referring with rea- soning in vision-language models for robotics","venue":null,"work_id":"fda95042-555b-4a64-9d35-7978eb50b269","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:8862a291f67d7b1040f23daf20cf5efa923cba2ab24e45bf0ff5edc30788d017","observation_id":"5438bedc-2204-4b28-8b6d-4a5f7b2dcc1d","resolution":{"observed_at":"2026-06-29T13:43:28.823705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.09847","last_updated":"2018-01-30T04:33:20Z","snapshot_observed_at":"2026-07-06T06:20:51.245757Z","submitted_at":"2018-01-30T04:33:20Z","title":"Open3D: A Modern Library for 3D Data Processing","version":1},"cited_work":{"arxiv_id":"1801.09847","doi":"10.3390/s17020243","metadata_source":"pith","pith_arxiv_id":"1801.09847","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open3D: A Modern Library for 3D Data Processing","venue":"cs.CV","work_id":"5e7f71f1-ed19-49c9-bc1c-fd5ed4ad5434","year":2018},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/1801.09847","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:e1eaf847220bf1936f590a87d3bcf40b3178c565b652bcdbf4355bdfc5a6797c","observation_id":"60ac761d-65ae-454b-a709-412f26e1fbbe","resolution":{"observed_at":"2026-06-29T13:43:28.832119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":27,"verified_exact":69,"verified_fuzzy":0},"total_outbound_references":102},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 102 outbound references and 3 inbound Pith citation observations for arXiv:2605.28548."}