{"as_of":"2026-08-10T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6045abf4b1896e575448d147d1263b7c78ffc1c274b321eae94ddddefa7df943","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:33:55.651566Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:57.174397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T19:19:42.748573Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2505.17685"},"observation_digest":"sha256:eee7ecc917d4cfff44c1144af0046a4ecc142babab04dab11f3b3ee7a7f6c981","observation_id":"7f957329-1602-4060-b1fb-d8301b5ef22a","resolution":{"observed_at":"2026-05-15T19:19:42.874884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-06T22:21:09.315435Z","title":"arXiv preprint arXiv:2505.21432 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21853","last_updated":"2025-09-07T09:44:32Z","snapshot_observed_at":"2026-08-08T23:09:09.540288Z","submitted_at":"2025-06-27T02:08:40Z","title":"Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:09.315435Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2506.21853"},"observation_digest":"sha256:d50520d12ccc79bcf41014f3949863c1a33292b6917579bdcf37e9fa390eeef1","observation_id":"9943f6b5-3f45-44ca-a277-c0385c11385e","resolution":{"observed_at":"2026-08-06T22:21:09.315435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:5d788507456f3c5cb2c6eb3b5baab14dbe8297f42afefde3e87378c8f803d3b8","observation_id":"bf1e6f74-a5fa-4853-a89d-9d6deb14871f","resolution":{"observed_at":"2026-05-16T15:42:41.581802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:d56101fdb609c6fdf99fbaf68d54c4640894fe1faec59d7c549169ef0a97bf31","observation_id":"e6c42ed0-3a1e-41ec-be9f-2ac5e9d0b556","resolution":{"observed_at":"2026-05-16T12:42:47.069003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:c213d9ba25753c67a6c4d10394d38a06f5d574969bb5110a2abcf79ef7e8cf16","observation_id":"3edc250c-f891-48c5-987d-ad183462ea08","resolution":{"observed_at":"2026-05-14T20:09:39.902748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-04T09:08:11.780961Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:11.780961Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:a02491bd38b3d1998b30d6233d352f5d23a19e2d1bf7bbcc99b81bbf8ddb7808","observation_id":"c5a28893-c809-42c3-bf40-11c38ea3f232","resolution":{"observed_at":"2026-08-04T09:08:11.780961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:a8354e85b49570921fcf94a17188cfebc9f5614a47c90b3267c0b800761cff0f","observation_id":"fa07afbc-06fa-432a-b218-afd5a0eb7310","resolution":{"observed_at":"2026-05-25T07:00:26.042642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T20:18:05.030889Z","title":"Hume: Introducing system -2 thinking in visual -language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-08T06:33:40.080560Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.030889Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:2c4b464c6785b08f593c3899df4451a38fc0116fd9d8abed7739d041d4941563","observation_id":"150d728d-7652-4a3c-bc24-46f9e1ba84ac","resolution":{"observed_at":"2026-08-02T20:18:05.030889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-15T12:10:54.741769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.09170","last_updated":"2026-06-24T04:09:53Z","snapshot_observed_at":"2026-07-15T12:10:52.932866Z","submitted_at":"2026-03-10T04:19:43Z","title":"ZeroWBC: Learning Natural Whole-Body Humanoid Interaction from Human Egocentric Data","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T12:10:54.741769Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.09170"},"observation_digest":"sha256:eeff6550b2024d5a6e8a1dc65e5203806a74528b59e779d1281c80f8773670a2","observation_id":"73a9281f-48a8-4fa0-a5d9-b79e4083dc45","resolution":{"observed_at":"2026-07-15T12:10:54.741769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2603.10126","last_updated":"2026-05-11T15:13:54Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:03:29Z","title":"AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T12:50:02.670780Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.10126"},"observation_digest":"sha256:3f4a7e9f5d707052bddf7dd21242085e1ed9bc571055e7c16edba85b7267efcd","observation_id":"e773579a-6a7d-4e0d-8a2f-5b3e8483c3fb","resolution":{"observed_at":"2026-05-15T12:50:37.167968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:40.836234Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.13842"},"observation_digest":"sha256:9dcce89cdb54c3c28c30b2fae248ccc44564df43368815d158b96781557dfa33","observation_id":"8deee7bd-f6c2-4f84-b333-13298a69cef4","resolution":{"observed_at":"2026-05-15T11:59:59.527563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-13T19:53:53.219607Z","title":"Hume: Introducing system-2 thinking in visual- language-action model.arXiv preprint arXiv:2505.21432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23082","last_updated":"2026-06-05T20:06:49Z","snapshot_observed_at":"2026-08-06T13:01:12.022501Z","submitted_at":"2026-03-24T11:25:52Z","title":"Spatial navigation in preclinical Alzheimer's disease: A review","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-13T19:53:53.219607Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2603.23082"},"observation_digest":"sha256:dc09a538d0034be78a184f81db3a0ae7f3112b6eb197e1bcf42e78e39f929126","observation_id":"635e0017-9b9f-4d17-b2f7-0e961982ed91","resolution":{"observed_at":"2026-07-13T19:53:53.219607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.02241","last_updated":"2026-04-10T14:04:42Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-04-02T16:33:38Z","title":"UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T21:40:30.771335Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.02241"},"observation_digest":"sha256:cc503c9b58785a66e5386a98a68e50e009f9d85145458865c50994ca803aa05a","observation_id":"5241d33f-930f-4b74-8528-f7da22a0e8d4","resolution":{"observed_at":"2026-05-13T21:43:19.018696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.03306","last_updated":"2026-03-31T02:54:21Z","snapshot_observed_at":"2026-07-06T22:52:29.705312Z","submitted_at":"2026-03-31T02:54:21Z","title":"Deep Image Clustering Based on Curriculum Learning and Density Information","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T00:03:05.442554Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.03306"},"observation_digest":"sha256:4552059e6be4c2c154d708efce875a4464c71736826ef91815eed6d5fc67ba9b","observation_id":"90f67b5f-aacf-4d18-a407-f2dfa1a89af7","resolution":{"observed_at":"2026-05-14T00:03:28.527131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2604.04161","last_updated":"2026-04-10T12:28:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-05T16:03:32Z","title":"Adaptive Action Chunking at Inference-time for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T16:57:52.595165Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2604.04161"},"observation_digest":"sha256:6af07deeb6beeb89a92155d57a5bccfb53b624928aed1648af243b5194fe07c3","observation_id":"28a5c88f-922d-4a9e-afe3-e79a16620ddd","resolution":{"observed_at":"2026-05-13T17:08:01.503826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-08T16:03:51.103968Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T15:14:03.865035Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:dc291daaac615b90ac08233dcceea15aa65e586fb6ff1a5014e462b79fd12e0e","observation_id":"bce58944-e575-4e19-aeeb-2f96c4ab1f0d","resolution":{"observed_at":"2026-05-11T16:46:04.809662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-08-08T16:03:51.103968Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T01:10:48.111387Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:9fe1271720df3b1ed9f4befb20e11429ec793804d1c6466ef42ea23b8f298230","observation_id":"c66e8685-deec-4791-a0d1-cde96d09ed9f","resolution":{"observed_at":"2026-07-01T13:05:45.064730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01194","last_updated":"2026-05-02T02:13:11Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T02:13:11Z","title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T15:10:16.533927Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01194"},"observation_digest":"sha256:1bfc04f8ca12b0124d31f41b7e8b115d2937a2113e9197519cc9242cb1e52131","observation_id":"c8b0042f-638e-4de8-b0bf-1858489ed884","resolution":{"observed_at":"2026-05-11T16:46:06.358813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01581","last_updated":"2026-05-29T06:35:10Z","snapshot_observed_at":"2026-08-04T09:16:03.156221Z","submitted_at":"2026-05-02T19:07:09Z","title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T03:47:16.205357Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01581"},"observation_digest":"sha256:9f9d721a7152cabdca1c11eb426b66ce86fa9bbef80171c82ef2bb733e9b0fc0","observation_id":"9237db13-56b0-4f9c-8a7b-61c5ff07d408","resolution":{"observed_at":"2026-05-12T06:56:30.361693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.01581","last_updated":"2026-05-29T06:35:10Z","snapshot_observed_at":"2026-08-04T09:16:03.156221Z","submitted_at":"2026-05-02T19:07:09Z","title":"Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T00:18:14.307099Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.01581"},"observation_digest":"sha256:b80d4c77eccc46ddde97482476b7a4a111a8e998ba7130382526e2dd362fc109","observation_id":"2913645b-6fa2-4e10-8c4d-453eb1512fbb","resolution":{"observed_at":"2026-07-01T00:25:09.759639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:7bbc52ce8432992bcdf2c17933cd22946b1db148a72e1caaf8c4cf47cc76ae0b","observation_id":"30972e20-377c-40dd-b05c-ff820df2d8c4","resolution":{"observed_at":"2026-05-13T05:12:18.267361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:57:25.010339Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:5282baf543474ce47db65e85eece0f08ef71e8d17db6bfe31ee1d51079e43d7c","observation_id":"0c5495cd-9e10-45be-8883-67a3eef00e56","resolution":{"observed_at":"2026-07-02T21:07:23.737640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T12:13:46.004799Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08015","last_updated":"2026-07-19T14:50:06Z","snapshot_observed_at":"2026-08-02T23:41:02.702950Z","submitted_at":"2026-06-06T07:10:25Z","title":"Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.004799Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.08015"},"observation_digest":"sha256:9b327883c7928cff2b52403a5f4f0aa82958886df6f36cf4c94e4bd7ee297b0d","observation_id":"de9b08b3-5e48-45e1-9deb-259b4f49c5da","resolution":{"observed_at":"2026-08-02T12:13:46.004799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.17924","last_updated":"2026-06-16T13:38:03Z","snapshot_observed_at":"2026-08-08T15:58:38.583682Z","submitted_at":"2026-06-16T13:38:03Z","title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:58.312567Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.17924"},"observation_digest":"sha256:c69c8dcd1e20fd1985ecb4e616d9a1e4e0154a41e4bdbce01612adcc2045e874","observation_id":"5e3fd18b-156e-424d-98fa-ba4770f928df","resolution":{"observed_at":"2026-07-03T20:58:58.507228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.22794","last_updated":"2026-06-22T03:10:19Z","snapshot_observed_at":"2026-08-04T03:01:53.810285Z","submitted_at":"2026-06-22T03:10:19Z","title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T08:57:01.861091Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.22794"},"observation_digest":"sha256:1e43dfb07afdd2707dae05e611013805070f14d81d438a023fbf76312473e0c8","observation_id":"53e4a2ea-4c7a-4e32-b782-a1ccb57258a1","resolution":{"observed_at":"2026-07-04T10:19:47.647699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:7c736411baf619c3d5870fa01b3dea2cec856d76b203510f7ef110ecec7b5f3d","observation_id":"8cf1726e-96e8-4ac7-8326-8919eb2502a4","resolution":{"observed_at":"2026-06-27T04:40:32.814702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.27268","last_updated":"2026-06-25T16:50:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T16:50:21Z","title":"E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T04:48:28.868562Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.27268"},"observation_digest":"sha256:5b4527542a78348f6242c189589b5c3f8550f90f69f6d7568cca0a3b68f38936","observation_id":"a96ac403-2fb8-43bc-bf7f-951da40ff893","resolution":{"observed_at":"2026-07-04T13:59:51.756964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.28374","last_updated":"2026-06-17T14:53:36Z","snapshot_observed_at":"2026-08-05T05:47:13.101802Z","submitted_at":"2026-06-17T14:53:36Z","title":"Recursive Self-Evolving Agents via Held-Out Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:13:15.923479Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.28374"},"observation_digest":"sha256:01a4f76f302ae39aa9852e0fecccaa5c7202af9d636856cd367d122eb668d37d","observation_id":"1c1c081c-dc97-461f-81d4-34b61c42e28c","resolution":{"observed_at":"2026-06-30T11:14:37.572040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2606.30686","last_updated":"2026-06-28T14:03:57Z","snapshot_observed_at":"2026-08-02T00:28:44.079969Z","submitted_at":"2026-06-28T14:03:57Z","title":"Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T06:56:45.197407Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2606.30686"},"observation_digest":"sha256:eebaafc443c699aca62650b67e4e1baf619103804dab11eb919e10fe6e0d3b0c","observation_id":"6d0ce5b9-3a94-40f1-b56c-203336e675e1","resolution":{"observed_at":"2026-07-01T08:55:35.827744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":"2505.21432","doi":"10.48550/arxiv.2505.21432","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hume: Introducing system- 2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432","venue":"ArXiv.org","work_id":"b96accc3-be4c-4b60-a0a0-2c05e865942b","year":2025},"citing_paper":{"arxiv_id":"2607.01088","last_updated":"2026-07-01T15:45:08Z","snapshot_observed_at":"2026-08-02T11:41:51.446909Z","submitted_at":"2026-07-01T15:45:08Z","title":"ROSA: A Robotics Foundation Model Serving System for Robot Factories","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-02T11:11:39.584755Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.01088"},"observation_digest":"sha256:7236f53e6d14551cd0b3eba3c19153f6f3083735bacc2334227e087cd39f492b","observation_id":"984e3d47-f327-4463-81e0-474103ed5288","resolution":{"observed_at":"2026-07-02T11:16:52.678721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-12T00:12:42.173815Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03751","last_updated":"2026-07-04T07:53:10Z","snapshot_observed_at":"2026-08-08T12:53:45.209498Z","submitted_at":"2026-07-04T07:53:10Z","title":"Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:12:42.173815Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.03751"},"observation_digest":"sha256:9b7c3498cc6130e28e1452998356b5ee51cfd2d79b149a87633c4ab5344f59a6","observation_id":"67504498-1254-428f-91dc-015b7465a512","resolution":{"observed_at":"2026-07-12T00:12:42.173815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ed51e1fb6ca23a328fda887f352c1d0863aa6e47b0b12ae59a68178b31b94527","observation_id":"73f704b0-a5e4-469e-b3e9-0953aa79b3a5","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T07:19:41.336447Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.336447Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:5f5a8fa5d6e3200df0b46481a9ce32d495112649c49536aa5d7c0d0c362a4fb8","observation_id":"5efd68fd-27c8-462e-ab83-5827f5d3a342","resolution":{"observed_at":"2026-08-02T07:19:41.336447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T00:30:57.030649Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.030649Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:c7150bc66948a3a64939eaf05b806e2f9d55d35899bcb6aee0a6723a5a7e7176","observation_id":"9c83eae8-90ec-454b-8d38-30cba65811db","resolution":{"observed_at":"2026-08-02T00:30:57.030649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-01T19:56:57.191876Z","title":"Hume: Introducing system-2 thinking in visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16806","last_updated":"2026-07-18T12:55:40Z","snapshot_observed_at":"2026-08-09T06:56:01.071812Z","submitted_at":"2026-07-18T12:55:40Z","title":"Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T19:56:57.191876Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.16806"},"observation_digest":"sha256:3f379773edfb4a3f7cf314f2484533dac714aae75dd1c4ad92580ea3f37b421b","observation_id":"d8f48e30-f03c-4298-aa2d-b3bd694feb13","resolution":{"observed_at":"2026-08-01T19:56:57.191876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-10T04:30:57.174397Z","title":"Hume: Introducing system-2 thinking in visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06434","last_updated":"2026-08-06T06:32:27Z","snapshot_observed_at":"2026-08-10T10:09:54.756723Z","submitted_at":"2026-08-06T06:32:27Z","title":"Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T04:30:57.174397Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2608.06434"},"observation_digest":"sha256:468f9f381501dcc4bfdb9059c52114f222cc9e0cf5a5bd943fd3265c9a839b34","observation_id":"c3761f79-4d71-4820-b142-ab1456f4d407","resolution":{"observed_at":"2026-08-10T04:30:57.174397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21432/citation-record","integrity":"/paper/2505.21432/integrity","json":"/paper/2505.21432/citation-record.json","paper":"/paper/2505.21432"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:46.176151Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.176151Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:b67d0c813438bd2dfdad7c6c5920701b3cc79204b4ff098da5f5dae1cb58a8a5","observation_id":"81007fef-4341-4caf-a768-4a4bb9bd60e8","resolution":{"observed_at":"2026-08-07T13:33:46.176151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T13:33:46.316972Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.316972Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:21ee941ad064b4b9b73ee2c32356ac80888784e1116120803852eac9ce33b8f6","observation_id":"a679ba6e-d086-424b-9449-b56e638d267f","resolution":{"observed_at":"2026-08-07T13:33:46.316972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.552000Z","title":"Fastumi: A scalable and hardware-independent universal manipulation interface with dataset","venue":null,"work_id":"f1fd961a-5153-4739-a07d-76738b6d40f5","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.445264Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:50ab7a6889c1308c38de513ad2b427274624e7c59832005c4d34415e5b955279","observation_id":"fbb5c2de-20a4-4c51-9fb5-d85fe417456e","resolution":{"observed_at":"2026-08-07T13:34:01.649706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T13:33:46.578291Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.578291Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:27e6474446ff5b9535387816600b1395e53ab1e4e5fce6a0100dd87246cbc7b0","observation_id":"f7a06d05-3a29-4c1f-aa89-74229fc47b72","resolution":{"observed_at":"2026-08-07T13:33:46.578291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.394821Z","title":"Learning 2d invariant affordance knowledge for 3d affordance grounding","venue":null,"work_id":"f6511644-58f9-4d51-a272-9690a66b4933","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.673699Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:10719946537e62126103a53a08b727ead71279245d9ff202de953a8e976b57fb","observation_id":"72bb9ad0-c3ad-4caf-92d2-0ae9f341887a","resolution":{"observed_at":"2026-08-07T13:34:01.457287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T13:33:46.813552Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.813552Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:81370a9600d21ca32d98059e8a688073579e61f03675fbfdf315d345e69c8657","observation_id":"523ae9b6-ae5a-4258-84ba-9c07faaa7f70","resolution":{"observed_at":"2026-08-07T13:33:46.813552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.232949Z","title":"Improving domain generalization in self-supervised monocular depth estimation via stabilized adversarial training","venue":null,"work_id":"4d95a7d3-8436-4b79-8c6f-f7f6ba128ab0","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:46.961211Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:cf70f7fe3e7f97c4751405d04157670f4aad88521d25be8c45a0efe94c90f81f","observation_id":"b16ca1ec-1d7f-44e0-94fd-da39d0af58cc","resolution":{"observed_at":"2026-08-07T13:34:01.302774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11081","last_updated":"2025-03-14T04:47:38Z","snapshot_observed_at":"2026-08-07T17:05:01.936206Z","submitted_at":"2025-03-14T04:47:38Z","title":"MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11081","snapshot_observed_at":"2026-08-07T13:33:47.040696Z","title":"Moma-kitchen: A 100k+ benchmark for affordance-grounded last-mile navigation in mobile manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.040696Z"},"links":{"cited_paper":"/paper/2503.11081","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e338cae4291e305539fbb340632a0ccb478a245109392463eba1ce877f22d75a","observation_id":"4a1439db-2ae7-4131-a03b-830828a63ccd","resolution":{"observed_at":"2026-08-07T13:33:47.040696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13707","last_updated":"2024-10-20T05:23:35Z","snapshot_observed_at":"2026-08-04T10:51:31.728813Z","submitted_at":"2023-09-24T17:40:19Z","title":"ORLA*: Mobile Manipulator-Based Object Rearrangement with Lazy A Star","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13707","snapshot_observed_at":"2026-08-07T13:33:47.143573Z","title":"Orla*: Mobile manipulator-based object rearrangement with lazy a star","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.143573Z"},"links":{"cited_paper":"/paper/2309.13707","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:cb3c2884cafdf25fa7f4cddacf7a5878faab218056487d2515056a22008346be","observation_id":"e4c00cb3-77d4-4214-b80e-5fa8af747019","resolution":{"observed_at":"2026-08-07T13:33:47.143573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15836","last_updated":"2025-09-02T08:16:33Z","snapshot_observed_at":"2026-08-06T22:05:24.604541Z","submitted_at":"2024-06-22T12:40:03Z","title":"Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15836","snapshot_observed_at":"2026-08-07T13:33:47.253710Z","title":"Decentralized transformers with centralized aggregation are sample-efficient multi-agent world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.253710Z"},"links":{"cited_paper":"/paper/2406.15836","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e9706283e4a499de1214b86e882b372bcd3428c27ff4f1be0f57201471e0b6b2","observation_id":"5f130c18-80c5-4cd6-9397-eb6338f72955","resolution":{"observed_at":"2026-08-07T13:33:47.253710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T13:33:47.358067Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.358067Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f1ca504fc1e28661507a28a042b5dd360ad8911dff73b392b9d07cf75b80f2d2","observation_id":"94eaf881-2020-449e-ab3a-2b66d3dc8480","resolution":{"observed_at":"2026-08-07T13:33:47.358067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T13:33:47.463400Z","title":"A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.463400Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:08cac31e87144f228b40496ad07e6a7d0543d10b2399c6843f7bd8a1257a3755","observation_id":"7b973670-3451-42d6-ada0-178115d937c5","resolution":{"observed_at":"2026-08-07T13:33:47.463400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:47.579910Z","title":"Thinking, fast and slow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.579910Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:38b73cfcaa513213dbcfeb26cb7e3e9c958f367e0b236bb1257b4cbd49b8075d","observation_id":"c5d2e319-e561-438f-b073-5c14a9713627","resolution":{"observed_at":"2026-08-07T13:33:47.579910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15146","last_updated":"2025-03-29T14:57:20Z","snapshot_observed_at":"2026-07-31T17:55:12.879597Z","submitted_at":"2024-09-23T15:53:41Z","title":"COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15146","snapshot_observed_at":"2026-08-07T13:33:47.705703Z","title":"Coherent: Collaboration of heterogeneous multi-robot system with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.705703Z"},"links":{"cited_paper":"/paper/2409.15146","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:9368150b4aa64cdf4e13a02d5117b7b037872ebb0e1ea3431ffbee5da54aa78f","observation_id":"7005a5ee-e8a7-4078-b940-90adc3152e70","resolution":{"observed_at":"2026-08-07T13:33:47.705703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:01.117598Z","title":"Kinematic- aware prompting for generalizable articulated object manipulation with llms","venue":null,"work_id":"d0bfe7a0-8d81-4db0-a8a1-f4e6e4c0b700","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.802501Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ddba46c0ef0d880d91fb5305ec45308b8f3105071506d94e1854d2210f408a60","observation_id":"dad5dba8-74ae-4f28-932a-592062ea71e2","resolution":{"observed_at":"2026-08-07T13:34:01.141533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08840","last_updated":"2025-06-12T03:06:12Z","snapshot_observed_at":"2026-08-08T22:54:36.294357Z","submitted_at":"2025-06-10T14:25:58Z","title":"MoRE: Mixture of Residual Experts for Humanoid Lifelike Gaits Learning on Complex Terrains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08840","snapshot_observed_at":"2026-08-07T13:33:47.950909Z","title":"More: Mixture of residual experts for humanoid lifelike gaits learning on complex terrains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:47.950909Z"},"links":{"cited_paper":"/paper/2506.08840","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:44ac4e99979aae0dfe725a1180937825d06006e94802b0318b2f3c303cceddad","observation_id":"8c35e3b9-4873-4117-a821-d10f28fa2b16","resolution":{"observed_at":"2026-08-07T13:33:47.950909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21853","last_updated":"2025-09-07T09:44:32Z","snapshot_observed_at":"2026-08-08T23:09:09.540288Z","submitted_at":"2025-06-27T02:08:40Z","title":"Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21853","snapshot_observed_at":"2026-08-07T13:33:48.084439Z","title":"Skill-nav: Enhanced navigation with versatile quadrupedal locomotion via waypoint interface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.084439Z"},"links":{"cited_paper":"/paper/2506.21853","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f06cc0f0e088d3ee05845ac4e3e748b1734d1383c795138fa317512572fae76d","observation_id":"6dddf33d-15cc-4694-939f-d600362909b7","resolution":{"observed_at":"2026-08-07T13:33:48.084439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:48.230494Z","title":"Robotic policy learning via human-assisted action preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.230494Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c5e4d144c41f1a453763d19535d47daf233f7bf91986d68dbacb3c55bed4d65f","observation_id":"597e2a01-7034-4650-b63b-32cafef1ea61","resolution":{"observed_at":"2026-08-07T13:33:48.230494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.916621Z","title":"Phoenix: A motion-based self-reflection framework for fine-grained robotic action correction","venue":null,"work_id":"46e3eddb-e275-4dad-ae07-da0647d2c607","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.361825Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:7a03566a23bbecdc60bef1f54a6ae60672d3e17c756d92d347833764332920fd","observation_id":"92e6060e-9b8b-44a7-a2c4-33d3bfb0e455","resolution":{"observed_at":"2026-08-07T13:34:00.991650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00420","last_updated":"2025-06-01T18:46:06Z","snapshot_observed_at":"2026-08-07T16:18:35.468522Z","submitted_at":"2025-04-01T04:55:34Z","title":"Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00420","snapshot_observed_at":"2026-08-07T13:33:48.487515Z","title":"Think small, act big: Primitive prompt learning for lifelong robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.487515Z"},"links":{"cited_paper":"/paper/2504.00420","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d2dc79392219f6c5bd1194b022b496f990a0ef7e814e600af308bcc905227c9d","observation_id":"85cd5166-56d9-467d-ae2d-9aa866a98f5e","resolution":{"observed_at":"2026-08-07T13:33:48.487515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.764177Z","title":"Spatial-temporal graph diffusion policy with kinematic modeling for bimanual robotic manipulation","venue":null,"work_id":"ccbf535b-0e14-4095-ad6a-db196c0db5f8","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.605623Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f0a0fd53b66f8c93b5887b6797db5b508630d116e016e8427ddb3eec0db2d70e","observation_id":"1aa81f56-cba4-40c7-b47d-aabcf0641517","resolution":{"observed_at":"2026-08-07T13:34:00.854828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.590418Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"44dcefd3-2921-4c27-89a8-138101e11d3e","year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.729701Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d7342bafc620e95cd38233f77e08d35a6ed4018eeb3738089fd38195dc35e4a4","observation_id":"1af8d243-7c3a-4325-b55d-d0415085ca79","resolution":{"observed_at":"2026-08-07T13:34:00.688344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T13:33:48.892757Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:48.892757Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:565e56701e4c0385c73e83da527d3010d1eac348547605427c5935d1fee6a010","observation_id":"33ca2d67-8cba-48d1-8c09-e441a74ddea4","resolution":{"observed_at":"2026-08-07T13:33:48.892757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.344624Z","title":"A dual process vla: Efficient robotic manipulation leveraging vlm","venue":null,"work_id":"888207c0-7f3c-44ea-ae57-8a1ce8c702da","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.081807Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:735e89e9805a3c4749a236fe22e4d0641b392820d41020f6b3f8b3b7c6137131","observation_id":"afbe1c2c-f490-4a80-a099-310c6b6a865f","resolution":{"observed_at":"2026-08-07T13:34:00.459634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-07T13:33:49.257537Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.257537Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c22dce61507b842ba9701d96ee20018b09239f729a61f210683d0f76320c6fee","observation_id":"0593f14e-de49-4900-97f9-ced694cb1150","resolution":{"observed_at":"2026-08-07T13:33:49.257537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-07T13:33:49.385522Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.385522Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ce6e1f7dca6415ab73830073638832a4085b81567174db98e12c2a806126df24","observation_id":"fbc7f4d3-eef8-4e1c-9eb2-c8f2cbfe781d","resolution":{"observed_at":"2026-08-07T13:33:49.385522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T13:33:49.511193Z","title":"Dexvla: Vision- language model with plug-in diffusion expert for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.511193Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:351238bd211c3b77e15c2d8ea3dce55827d7d1509b8ae69caa23ae78e266a66e","observation_id":"5ca8f132-157a-4cc0-a0b7-b44fbf22ab28","resolution":{"observed_at":"2026-08-07T13:33:49.511193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T13:33:49.614480Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.614480Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:abf0665746b3d28c30fb74c5fdefdf29eefed0359a86a25af77af24183525384","observation_id":"3c1db6a1-da02-49f4-a743-2c29061bc1a0","resolution":{"observed_at":"2026-08-07T13:33:49.614480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-07T13:33:49.760140Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.760140Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:6d1cb9d3601406016c5bc9f15caea957753e71849ccff319fe6c16b3491d9f8d","observation_id":"faf03009-fb2c-461a-bd4d-14ef462cf812","resolution":{"observed_at":"2026-08-07T13:33:49.760140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.131743Z","title":"Helix: A vision-language-action model for generalist humanoid control, 2025","venue":null,"work_id":"bd94ee99-29fc-4448-90b3-7d504ccfbc1b","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:49.915193Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:6d652274dc2ae61aa8a7b21adf190d714966c7f4669ec3243f0ceca8219758ea","observation_id":"f3b374f1-6e31-40ef-983a-45e2b9a5fa7a","resolution":{"observed_at":"2026-08-07T13:34:00.206921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T13:33:50.042676Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.042676Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d9ef1e99302a96a4abd95b64ab93815f4503fd4d5dbfa6194e27fe25284b21ca","observation_id":"32fb4798-d4e5-4b97-82c7-86ae6160cf74","resolution":{"observed_at":"2026-08-07T13:33:50.042676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23346","last_updated":"2025-05-29T11:10:41Z","snapshot_observed_at":"2026-08-10T10:29:25.022661Z","submitted_at":"2025-05-29T11:10:41Z","title":"Beyond Optimal Transport: Model-Aligned Coupling for Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23346","snapshot_observed_at":"2026-08-07T13:33:50.178954Z","title":"Beyond optimal transport: Model-aligned coupling for flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.178954Z"},"links":{"cited_paper":"/paper/2505.23346","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:9c5945e389b142496d2459bd97f14c0ecbdc82e9d1cb1616a901182bbc8c7876","observation_id":"e36e8996-aef0-42d3-9da8-5e096f4a255c","resolution":{"observed_at":"2026-08-07T13:33:50.178954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-07T13:33:50.325026Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.325026Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c04abe3f6bd910e74d7ad67643ebeaa01f4f01e6f86f8db28f536fbad77065f2","observation_id":"4e2d2e85-f720-40dd-9f4e-71daf55ff675","resolution":{"observed_at":"2026-08-07T13:33:50.325026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:00.001813Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":"eb87de91-188e-4cec-ad32-60763dc2209b","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.473479Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c8f970137dc78c11d3fcba48bf699cc11c4ccdb19ca39d12fe0471a954d7112b","observation_id":"ed099548-4729-4806-a43b-4047d2b92ee5","resolution":{"observed_at":"2026-08-07T13:34:00.079764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T13:33:50.601029Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.601029Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f45a3f4987b57c3adf5d247cb0693609319dd40d634b37461f6112e1dfb1ccb5","observation_id":"b6980a7b-23da-4fac-9da9-898329f2d91a","resolution":{"observed_at":"2026-08-07T13:33:50.601029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17685","snapshot_observed_at":"2026-08-07T13:33:50.714630Z","title":"Futuresightdrive: Thinking visually with spatio-temporal cot for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.714630Z"},"links":{"cited_paper":"/paper/2505.17685","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d753dc20a7efddf672fda7d4d396f3c95a33a866dff6585bcc80d60675c24e7c","observation_id":"4661f28f-b4fd-428c-8cab-dd0ea2467d6c","resolution":{"observed_at":"2026-08-07T13:33:50.714630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-07T13:33:50.849364Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.849364Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:16a2b5b021fd2db5294eff5184728a5a1a2b57775d159fb67cef2aef6eb0b525","observation_id":"257b1298-91e4-4d6a-b99e-c8e12cacef87","resolution":{"observed_at":"2026-08-07T13:33:50.849364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.856160Z","title":"RoboMP2: A robotic multimodal perception-planning framework with multimodal large language models","venue":null,"work_id":"2271ef7e-e3b4-418b-adff-1d1135e62468","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:50.961129Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a34eaf011b64deb3d5ff758dca740da6a3562d42ce1296387dfd2935d995da2a","observation_id":"15194271-763a-4a9e-ae20-58bc0171772c","resolution":{"observed_at":"2026-08-07T13:33:59.951725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-07T18:35:21.532343Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-08-07T13:33:51.178608Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.178608Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:c538f417509799b3788aa3c9ba2485345c6170b1160fdd982b45e6011dc8bc06","observation_id":"6f71dcb0-3c70-43a6-b824-801f1038533a","resolution":{"observed_at":"2026-08-07T13:33:51.178608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.631358Z","title":"Learning causality-inspired representation consistency for video anomaly detection","venue":null,"work_id":"4254a523-77cc-4363-b24a-6757e16c41f5","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.301356Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:bb951342ccbefa10efcd7db401dc478ca9ec5b54fba21b66e42e1d889cf547f0","observation_id":"98106cf3-bab8-479b-bef4-aedf443dc267","resolution":{"observed_at":"2026-08-07T13:33:59.715736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.434697Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":"c431c9f9-9096-41d3-9573-5656068dec2f","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.416783Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:2b40f57f0d0b63d3ff96bc96d11a0ead1e341817bed309c47a9d1fcc351d2a1e","observation_id":"7987215a-b994-45c6-abc3-f9d0c0442d99","resolution":{"observed_at":"2026-08-07T13:33:59.525438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.238459Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"4ff97077-8359-44d1-b112-1a7cb96f6144","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.548815Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ffda652984b58d68cb2b8757b42a1c3067f19a41ce0a7085244353bb3186c424","observation_id":"a686961f-ed9d-4b19-866a-bda44f39afa6","resolution":{"observed_at":"2026-08-07T13:33:59.312277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:59.052105Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"39f63e8f-c59a-4f61-a499-57d196418fe8","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.664459Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:0160feddf094ce3fa3e8ab56da2a56dcfc8764245b39de5cd4cdef720246cb59","observation_id":"f30ddaf8-0366-41b9-ac3c-a4e833fb91c2","resolution":{"observed_at":"2026-08-07T13:33:59.120220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.772547Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.772547Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a81bd7fb63d3b81dac9d5a77e45a46763a877da315497d2efb412dfdcc29af40","observation_id":"bb30c695-ea59-47f2-b80d-691d8ebc69ca","resolution":{"observed_at":"2026-08-07T13:33:51.772547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T13:33:51.884717Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.884717Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:198567ae06dc5b2301eea0e5bca0ba52b8160cbc49c0250e06733ceeebf0c082","observation_id":"d0c08af9-ddd5-4a01-aed7-1077f92b290c","resolution":{"observed_at":"2026-08-07T13:33:51.884717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:33:51.985432Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:51.985432Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:d010f8224833b29bd630ff5c9da3f8b001ecc5d1b05639c9c9d32cad404938ad","observation_id":"76800bd8-a57b-47d3-be37-85e5bc17e353","resolution":{"observed_at":"2026-08-07T13:33:51.985432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-08T02:45:56.557199Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-08-07T13:33:52.124767Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.124767Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:9ba7d2d86e9d688aa9b22c0c4191dbc282a3918b68c737726353be1e13d7d209","observation_id":"232a0add-3c70-40f2-85a8-dc5ba1c1ae8a","resolution":{"observed_at":"2026-08-07T13:33:52.124767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.816934Z","title":"Mllmguard: A multi- dimensional safety evaluation suite for multimodal large language models","venue":null,"work_id":"00ba4695-ec73-42d7-9064-735447a4076f","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.282259Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a33d4bfad0779a294ff88f207560331ece40173f5bf815125d3fa09543b18b72","observation_id":"c515e4aa-907b-4748-b0fe-ab70894abfb7","resolution":{"observed_at":"2026-08-07T13:33:58.909259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00436","last_updated":"2023-10-05T12:59:59Z","snapshot_observed_at":"2026-08-05T10:40:40.562724Z","submitted_at":"2023-08-01T10:31:36Z","title":"SelfCheck: Using LLMs to Zero-Shot Check Their Own Step-by-Step Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00436","snapshot_observed_at":"2026-08-07T13:33:52.387699Z","title":"Selfcheck: Using llms to zero-shot check their own step-by-step reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.387699Z"},"links":{"cited_paper":"/paper/2308.00436","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:0069b323b397739ae55c0ccf2d96ae732606a2ef51380e9babd1fb0f6097b239","observation_id":"51c50869-8ef4-42d7-9746-4530cff6eec3","resolution":{"observed_at":"2026-08-07T13:33:52.387699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11541","last_updated":"2025-05-20T00:24:09Z","snapshot_observed_at":"2026-08-10T07:19:20.337181Z","submitted_at":"2025-05-14T13:11:16Z","title":"MorphMark: Flexible Adaptive Watermarking for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11541","snapshot_observed_at":"2026-08-07T13:33:52.513946Z","title":"Morphmark: Flexible adaptive watermarking for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.513946Z"},"links":{"cited_paper":"/paper/2505.11541","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ce25e297fc6f806e98de5312044bf1f346553c8674e4c35c4b026aa7967afbe0","observation_id":"b14d58a8-8cfa-42de-b0fc-c8e86a6fd48f","resolution":{"observed_at":"2026-08-07T13:33:52.513946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.637946Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"41b83396-da64-4ba4-9717-e28bc6868d62","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.622187Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f9ce71a89f786329eacedff5b7db716d809311d0573f542143d688eb138a6cfe","observation_id":"0ade5a7e-5cda-44de-b5bf-de1ce2217f55","resolution":{"observed_at":"2026-08-07T13:33:58.729436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11905","last_updated":"2025-03-21T04:40:24Z","snapshot_observed_at":"2026-07-06T19:17:32.745266Z","submitted_at":"2024-09-18T12:05:30Z","title":"AlignBot: Aligning VLM-powered Customized Task Planning with User Reminders Through Fine-Tuning for Household Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11905","snapshot_observed_at":"2026-08-07T13:33:52.754745Z","title":"Alignbot: Aligning vlm-powered customized task planning with user reminders through fine-tuning for household robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.754745Z"},"links":{"cited_paper":"/paper/2409.11905","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:7914e8d708740addd2932b17edbb92681f81d94e6c29f798a55831288ea66ce9","observation_id":"52dd79ae-1572-46ca-b6ee-a04dcf031ad7","resolution":{"observed_at":"2026-08-07T13:33:52.754745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:52.896307Z","title":"Sets: Leveraging self-verification and self-correction for improved test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.896307Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:2466eb03d9fe69028431abdc9a5aa17e39b34482af3d684edc4061db04cf4569","observation_id":"56722f56-4188-4b25-aede-774f1ca05879","resolution":{"observed_at":"2026-08-07T13:33:52.896307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01707","last_updated":"2024-12-25T13:32:54Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T16:15:31Z","title":"Interpretable Contrastive Monte Carlo Tree Search Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01707","snapshot_observed_at":"2026-08-07T13:33:52.995028Z","title":"Interpretable contrastive monte carlo tree search reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.995028Z"},"links":{"cited_paper":"/paper/2410.01707","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:9702dc50ffc475d5a7fc18c56994aadc098a6ddcf575c10745fe5c6117b77a47","observation_id":"23c7015d-acb4-4e75-9d04-2bd052aeccba","resolution":{"observed_at":"2026-08-07T13:33:52.995028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-08T03:22:47.699927Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T13:33:53.140367Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.140367Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:8e28dcbc5842d9752b27fa26a36190c2d23e27e70ff12b223c44484a15308345","observation_id":"51468219-21ee-4e85-a594-c758e0825966","resolution":{"observed_at":"2026-08-07T13:33:53.140367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15282","last_updated":"2021-12-17T17:21:04Z","snapshot_observed_at":"2026-08-07T06:41:10.116700Z","submitted_at":"2021-05-30T17:14:52Z","title":"Cascaded Diffusion Models for High Fidelity Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15282","snapshot_observed_at":"2026-08-07T13:33:53.244353Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.244353Z"},"links":{"cited_paper":"/paper/2106.15282","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:643a1eeb11d33dd84caacd523e8678f54635c733ee4cb3ced367e43fbc8b9285","observation_id":"b0acd536-3231-4720-905d-cf6adbc16476","resolution":{"observed_at":"2026-08-07T13:33:53.244353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.327795Z","title":"Revis- iting multi-agent world modeling from a diffusion-inspired perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.327795Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:4656d846a4c1c7f75f102094b3b58c57ce93ff3f0b1fede37a909a89476933bc","observation_id":"55a1e608-4ed0-4fa6-bde0-4ddcb2a9a26a","resolution":{"observed_at":"2026-08-07T13:33:53.327795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04955","last_updated":"2022-10-10T18:49:25Z","snapshot_observed_at":"2026-07-06T14:03:17.645948Z","submitted_at":"2022-10-10T18:49:25Z","title":"f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation","version":1},"cited_work":{"arxiv_id":"2210.04955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04955","snapshot_observed_at":"2026-08-07T13:33:56.118253Z","title":"f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation","venue":"cs.CV","work_id":"a4c4e12e-b432-42c3-8dd4-fb0b55bad0d8","year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.420181Z"},"links":{"cited_paper":"/paper/2210.04955","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:06d4e2ecf9bc00f7f36447983e00754bc21398a2ad86dfbf64c08dae1b97b94d","observation_id":"f73061fa-010c-4826-9dc2-865bbd20f8fd","resolution":{"observed_at":"2026-08-07T13:33:56.228091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02414","last_updated":"2024-01-04T18:55:01Z","snapshot_observed_at":"2026-07-06T17:11:42.641129Z","submitted_at":"2024-01-04T18:55:01Z","title":"Bring Metric Functions into Diffusion Models","version":1},"cited_work":{"arxiv_id":"2401.02414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02414","snapshot_observed_at":"2026-08-07T13:33:55.933422Z","title":"Bring Metric Functions into Diffusion Models","venue":"cs.CV","work_id":"663fcf4c-9d8a-4948-8af2-81b725d23dba","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.554629Z"},"links":{"cited_paper":"/paper/2401.02414","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:47adf88309f6fb8340569615726c1c5c39214f8c80b9d9ba0f4bc8526e0b16ac","observation_id":"d2f7f3f1-10d6-4d08-ab54-bf8ea252f4b1","resolution":{"observed_at":"2026-08-07T13:33:56.005341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.414151Z","title":"Spectral-cascaded diffusion model for remote sensing image spectral super-resolution","venue":null,"work_id":"b4be3b9f-00af-4e8f-9859-073e7b9b2153","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.717819Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:eb97f55d6ffbf9ccb62eac3a23efaba60c07735349ebf611c228fc1ac5d22243","observation_id":"50763b71-7e9d-4562-b70a-c7dee4706c6c","resolution":{"observed_at":"2026-08-07T13:33:58.526003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.236694Z","title":"High-resolution frame interpolation with patch-based cascaded diffusion","venue":null,"work_id":"2c4ae53e-a149-4717-862a-5e67fac67684","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.835285Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:769447cb47e516ca86f92009bd1011d3af3a50c9eb6a65495170871f15e0b2db","observation_id":"f51f89c3-d1cb-4027-84ce-d0d70f442a8f","resolution":{"observed_at":"2026-08-07T13:33:58.305583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.056810Z","title":"Cascaded diffusion models for virtual try-on: Improving control and resolution","venue":null,"work_id":"b2d3a273-9a8d-4d3d-871c-3b5bfd711762","year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:53.990234Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:98c77eae5fce09e3a7a6999e7052d1b13f055750f8806fd564de91ee8e323985","observation_id":"c527b747-cc31-4b73-8b80-f6f1e271296e","resolution":{"observed_at":"2026-08-07T13:33:58.127619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:33:54.126278Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.126278Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f04f7ebaf67f4ea3b3ca769f1406eca6abe83e314876d0f6ee2ec2329511f254","observation_id":"2c28b4f4-4442-4192-947e-bf9bac79cfd2","resolution":{"observed_at":"2026-08-07T13:33:54.126278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.912153Z","title":"Pre-training for robots: Offline rl enables learning new tasks from a handful of trials","venue":null,"work_id":"fd9ffa19-4e48-437a-b086-f72ef76cfe98","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.254443Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:be55e70fab877c91ae2ba0d485b435a403fcee23a06be4f8da6519b2e6694569","observation_id":"05da854f-a948-4814-ad54-9ffdfb1cc9e1","resolution":{"observed_at":"2026-08-07T13:33:57.971727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.746746Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"872e9e25-a8ba-4d71-b8c9-025b2f2ac8ee","year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.384981Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:fa2dc0bd075fb17a7ec7414bbecc8319a59b9d55032dcb643a912d8583b887dc","observation_id":"287d1e5a-a6e8-4633-a58d-c5f73ef9088f","resolution":{"observed_at":"2026-08-07T13:33:57.814329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T13:33:54.509544Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.509544Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a638e0dcbe5a92ff9b203a57f08373d28343c2587674fd874cf1d61d39b8c01d","observation_id":"f5826893-a8b4-4a18-848d-bfba099c12f1","resolution":{"observed_at":"2026-08-07T13:33:54.509544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:54.674777Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.674777Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:4ba700f23b5cddfe0e5f090c8abd53079f3bf5c68de82d49aec66bdc007526a7","observation_id":"b73c3ab7-a074-4ed8-bac6-3ee1f980e446","resolution":{"observed_at":"2026-08-07T13:33:54.674777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.553441Z","title":"Scaling proprioceptive-visual learning with het- erogeneous pre-trained transformers","venue":null,"work_id":"d541d6a1-34f7-418b-9b68-f40d5cdb0113","year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.796683Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:211d059272fb8a75301d0231fde1f068b3ed3d0f2b63d8a52e310c16e54931b7","observation_id":"949e21aa-1443-418a-a674-d4b10016708d","resolution":{"observed_at":"2026-08-07T13:33:57.645007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-07T13:33:54.889344Z","title":"Towards generalist robot policies: What matters in building vision-language- action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:54.889344Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:8778d4c3f1d828c64346f0f6fe4a2e5d1bacf464dba57395b2f67392f04acbf5","observation_id":"fb8bd160-8b34-48c3-9899-1b76a00db3e0","resolution":{"observed_at":"2026-08-07T13:33:54.889344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T13:33:55.004692Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.004692Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a6c441debe154c824eac2441f2a002253082df3bcb40226b3d5a37719017801e","observation_id":"4ee513b6-aba5-475c-9d35-14fb20a3afc8","resolution":{"observed_at":"2026-08-07T13:33:55.004692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.157444Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.157444Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:8e095be447d9756298c6a346b95b1d8d34798bc2315b8cbe7df71684fc2b596f","observation_id":"ad6b665d-616d-44f5-bdca-262e55c9930f","resolution":{"observed_at":"2026-08-07T13:33:55.157444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T13:33:55.223798Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.223798Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:f7ad81ac506bdef712f2868c057343ddad05756574852ef420328211685c5f7b","observation_id":"7ac1ebce-6d32-4038-8412-5bb69cd72bc6","resolution":{"observed_at":"2026-08-07T13:33:55.223798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:33:30.170449Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-07T13:33:55.329461Z","title":"Improving large language model fine-tuning for solving math problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.329461Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:e3107d8f8d7d6815bb380e8f03b23b4fe2661ac9f6ec0ffdae4bf6ab0565267f","observation_id":"ae1bf471-dc67-454c-9dff-58f2d586f78c","resolution":{"observed_at":"2026-08-07T13:33:55.329461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T13:33:55.428373Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.428373Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:a7e00c2eabab6de1932723591599b81cefa9cc777f62615dd90b78a361b50e03","observation_id":"1791c3be-837b-4f62-b6bf-1553d4807b86","resolution":{"observed_at":"2026-08-07T13:33:55.428373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.331728Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"60d80ed8-8f75-4d84-b09b-85adbb4efb23","year":2018},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.564589Z"},"links":{"citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:349ba31bfeed8ffe288449a537610990419d9854f562a80a5be1d4c7e31b43fd","observation_id":"9b18831f-3bec-46ab-82ca-e17095e176ce","resolution":{"observed_at":"2026-08-07T13:33:57.417704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T13:33:55.651566Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:55.651566Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:ea7fdeda80152389c1990c5a471085ef5a87344717822fcfa6498a3bb328cdba","observation_id":"5d8e87df-c426-4323-8554-e9c8d0a2fea1","resolution":{"observed_at":"2026-08-07T13:33:55.651566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T12:56:33.945381Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 36 inbound Pith citation observations for arXiv:2505.21432."}