{"as_of":"2026-08-07T06:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b90a5b08209111c4f2a0c33c6f1a90790d9c2c5e3a646abc90279732b970c42","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T00:59:54.787472Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:05:10.384913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:9924ad85d725b5af07e8f07b1d45cdb4a92d9c568466f139884f68ef0ffdf4e3","observation_id":"04e7d929-150b-4cb2-a099-c465f3a27b73","resolution":{"observed_at":"2026-06-27T22:01:20.760224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.07723","last_updated":"2026-06-05T16:21:27Z","snapshot_observed_at":"2026-08-02T03:37:35.733251Z","submitted_at":"2026-06-05T16:21:27Z","title":"VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:00.330510Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.07723"},"observation_digest":"sha256:bf312755c367e10cc190c3e57e6ca96999c9e1ea019c0ec97319d68623150545","observation_id":"eb9ddbb9-46b3-4f54-a794-b2b49074cac9","resolution":{"observed_at":"2026-07-02T19:07:18.160599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Molmoact2: Action reasoning models for real-world deployment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:a5c72e8dfb9ac3a16c676939240fbd7c94a26de77bf20ca5bb803afe716738cc","observation_id":"2892ac8a-b5f1-41be-b870-9b9f73669512","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.12299","last_updated":"2026-06-10T16:34:49Z","snapshot_observed_at":"2026-08-02T08:10:49.488336Z","submitted_at":"2026-06-10T16:34:49Z","title":"Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:02:35.406713Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.12299"},"observation_digest":"sha256:6ccf23c5eba487df1a26a68142d7f69e616eddc9088cc35e7b1e3d5a68d5fa9a","observation_id":"46c47a8b-3c3e-4d08-9f05-852227d9b745","resolution":{"observed_at":"2026-07-03T10:27:56.320924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.13497","last_updated":"2026-06-11T15:46:28Z","snapshot_observed_at":"2026-07-30T20:19:53.530896Z","submitted_at":"2026-06-11T15:46:28Z","title":"SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:28:14.694168Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.13497"},"observation_digest":"sha256:e5bf878930b05e24e3c68f056b467fab694707e8cf67b0ee5647a3bfe063447f","observation_id":"4f1a819b-a456-4ef7-a2c2-edd894d80e2c","resolution":{"observed_at":"2026-07-03T15:28:34.327902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:59.969040Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.17846"},"observation_digest":"sha256:5689b004e170daad272da599a53cdf1b0e215b78a006ef18d7ea1b23c3c6a587","observation_id":"0a03aa81-afba-469c-af01-20ee83e1281b","resolution":{"observed_at":"2026-07-03T20:48:55.821613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.18363","last_updated":"2026-06-16T18:09:26Z","snapshot_observed_at":"2026-08-05T15:56:55.047751Z","submitted_at":"2026-06-16T18:09:26Z","title":"Guava: An Effective and Universal Harness for Embodied Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T00:22:53.323832Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.18363"},"observation_digest":"sha256:27b0d6a2937e2752b88ab5e7bd51ca302abd260127e7ab58bf40265f3730942f","observation_id":"21f80482-41de-4e7a-87a9-2f98742c3f5b","resolution":{"observed_at":"2026-07-03T21:38:58.342197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:47.702578Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.18558"},"observation_digest":"sha256:553c6e78b54933ed36b8b853415a84debf10f0567f38bcd567065a38f8b772b7","observation_id":"18a2dc62-579a-4ebf-8a19-2a4bb1094065","resolution":{"observed_at":"2026-07-04T00:09:14.640541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.20521","last_updated":"2026-06-18T17:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-18T17:37:34Z","title":"HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:53:24.431287Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.20521"},"observation_digest":"sha256:7370f9a6d29ab74da02c45f90986e14740cf3e07f397370b38e61c6895bda068","observation_id":"a4c14bdc-b8a5-41df-b0b4-a0beb3aeae1e","resolution":{"observed_at":"2026-07-04T03:39:29.615529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:eed77748f8a3ac10a98e033a0621f54702cb32c015b9ae5538d58d00ffadddff","observation_id":"4e46e123-6b38-46d8-817f-1ae7e82c2f32","resolution":{"observed_at":"2026-07-04T06:59:37.867290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.21386","last_updated":"2026-06-19T12:51:21Z","snapshot_observed_at":"2026-08-01T15:33:46.435054Z","submitted_at":"2026-06-19T12:51:21Z","title":"VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:57:41.592627Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.21386"},"observation_digest":"sha256:6d3a2aaa0d1964b4107bc22763885ee6fa92d253ac71679e8805f5c8a30737b9","observation_id":"847fe876-6ec4-4871-af86-8f0437a3323a","resolution":{"observed_at":"2026-07-04T05:59:38.225358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T04:41:13.473022Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:89d5ff7e4bf74e7e1700e380e7f3200f81163747d54c19ba8ff738445d3e706f","observation_id":"acee10e4-2651-4036-9024-c4ddc7a00c95","resolution":{"observed_at":"2026-07-04T13:59:52.636525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T04:38:02.797595Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:ccd404f0bb2b3f7418b3d01c11103074f5b050f8311d8063b0819a508d868a8b","observation_id":"a2f593a0-0818-4c5b-987c-d47e1f91cd89","resolution":{"observed_at":"2026-06-29T19:53:56.090438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.27375","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-08-05T07:04:21.472262Z","submitted_at":"2026-06-25T17:59:57Z","title":"Scalable Behavior Cloning with Open Data, Training, and Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T04:15:34.832025Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.27375"},"observation_digest":"sha256:dd58975c2afed2c0cae906179a8b66c63e6c4c0c45676a81ccaf61d87c582e42","observation_id":"c76d0277-9ff3-4e85-b551-db3b24e3c7ad","resolution":{"observed_at":"2026-07-04T14:19:53.796200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.30552","last_updated":"2026-07-01T17:07:04Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T16:48:48Z","title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T05:10:51.005004Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.30552"},"observation_digest":"sha256:c823e80aacb1f12b36c7ebd96762f7fc8cb98e84114f14132ed55302ede9f4aa","observation_id":"48bca585-2f79-4aaa-8761-df9354ff7d9e","resolution":{"observed_at":"2026-06-30T15:44:48.929931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.30552","last_updated":"2026-07-01T17:07:04Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T16:48:48Z","title":"Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T20:29:13.282030Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.30552"},"observation_digest":"sha256:c151341a2e796f0089cc9c334751b1ba54306293d59dcbfa6848b63ed825c688","observation_id":"56d5dedb-cbf1-44d7-805c-d7d0fc0dd38d","resolution":{"observed_at":"2026-07-02T20:37:22.343593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.30613","last_updated":"2026-06-29T17:48:01Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:48:01Z","title":"Sequential Planning via Anchored Robotic Keypoints","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T04:59:12.363425Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.30613"},"observation_digest":"sha256:b0c9b9d5441b42f709f451b3ef5d63c0bc65d67da35c952ffe0f06d85ad2d804","observation_id":"8b2c9acf-80ab-4367-af94-76d5f2f519c1","resolution":{"observed_at":"2026-06-30T05:04:20.439809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Molmoact2: Action reasoning models for real-world deployment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:64d78d9c57ee4ede5fc9c7eaf19b756420a0e747cfb9843418ab89d6822dbbdb","observation_id":"7093daec-0540-48bc-a710-2b00f05698e1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-11T19:13:23.494763Z","title":"Molmoact2: Action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04434","last_updated":"2026-07-05T17:58:02Z","snapshot_observed_at":"2026-08-06T10:08:15.724066Z","submitted_at":"2026-07-05T17:58:02Z","title":"RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T19:13:23.494763Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.04434"},"observation_digest":"sha256:864db2ded37ba1e08705dc64617e017a92ba810ad77b8af3cbba3165d837a291","observation_id":"b679f0cd-85c1-4ed9-b183-4dcea1c56464","resolution":{"observed_at":"2026-07-11T19:13:23.494763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-11T07:12:02.239732Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05369","last_updated":"2026-07-06T17:47:31Z","snapshot_observed_at":"2026-08-06T10:45:16.753137Z","submitted_at":"2026-07-06T17:47:31Z","title":"GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:12:02.239732Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.05369"},"observation_digest":"sha256:67907aa240f9ce0725fc1b2a5c8344272cf9f2c6f86107234de09855b31fb2f2","observation_id":"c4b2beab-3ba5-4477-83bc-c6220315f131","resolution":{"observed_at":"2026-07-11T07:12:02.239732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2607.08127","last_updated":"2026-07-09T05:56:08Z","snapshot_observed_at":"2026-08-05T22:45:50.947147Z","submitted_at":"2026-07-09T05:56:08Z","title":"Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T12:39:02.545780Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.08127"},"observation_digest":"sha256:44e8d35e47539cbc675113ef65de9b632b969bab4ed20c9a081091b93db00549","observation_id":"88039e0d-e590-4bef-9e81-6e2a5f164489","resolution":{"observed_at":"2026-07-10T12:47:05.529649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T06:07:00.047773Z","title":"arXiv preprint arXiv:2605.02881 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13154","last_updated":"2026-07-17T03:42:10Z","snapshot_observed_at":"2026-08-06T11:48:46.636705Z","submitted_at":"2026-07-14T18:04:58Z","title":"Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T06:07:00.047773Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.13154"},"observation_digest":"sha256:27c00221cb9e8574c5348878d156ea65d1d5e898160f1052b1be306e351715ac","observation_id":"3b8ab96d-0154-4c86-92ed-fc610b9b7ac7","resolution":{"observed_at":"2026-08-02T06:07:00.047773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T03:16:53.016209Z","title":"Molmoact2: Action reasoning models for real-world deployment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.016209Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:912b4b325b0ac9db204ef4c82efe8ab40aaefcac33c4f27817ff884d73e265a7","observation_id":"ae0e4585-db95-4289-9304-68fa09bea061","resolution":{"observed_at":"2026-08-02T03:16:53.016209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T02:40:36.286530Z","title":"Molmoact2: Action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14280","last_updated":"2026-07-15T18:39:13Z","snapshot_observed_at":"2026-08-06T08:18:11.392198Z","submitted_at":"2026-07-15T18:39:13Z","title":"DiMaS: Distribution Matching for Steering Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:40:36.286530Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.14280"},"observation_digest":"sha256:4e3200cb72f0a3d723b3bdbe53f64a2dfe73b2d0226e323622ec0c5ebde1dc02","observation_id":"cf7ae672-17fb-434a-a3b0-84017c78795e","resolution":{"observed_at":"2026-08-02T02:40:36.286530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-01T23:43:17.812765Z","title":"Molmoact2: Action reasoning models for real-world deployment, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15275","last_updated":"2026-07-16T17:59:06Z","snapshot_observed_at":"2026-08-06T21:07:47.554168Z","submitted_at":"2026-07-16T17:59:06Z","title":"RoboTTT: Context Scaling for Robot Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:43:17.812765Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.15275"},"observation_digest":"sha256:f281db93f3d1594c1bb0d7373c2e93f12744727548ee6a110ebf2f9a739b467f","observation_id":"3ce97011-8962-433a-b591-c49bd1ccf417","resolution":{"observed_at":"2026-08-01T23:43:17.812765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T00:04:01.196872Z","title":"Molmoact2: Action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-06T10:19:48.881664Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.196872Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:94039f85893174cadfd7e30785d65d8626589084e5563d56049a99ad52196b39","observation_id":"b0517684-f747-44da-b962-a8232099456e","resolution":{"observed_at":"2026-08-02T00:04:01.196872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-01T16:19:09.418294Z","title":"arXiv preprint arXiv:2605.02881 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18060","last_updated":"2026-07-28T09:02:58Z","snapshot_observed_at":"2026-08-06T12:06:56.472517Z","submitted_at":"2026-07-20T15:27:13Z","title":"RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:09.418294Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.18060"},"observation_digest":"sha256:b59c0723de3582ca54761ac694a2a65ab14db4de98db8084d29f28f522e863d9","observation_id":"0fd56c30-abf1-46c4-9068-942911e35c7f","resolution":{"observed_at":"2026-08-01T16:19:09.418294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-30T12:41:24.818011Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23784","last_updated":"2026-07-26T18:00:02Z","snapshot_observed_at":"2026-08-06T12:00:08.904543Z","submitted_at":"2026-07-26T18:00:02Z","title":"A Few Words Go a Long Way: Language Guided Robot Policy Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T12:41:24.818011Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.23784"},"observation_digest":"sha256:5595889f0bc6c8a92026e5e0471822801a151b59607b8c1f4a4431e55907b2ab","observation_id":"2412d0e3-8b04-46d3-91ac-a787f5a05d83","resolution":{"observed_at":"2026-07-30T12:41:24.818011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-31T13:44:33.034018Z","title":"arXiv preprint arXiv:2605.02881 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24481","last_updated":"2026-07-27T14:16:43Z","snapshot_observed_at":"2026-08-06T16:36:54.812723Z","submitted_at":"2026-07-27T14:16:43Z","title":"ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T13:44:33.034018Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.24481"},"observation_digest":"sha256:289af5c56447bba4af23b52767acec298ed004216808dee18ab9c7bdbdcb5348","observation_id":"2e971b77-d2cb-479d-9117-adfd9f3c2613","resolution":{"observed_at":"2026-07-31T13:44:33.034018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-31T06:18:55.466819Z","title":"MolmoAct2: action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.466819Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:35239c19edbdf6b3f2714dd40e532eb247ec7d68dd8fd994f89a0d809bcc58a0","observation_id":"a058621a-cf7a-4176-9494-957a4831b69f","resolution":{"observed_at":"2026-07-31T06:18:55.466819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-04T05:05:10.384913Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02547","last_updated":"2026-08-03T17:32:45Z","snapshot_observed_at":"2026-08-06T23:39:09.917734Z","submitted_at":"2026-08-03T17:32:45Z","title":"Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T05:05:10.384913Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2608.02547"},"observation_digest":"sha256:3db680eb13b6546a5c414eeefedfc24fd31e8c9260b7413e66ec572815981817","observation_id":"4cbbffd6-21e5-4856-8f36-8bfb00622caa","resolution":{"observed_at":"2026-08-04T05:05:10.384913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02881/citation-record","integrity":"/paper/2605.02881/integrity","json":"/paper/2605.02881/citation-record.json","paper":"/paper/2605.02881"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:4e8a38a7fe997aaa19a53ae3b8928352204bf9837848d32f3d6c6cfd05424cb8","observation_id":"7b49e2f3-a5cc-4d08-8360-badc491287dc","resolution":{"observed_at":"2026-05-11T04:55:57.306199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Berscheid, P","venue":null,"work_id":"b6fde8c5-c276-4611-b7c5-32f10b37fcdd","year":2019},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:94e19d089185f61037b79bfbaf61c23daecd225049d353fcd28c3f8deb148530","observation_id":"3e5d8cb7-63a3-4773-b41b-4fc86aa6d1fb","resolution":{"observed_at":"2026-05-16T00:40:27.359456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:5385de08b89272ba1da0536ec65c28b59689a901277484ded4aee2af09a0a432","observation_id":"1ac003eb-44b0-4763-8ce3-3239a1d058a7","resolution":{"observed_at":"2026-05-11T04:55:57.212355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:2820289edb3e8c542cb63349b4b0cf534c1579af9f02407984161c17dcfef50f","observation_id":"aab02a0c-3713-4454-9e9a-c38b6153cc66","resolution":{"observed_at":"2026-05-11T04:55:57.351606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04668","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sims-v: Simulated instruction-tuning for spatial video understanding","venue":null,"work_id":"ffe5ae67-e198-47ed-bdaa-ff378c87fca4","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:a27f594cbd49a844cd2fa24d585e14874498de439ae785bd0f5717864b39ebfa","observation_id":"66f523f6-efba-43bf-90e5-a5ed53676da5","resolution":{"observed_at":"2026-05-11T04:55:57.081169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13719","doi":"10.48550/arxiv.2511.13719","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":"arXiv (Cornell University)","work_id":"ceb84861-8bdb-4822-864c-8e2d0ae4d322","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:fa52cff1302253ee10f6c020bf31eba3d0649a0c864b259297fb73e94161b63c","observation_id":"4d45beaf-1cd7-46ee-966a-70f787df3caf","resolution":{"observed_at":"2026-05-11T04:55:57.329449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09990","last_updated":"2025-05-16T18:37:26Z","snapshot_observed_at":"2026-08-05T04:58:41.633559Z","submitted_at":"2025-05-15T06:04:42Z","title":"PointArena: Probing Multimodal Grounding Through Language-Guided Pointing","version":2},"cited_work":{"arxiv_id":"2505.09990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09990","snapshot_observed_at":"2026-07-04T04:29:35.800189Z","title":"Cheng, J","venue":null,"work_id":"f838c149-a8e1-4ada-ad52-1fbdb7fef0c1","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2505.09990","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:3c667edd6e67dffa857f9e8dabe9195cae6e2d30bbf8cb831c01c16935b8e0ab","observation_id":"9fc55664-f5a3-49a2-9a06-8e511421e035","resolution":{"observed_at":"2026-05-11T04:55:57.197919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":"2601.10611","doi":"10.48550/arxiv.2601.10611","metadata_source":"pith","pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","venue":"cs.CV","work_id":"f0dc2969-bd90-4a5d-81df-d557352690b6","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:af87d81fddb5b5f49eb8c21c1a54570d0a0e884757c1a7043fec42fc16bc30a2","observation_id":"b4f01cc1-e0ce-40b3-9f98-d2eee21ca948","resolution":{"observed_at":"2026-05-16T04:21:30.454351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11215","last_updated":"2020-01-02T06:26:37Z","snapshot_observed_at":"2026-07-06T08:31:59.314616Z","submitted_at":"2019-10-24T15:20:03Z","title":"RoboNet: Large-Scale Multi-Robot Learning","version":2},"cited_work":{"arxiv_id":"1910.11215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.11215","snapshot_observed_at":"2026-07-04T08:59:42.026927Z","title":"RoboNet: Large-Scale Multi-Robot Learning","venue":"cs.RO","work_id":"a19770ba-65e3-409a-8ef4-98ed438c113b","year":2019},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/1910.11215","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9bc1374e9fb32604bebc95dd874832b0016e5425b1b7ddbe337eef0a90679813","observation_id":"b37d6612-e929-4a24-96ca-b04ff8b74e75","resolution":{"observed_at":"2026-05-17T19:08:29.717161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:0973dc0c9dec3a83c1fd8c65c3165d8f06f90b328246e70411e9fe096e7e9c25","observation_id":"5f5dc25b-ad35-4b5c-8263-6d52775a873b","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16861","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:09:14.710251Z","title":"Deshpande, M","venue":null,"work_id":"588def00-69e1-4838-a867-c2bdade90c84","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:0ae756bacbc82a720be9f4d71359ab09b92405233dc8c05377f386e8e37fb55c","observation_id":"3d8b7f54-3007-4915-a627-c67e87743aed","resolution":{"observed_at":"2026-05-11T04:55:57.045565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-04T23:25:15.750324Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":"2505.23705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-07-10T23:07:48.099929Z","title":"Knowledge insulat- ing vision-language-action models: Train fast, run fast, generalize better","venue":"cs.LG","work_id":"0cb59615-1c1f-41a5-a1cf-4ecf8e6a0aa6","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:4780c059c22d6542a30ad09180d88fa8cd057d3d40980812283e5d79811792d8","observation_id":"8dbdd4d7-1fdc-4c73-b31d-af0e838aaf27","resolution":{"observed_at":"2026-05-11T04:55:57.430704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":"2109.13396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-04T08:49:42.858933Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","venue":"cs.RO","work_id":"59e728c0-b6ca-4759-a8f4-02b981f2220f","year":2021},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:6a8bbad66d66dff48b2fa09ed86f3e99120740a9219516a08b2117dcf208b7b7","observation_id":"7e396091-4020-48fc-86c0-e580b6466b72","resolution":{"observed_at":"2026-05-13T19:55:55.512010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":"2307.00595","doi":"10.48550/arxiv.2307.00595","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RH20T: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":"arXiv (Cornell University)","work_id":"d0404087-2d28-482f-8b50-8400d35d315e","year":2023},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:d48032e87e494567e50083cf454b76fbb8af5edb7cd01b8be5aa566d64db81fb","observation_id":"c0097d0f-158d-4a9b-ba98-9559a4982cde","resolution":{"observed_at":"2026-05-11T04:55:56.986582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18259","last_updated":"2024-09-25T21:55:38Z","snapshot_observed_at":"2026-08-05T13:44:08.331144Z","submitted_at":"2023-11-30T05:21:07Z","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","version":4},"cited_work":{"arxiv_id":"2311.18259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.18259","snapshot_observed_at":"2026-07-10T18:47:31.698544Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspectives","venue":"cs.CV","work_id":"9ba8345e-e5d3-4118-a598-3094f89cbc76","year":2023},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2311.18259","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:99642246eac447ef7b7deeeb50aa80d51552b4b589c0b98b2c1900801b3820e1","observation_id":"0a135132-adaf-410e-84db-cd80d96e06ac","resolution":{"observed_at":"2026-05-11T04:55:57.151671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"web/2024123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed: 2024-12-31","venue":null,"work_id":"9b340b76-4aca-4b16-8385-e8e25f568ade","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:6dff1920eef8fe86bdf3cf4aa9960d835295922dd195ed2a536cad3147e21ce3","observation_id":"e1723710-3fb4-474a-a5bb-d2cdcf4fa735","resolution":{"observed_at":"2026-05-11T04:55:57.249924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:cbda1433e90e691febccf42e1908831da88851b54fa6d92c79dae8c4991192cb","observation_id":"06149cdf-1a51-4c86-a7a6-27d23e0645ac","resolution":{"observed_at":"2026-05-16T15:53:29.501619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:f6c587c70fbef0e69f2e09195785f60d7c724ee48cf575f4d4e3fabc973539cc","observation_id":"3ca969a2-2062-4c90-b9a8-ed251b7bb76d","resolution":{"observed_at":"2026-05-11T04:55:57.006466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.06890","last_updated":"2016-12-20T21:40:40Z","snapshot_observed_at":"2026-07-06T05:23:33.117300Z","submitted_at":"2016-12-20T21:40:40Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","version":1},"cited_work":{"arxiv_id":"1612.06890","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.06890","snapshot_observed_at":"2026-07-04T13:19:50.661652Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","venue":"cs.CV","work_id":"7da49ac2-097b-4022-910a-c1cd0974a561","year":2016},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/1612.06890","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:4f84302b2c06ea4211af4009c806f2645bc07bb9a13561bf423a3bf600d317db","observation_id":"253cf7e7-ce59-40b3-bac6-93a5e57c4cb6","resolution":{"observed_at":"2026-05-11T04:55:57.465368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:08f0b93bde7ec93c7493bb759c9c20dd247aa1127c13e315c99d0c3739c4514d","observation_id":"9884ad99-e5e0-40e4-abf6-3b92aa236e63","resolution":{"observed_at":"2026-05-11T04:55:57.339764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:fdc9a31e2b1a12f58ec113e3d2465bedc40347ed7a7b4299b586533b46770923","observation_id":"b43b9662-87bb-4766-a465-f370660abc5f","resolution":{"observed_at":"2026-05-11T04:55:57.173053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:ef73196f9b35c313dd35a0a77a87a73944dc1b6a4f2b02fe32bb4853f5b807ee","observation_id":"9f7c52cd-7bea-44f3-a88b-12673aa95206","resolution":{"observed_at":"2026-05-12T14:50:13.054714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:6d99bf6626be59ee25db37f4757f4ac745999c80b5221b91e58a6091997cae47","observation_id":"cf981437-b674-4b8d-be86-395cb9a906e7","resolution":{"observed_at":"2026-05-11T05:06:39.239829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:40f8e2d1f7c689d6fc3668a1d1565021c92278e9c164dd159a7d3be7a9cea0da","observation_id":"6c8e35ff-79cd-4217-8463-ca23deed3a71","resolution":{"observed_at":"2026-05-14T23:35:23.409560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:8c3e2077a679c059dc717517febdb79569a7888e5beb690015656fb080080a7d","observation_id":"311a71b0-a972-4418-98f2-2958e89f1a43","resolution":{"observed_at":"2026-05-11T04:55:57.014057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:59698dec3eb9c964a97f216e013ea488d70c88b636c72030fe64ec05cbb769b9","observation_id":"4832b423-1abc-4ad6-be4c-223d11943244","resolution":{"observed_at":"2026-05-11T04:55:57.565000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:446d16b3e79b0c74d23abff86fad666c68f0e40d635886f9e2b0e971dd516186","observation_id":"d5fe3bc5-f1d4-40f9-9864-95067fe8dcc7","resolution":{"observed_at":"2026-05-11T07:46:30.715521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02229","last_updated":"2023-02-14T16:12:48Z","snapshot_observed_at":"2026-07-06T14:37:51.682439Z","submitted_at":"2023-01-05T18:55:20Z","title":"All in Tokens: Unifying Output Space of Visual Tasks via Soft Token","version":2},"cited_work":{"arxiv_id":"2301.02229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA, J","venue":null,"work_id":"3172ea1c-3fd1-4c31-8a5a-b5e87c90d8e0","year":2023},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2301.02229","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9ea79d7370c9994187288293e89bc17dc28d2bcd8a680d5ac96d68fde8673f32","observation_id":"b5198592-196f-4a01-bd40-075bf75d892f","resolution":{"observed_at":"2026-05-11T04:55:57.159781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"84a01af7-2246-43b5-a0db-3cdc9f9bf2d3","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9f39be26c0b31c9994ea094402e0c5a81659c21f591e18553e08309e3989f98d","observation_id":"1efaa6d5-e8ea-4234-b4b4-192f69377328","resolution":{"observed_at":"2026-05-16T00:40:27.347841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:212bb807edacd2fe15ed3e3d9a0a124f064b595429e6abd41f7cab563804aa53","observation_id":"68850316-85f1-4886-90d4-7fbf7a35f772","resolution":{"observed_at":"2026-05-11T08:52:32.433811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:45a09c8b3c3435f4b975a9bbe7f4ca8a270345e63b9ace7dc94414741e88d23c","observation_id":"d69b634a-61f3-4932-af09-ecda30f8abe3","resolution":{"observed_at":"2026-05-12T06:12:22.898827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.649286Z","title":"Sat: Spa- tial aptitude training for multimodal language models","venue":null,"work_id":"bbf5f212-8e91-4bac-9e1c-ba1d133bfc4c","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:64ae29dc3d7bb38df0c1dc47ee17edd98594ef097f7746324452f4385f3ada57","observation_id":"0e126d8d-3b9a-4827-86f8-dc0f0d96dca6","resolution":{"observed_at":"2026-05-11T04:55:57.497058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":"2311.00899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-07-05T11:41:02.660093Z","title":"In","venue":"cs.RO","work_id":"e9b50329-dbe8-4561-baf4-9128c5cef20c","year":2023},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:2d1158c1009b50361ca25f7b0da3a3cd61a9c1fe5fe39ee733aef03578989c67","observation_id":"4907ffc0-347b-4fac-9e9c-20fc9e54a0dc","resolution":{"observed_at":"2026-05-11T04:55:57.182333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:560491b254e26fea4a2fcccf98f9a75d0e5b033abe52d26da93d2a2b23248104","observation_id":"1761c014-ccf4-4622-9f5f-142a8353ac6d","resolution":{"observed_at":"2026-05-11T21:22:37.721356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-07-06T20:07:54.727859Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2412.11974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11974","snapshot_observed_at":"2026-07-04T13:59:51.757758Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":"8c0ec68f-40c8-45ed-a393-948d0b590fd9","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2412.11974","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:db2bc40a0f0784a2abb7b3ed5e9e570978913888853b357473d677d2a7aec98a","observation_id":"e8c2aec0-2777-49a3-871b-a3f5f472a521","resolution":{"observed_at":"2026-05-11T04:55:57.288841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:094d3825de8b36f4f3ecb2da8149ca299db9a7c408d0d1e943f3f2e21ad22537","observation_id":"c1ba78f0-1713-4945-8bc1-7ae4d1fd107e","resolution":{"observed_at":"2026-05-11T04:55:57.517964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":"2510.03342","doi":"10.48550/arxiv.2510.03342","metadata_source":"pith","pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","venue":"cs.RO","work_id":"ffe7b7f4-997b-4957-b253-03cfbebf6f9a","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:a70340e67db6f7a773d0fb7402fbb5a93164dbfe090922a9616148ba6f6d3038","observation_id":"9cd6854a-fb94-4f8e-9ddf-54c6e423b1f1","resolution":{"observed_at":"2026-05-16T07:37:16.476937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:47490ff3b04666ff2390d92b9529b7dfb791aea013188c250e67163a3842e0db","observation_id":"9a277eb4-2dab-43cd-a824-73d204ffdaf6","resolution":{"observed_at":"2026-05-11T04:55:57.541532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.722385Z","title":"Recurrent-depth vla: Implicit test-time compute scaling of vision-language-action models via latent iterative reasoning","venue":null,"work_id":"45e3c7a0-dd48-446a-a714-98ab7f176209","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:fff87f93d2d27e0f402f86fb0c2bea34966eaa2cdf855c5714d0ab3f10cd44e4","observation_id":"cc4791da-7040-494c-924f-7e43e55e401a","resolution":{"observed_at":"2026-05-11T04:55:57.320331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76abad6c-841e-4d9d-a238-3c0dec6ab97c","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:ab94ed2d359b9cae11330f5ca1251abcb6e68950846825c2adfdbd952605db8a","observation_id":"2070972d-def5-46e4-8069-1ffaf03e9bd6","resolution":{"observed_at":"2026-05-16T00:40:27.351697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:cfae5a56014d55227525a868bd646097968a723b0e635dcaae0b710392e56bc8","observation_id":"1e30d036-7643-4495-9378-b6e5dc7db8ff","resolution":{"observed_at":"2026-05-11T04:55:57.119774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00435","last_updated":"2026-05-04T20:30:13Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:33:16Z","title":"RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation","version":2},"cited_work":{"arxiv_id":"2507.00435","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00435","snapshot_observed_at":"2026-07-04T04:09:35.527120Z","title":"RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation","venue":"cs.RO","work_id":"52defc92-d887-4a0d-b188-6fb7be9305de","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2507.00435","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:f4b8dec5f71a44f6167736ea7d73531fb8156e09772363ab42e43a628d6b2de2","observation_id":"39649cf4-4c0f-4cde-a1d6-ab093dd36295","resolution":{"observed_at":"2026-05-11T04:55:57.471549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":"2502.05855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-10T04:16:48.719609Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","venue":"cs.RO","work_id":"3564a757-5726-4b2a-a28e-114a4a467dfb","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:e5bb670a7af4b17ed3ff710336af6cb9088fe99faeb8429e6d10d3e256dec128","observation_id":"ec0386b6-485f-48d7-8de1-52b225dbff63","resolution":{"observed_at":"2026-05-11T04:55:57.052538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:2678b5d81ffdac6d2546a6bd79179d8a53440699db4e2d56de603b66977f7833","observation_id":"3fb9f65f-1f04-4626-864e-0611401c9829","resolution":{"observed_at":"2026-05-11T04:55:57.231212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05491","doi":"10.48550/arxiv.2511.05491","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":"arXiv (Cornell University)","work_id":"98823083-5573-413f-a371-f50911725458","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:ee01c07f124c6be66cefbf1e2291f225fe1ecfa9b82fb4e2da4ab7b1243ef3fc","observation_id":"1c2d934b-4331-44e2-97de-e7e4253f0fe0","resolution":{"observed_at":"2026-05-11T04:55:57.137498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2407.08693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-10T13:37:06.920040Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","venue":"cs.RO","work_id":"bbe96698-686e-4b4a-9f7f-ed5054e61cca","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:af9a775fe2e751f83b5214e6883cb9cf69e0f529c4987a15ea3d543b071727d5","observation_id":"e397e0c9-1eca-4ee1-a70d-57ad984b25a5","resolution":{"observed_at":"2026-05-15T08:14:32.442267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.587545Z","title":"Lap: Language-action pre-training enables zero-shot cross-embodiment transfer","venue":null,"work_id":"2a74934a-8324-46a8-a964-b3044e067acc","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:26f970d6b83b7aca174cfc189f96d528945a144936c2d82493ad31ac81d4bfb1","observation_id":"c382cbc3-8316-41ae-ba84-780f1f191de2","resolution":{"observed_at":"2026-05-11T04:55:57.386378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, M","venue":null,"work_id":"2680a0ab-176a-4b55-9151-deb5e0dc35a9","year":null},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:3f98ca5b01773b6edc06b865a2db29b9c5a72153f5cdd41e6549e52bae8603f6","observation_id":"bb6ff770-3cbe-4fed-91d1-3a1be755a76b","resolution":{"observed_at":"2026-05-11T04:55:57.070216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-05T13:44:48.719708Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":"2410.13126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-07-04T19:30:08.155799Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":"db13f99b-32b7-4745-adc2-d4cfb5799638","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:3069ddfd91d30f196cad3240261f362ed277b03bb5fa816b224baa73f738d86d","observation_id":"b28737d2-3197-4476-a7d0-40be74a274db","resolution":{"observed_at":"2026-05-11T04:55:57.279060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2510.10274","doi":"10.48550/arxiv.2510.10274","metadata_source":"pith","pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","venue":"cs.RO","work_id":"13faca8d-e96d-4e6c-a441-9f2683d11934","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:7457c2428c4d39651af62624075cee6f0cafa08485b842b60cda792fdb2b6b67","observation_id":"c98ff74f-5701-493b-ade9-a2a257ccdb3b","resolution":{"observed_at":"2026-05-12T14:57:47.957311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:ace4036c5794d3ce7ffcf386d20a8c13e746a7bf4e957fb6d0771a3ebe7dc979","observation_id":"d7134601-83cb-4ead-b4a8-600efcea92f5","resolution":{"observed_at":"2026-05-15T18:27:23.210785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.026359Z","title":"RoboRefer: Towards spatial referring with rea- soning in vision-language models for robotics","venue":null,"work_id":"fda95042-555b-4a64-9d35-7978eb50b269","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9f05ecaeb3de26b681378bd450e9b44e48ffd96c28c18f0f36e30d9bbd9650c0","observation_id":"e40096fe-ae0d-4a55-8aa2-ca2a545bd9c0","resolution":{"observed_at":"2026-05-11T04:55:57.510897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":"2504.02792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-10T18:47:31.709153Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","venue":"cs.RO","work_id":"c181dcf1-e774-4216-a30e-e55c3f3a766c","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:741e9e117444ea379ab712160e0adf7131b587db07ca1a050796949aa2fdf763","observation_id":"ae8b9d07-5882-4ca3-a015-b5796b8f2888","resolution":{"observed_at":"2026-05-13T16:25:00.606134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"4.1 and Sec","venue":null,"work_id":"6919b105-3c8b-4c48-8bfb-7992e4c005de","year":2026},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:afd770591f7ecf51d34e74a6524031eedda93cdc927e3364f97fa5df1ff99fc9","observation_id":"50db70d3-7d83-4e4d-8c07-daf3aa314e8b","resolution":{"observed_at":"2026-05-16T00:40:27.345018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dialects","venue":null,"work_id":"ddb24361-7177-41e3-91b8-0e6b47e3e1eb","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:dd7d007da385a0101a3a4158cbaaa9b0611900b21ed434b624aef84302fd476e","observation_id":"b7b33432-b2bc-4d6b-9460-e278eef8bf02","resolution":{"observed_at":"2026-05-16T00:40:27.362757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Camera positions are held fixed across all three models","venue":null,"work_id":"5506e92d-1748-4de3-9e6d-3f1f42ef0cb1","year":2016},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:af45ded361f221eae724e2c5bd34df499abdf8f6eb75784eb4a1102958c329cf","observation_id":"f08d8320-2dcd-4cb8-95b8-666c8cfa5884","resolution":{"observed_at":"2026-05-16T00:40:27.356182Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":50,"verified_fuzzy":3},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 31 inbound Pith citation observations for arXiv:2605.02881."}