{"as_of":"2026-08-19T01:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d9d90928a752af4c01f93cd3be0b83fbc8d6b85100668756eeb53674a31cd58","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:59:14.995680Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:50:24.245044Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T00:12:50.440895Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-11T00:39:38.533421Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:290e0d17f534b92bcd37eb94d3140f2528eab1bce3f47176862e03052524755e","observation_id":"b33cb9ae-d653-419a-abd6-38e1e06ce0f9","resolution":{"observed_at":"2026-05-15T22:06:42.973999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-02T19:58:16.813817Z","title":"Robix: A unified model for robot interaction, reasoning and planning.arXiv preprint arXiv:2509.01106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-12T20:25:39.865322Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:16.813817Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:65145c54a9d8da48270489164689aa95d975809712a1764607857bbae19189ac","observation_id":"26f2ab94-28a4-465e-ab11-d1251edda387","resolution":{"observed_at":"2026-08-02T19:58:16.813817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:6a7ba050d323c4cc25c3039196b8b282326dc109d593ddc6fc5c61045bb9f141","observation_id":"6fa9424d-9b5e-4d26-bae7-311eac757146","resolution":{"observed_at":"2026-05-11T05:15:57.151412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2604.21924","last_updated":"2026-04-23T17:59:04Z","snapshot_observed_at":"2026-08-11T14:12:44.952595Z","submitted_at":"2026-04-23T17:59:04Z","title":"Long-Horizon Manipulation via Trace-Conditioned VLA Planning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T21:10:03.554504Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2604.21924"},"observation_digest":"sha256:63fc6717346d94a14c44bb577769e049fccb4de60461c7d64f201d5a841b60d3","observation_id":"3dc1ef30-a774-4c8b-8440-c87f4baaf9f7","resolution":{"observed_at":"2026-05-11T14:41:39.136763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T20:54:50.887381Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:a9da1916d845e3b934acf740972a47801a1f51adb4a896ca93223dfa5a9f0819","observation_id":"0dc09871-a728-477e-b0b6-2072e4a5cb0b","resolution":{"observed_at":"2026-05-14T20:59:28.436108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T05:07:58.953866Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:eff7089d338926ead1567a50f8c6d676a0960c95cb61ea6ee54d1a784c698857","observation_id":"2d1ea616-77a2-4fcf-81a4-15529b0e86bb","resolution":{"observed_at":"2026-05-15T05:09:45.357096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:1d2dec9a7cbcfa985c39be33c89914ee412963856318c2dc8f3f55e8bb16e89c","observation_id":"0f9e415a-9191-4947-94d2-8afe5c3a65f0","resolution":{"observed_at":"2026-05-14T17:57:33.141297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":"2509.01106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-06-29T00:12:50.440895Z","title":"Robix: A unified model for robot interaction, reasoning and planning","venue":null,"work_id":"b6c06e88-458f-4ff1-a668-05be8e43f148","year":2025},"citing_paper":{"arxiv_id":"2605.31075","last_updated":"2026-05-29T09:43:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-29T09:43:35Z","title":"Task-Focused Memorization for Multimodal Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:14:45.287255Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2605.31075"},"observation_digest":"sha256:2dbcaeba63fc3dd50ee937fbfee7709dbefcae0e1c3ad433e08ce9fdefaafa64","observation_id":"f8ff0e8b-78cc-4557-b69e-9a553100bdf8","resolution":{"observed_at":"2026-06-29T00:12:50.442528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-01T14:39:34.926586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-16T19:36:52.307904Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:34.926586Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:c0c1a6d7f33f49602dbdced28b5b916f00f358d3c8853cf792c5c47420e6c7b7","observation_id":"c21486c5-ff69-4421-a0e3-7d971ef99126","resolution":{"observed_at":"2026-08-01T14:39:34.926586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-08T00:50:24.245044Z","title":"Robix: A unified model for robot interaction, reasoning and planning.arXiv preprint arXiv:2509.01106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.245044Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:a3bd75c808be88786cad160ea2c61fe3ce9c6fc3e56f49ae51c8705495fba5da","observation_id":"d3f2bba2-f884-4ca0-b96e-b336c4464c22","resolution":{"observed_at":"2026-08-08T00:50:24.245044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-08T00:15:18.629999Z","title":"Robix: A unified model for robot interaction, reasoning and planning.arXiv preprint arXiv:2509.01106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.629999Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:847f8e921f849011274b48af75028495b38ffc62d1f0ca67ac7ff7abbd2d7423","observation_id":"0c2694aa-3f0f-4a19-8dfa-12c24caad030","resolution":{"observed_at":"2026-08-08T00:15:18.629999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01106/citation-record","integrity":"/paper/2509.01106/integrity","json":"/paper/2509.01106/citation-record.json","paper":"/paper/2509.01106"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T12:59:01.275527Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.275527Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:663cdc8e459c87d0c21329d21893576f5486da1f89f01d98e8642f64e35be8bc","observation_id":"e3946b7e-d836-4113-8cb1-a974e2622cf4","resolution":{"observed_at":"2026-08-05T12:59:01.275527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-05T12:59:01.337742Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.337742Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:efb04d5124f62e4e0608e16c45c2fe5f85e3a233b8dc1fc49e4e5729efd8c0f8","observation_id":"16cb9f9d-0c5f-409e-9366-6f621e68af10","resolution":{"observed_at":"2026-08-05T12:59:01.337742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T12:59:01.472388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.472388Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:d6ff14ab116a1693e599479ad7ed8c28e93fa00607ebea33eba078912a2ef451","observation_id":"740f2915-9113-4947-80c2-24ba394928d5","resolution":{"observed_at":"2026-08-05T12:59:01.472388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:01.585622Z","title":"ARKitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile RGB-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.585622Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:8bf13b3991dfeaa95e3ff549c727e10d0153035f2d2f1499053bde647835b742","observation_id":"2cefbaea-4519-4525-acd1-18cfbc10adc9","resolution":{"observed_at":"2026-08-05T12:59:01.585622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-05T12:59:01.688170Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.688170Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:48d6e820122a372e8cdaa90f68b3e3a424f76e36c4d3d783ce79031caed0c148","observation_id":"d8e65175-1124-49bd-be29-b730109d504c","resolution":{"observed_at":"2026-08-05T12:59:01.688170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-05T12:59:01.816963Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.816963Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:39662dfca87e516cde590b446ff1b773b3c6a9c309d25a9e71b97485413e787f","observation_id":"96c5b96b-2e05-44ec-932b-723806dee997","resolution":{"observed_at":"2026-08-05T12:59:01.816963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-05T12:59:01.954600Z","title":"Gr-3 technical report.arXiv preprint arXiv:2507.15493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:01.954600Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:9c84a737d29940e37b7cc140ef68ef77345728f2af78a84e14824660efc82f94","observation_id":"57a30a8f-f048-49f8-ad26-82e3fa535725","resolution":{"observed_at":"2026-08-05T12:59:01.954600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T12:59:02.133626Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.133626Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:0465a4dc752b3aefd480450a42d8bf5670a3d37770360b0257921a47bfdce29c","observation_id":"347d0f17-a116-4e37-9d7f-8a777b4109dd","resolution":{"observed_at":"2026-08-05T12:59:02.133626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13059","last_updated":"2025-02-18T17:04:26Z","snapshot_observed_at":"2026-08-16T12:57:14.587165Z","submitted_at":"2025-02-18T17:04:26Z","title":"SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13059","snapshot_observed_at":"2026-08-05T12:59:02.279885Z","title":"Simplevqa: Multimodal factuality evaluation for multimodal large language models.arXiv preprint arXiv:2502.13059, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.279885Z"},"links":{"cited_paper":"/paper/2502.13059","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:e9494d0cb4d88ddbf3f6a32987502d46669b4358205ed596cac24d348cc5ed51","observation_id":"a699e3ba-a553-4fbb-967d-c5d1cc42bf93","resolution":{"observed_at":"2026-08-05T12:59:02.279885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:02.437002Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.437002Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:a0375bc2a37db6a62034936a3fba0506ba9f8d08e73e145fe1c200d64185c780","observation_id":"4e77cdef-09f6-4006-8025-a7bc9eefefa6","resolution":{"observed_at":"2026-08-05T12:59:02.437002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15033","last_updated":"2024-11-22T16:05:54Z","snapshot_observed_at":"2026-08-16T10:37:57.600393Z","submitted_at":"2024-11-22T16:05:54Z","title":"One to rule them all: natural language to bind communication, perception and action","version":1},"cited_work":{"arxiv_id":"2411.15033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15033","snapshot_observed_at":"2026-08-05T12:59:18.014143Z","title":"One to rule them all: natural language to bind communication, perception and action","venue":"cs.RO","work_id":"acd3f241-c3f5-4019-9224-a5b148121240","year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.588288Z"},"links":{"cited_paper":"/paper/2411.15033","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:74e62d055132b6a9e616eb04ba6a7a7ec20b2e094974c6c6ccf47f59724e3044","observation_id":"878cd1b2-b2a0-4334-b799-637ce9755adb","resolution":{"observed_at":"2026-08-05T12:59:18.088647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:02.692534Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.692534Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:9cd92fcf23a5c6e2565bfc49b93fe33083abd6412b6b858196fd328fd6763434","observation_id":"1d0b47da-3f8a-448c-871d-b781f4305bf1","resolution":{"observed_at":"2026-08-05T12:59:02.692534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14674","last_updated":"2024-09-23T02:50:33Z","snapshot_observed_at":"2026-08-16T13:16:25.302872Z","submitted_at":"2024-09-23T02:50:33Z","title":"RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14674","snapshot_observed_at":"2026-08-05T12:59:02.830306Z","title":"Racer: Rich language-guided failure recovery policies for imitation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.830306Z"},"links":{"cited_paper":"/paper/2409.14674","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:5b50cd209871d5efc23c75b4b51f9b24ef893f1477ee3cd96ac5dccaaa90f2eb","observation_id":"ed4eb19b-9770-48c3-a129-36c3b56d80b5","resolution":{"observed_at":"2026-08-05T12:59:02.830306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:02.958705Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.958705Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:14fbc99cf631f5dbfc4ceb3aa9030dbc50d63e2987c678c12c555bacefd7ca4c","observation_id":"42fe07ab-b146-46c4-a5f9-adf6a9a5b444","resolution":{"observed_at":"2026-08-05T12:59:02.958705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:03.096091Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.096091Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:3e9ad3b63e9c1d253444b2919a2def000d19988e7183e9297b59b226a22fdd58","observation_id":"f3d1c122-fe38-466e-bfde-f12167d707ba","resolution":{"observed_at":"2026-08-05T12:59:03.096091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:03.234127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.234127Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:cb633e6c192c904708a2a1be04690cabde5f567a19640e60952095afb0332b16","observation_id":"a5c5abfc-ee71-4690-89f2-93553de024b1","resolution":{"observed_at":"2026-08-05T12:59:03.234127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18915","last_updated":"2024-08-29T16:07:30Z","snapshot_observed_at":"2026-08-16T13:39:12.239182Z","submitted_at":"2024-06-27T06:12:01Z","title":"Manipulate-Anything: Automating Real-World Robots using Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18915","snapshot_observed_at":"2026-08-05T12:59:03.378073Z","title":"Manipulate-anything: Automating real-world robots using vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.378073Z"},"links":{"cited_paper":"/paper/2406.18915","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:887ab9dd7cc29dbc76d170e65f05407177ee29e12bfcb59e5b1d2f099e57be06","observation_id":"fec17863-6692-4e7c-ac09-bfc918ad9ed1","resolution":{"observed_at":"2026-08-05T12:59:03.378073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-18T21:58:09.907460Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-05T12:59:03.490856Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms.arXiv preprint arXiv:2411.15296, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.490856Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:83714ec6409a7dd2fc575759322267e1396cb02c9accbf4f7503ce2f01eb5110","observation_id":"aa0ca7aa-a81d-43a5-ba0b-89fa84c15f9e","resolution":{"observed_at":"2026-08-05T12:59:03.490856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:03.646395Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.646395Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ff004597a6b5941935a0defffd889dc5d3a7a7c62b6d922e3b334d80c6d2491a","observation_id":"3a609bc7-97b5-44d2-b2d1-1115b41c63fc","resolution":{"observed_at":"2026-08-05T12:59:03.646395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:03.814310Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.814310Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:950c30c6e93cca0012ead2419ed27b0b467ff2c31b4d169dfa3e5a744a121e30","observation_id":"c3ea131f-9ff6-4431-80fe-a3a6afa09348","resolution":{"observed_at":"2026-08-05T12:59:03.814310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:03.946357Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:03.946357Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:9372c5c206f38cd4ca34d9a7b3959015d3ad9d42a1eeaff8ce18005523642ea6","observation_id":"7dafc7ce-6729-4e8a-ab0d-b233912a5db9","resolution":{"observed_at":"2026-08-05T12:59:03.946357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:04.073445Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.073445Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:e73f7f18d5a900088c32a04d914c415edf4c2775d66c52f90c75f46a15b4aad3","observation_id":"99c3fffb-f4e4-48a3-9843-11616ab91024","resolution":{"observed_at":"2026-08-05T12:59:04.073445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:59:04.246189Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.246189Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:e61a8ec6344ac3f16a4c1271a1841ff895f956e50889e95730469262a509c669","observation_id":"1aae740f-9574-4429-abcf-3ab4d6a477ab","resolution":{"observed_at":"2026-08-05T12:59:04.246189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T12:59:04.402669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.402669Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:6e24d8fb774cff48fb9678e85f237aa13ffe3f951853ef9462236d3209dfac7a","observation_id":"cef2c61f-7ab2-4e5c-9639-9b34512f8f88","resolution":{"observed_at":"2026-08-05T12:59:04.402669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:04.516363Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.516363Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:2e2db01cb9667f1b78b9dcb624d5d8ea8406bf22ff8b6a67da4b3dd5150149fa","observation_id":"3ca97fac-e162-4486-968d-e7f27d911221","resolution":{"observed_at":"2026-08-05T12:59:04.516363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T12:59:04.675140Z","title":"Glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.675140Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:42036f19e5bb890151767e701fab913b0fda157f87fd8e3c38286a706767fa44","observation_id":"1907c8b7-3f81-4dd4-82fe-5c89bff49bc8","resolution":{"observed_at":"2026-08-05T12:59:04.675140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-08-12T03:35:51.024147Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-05T12:59:04.733938Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video.arXiv preprint arXiv:2505.11709, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.733938Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:864b4c1ff6cdea8a0de50fae5d357fd1eaec030a536a7f347e25eeedf43a02a9","observation_id":"8b708a0c-296f-48a0-99a5-058dcc89d245","resolution":{"observed_at":"2026-08-05T12:59:04.733938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-16T14:39:09.587564Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-05T12:59:04.852667Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning.arXiv preprint arXiv:2311.17842, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.852667Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ee80f9e7c31bac136b8fed3fadfe4c3b56ebb02c6ea69183cdddd4d4c6222324","observation_id":"88f04f39-f3ec-466f-96fc-c4487bb4d52b","resolution":{"observed_at":"2026-08-05T12:59:04.852667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-05T12:59:05.012677Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.012677Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:91fb759d8736132fe57865e8b3a0dff8011d201150c5b526ce699b771cad4b04","observation_id":"9fa75e1c-e39b-4eb7-a76f-8ab1073f20e0","resolution":{"observed_at":"2026-08-05T12:59:05.012677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T12:59:05.169289Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.169289Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:8b0fddda9963752234d361d26bb99adbd00f987f639f0b2bca2ab5221e80050f","observation_id":"4bd2ddcc-9ba9-4217-b1c4-6ba3a8ece33d","resolution":{"observed_at":"2026-08-05T12:59:05.169289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:05.287162Z","title":"Egotaskqa: Understanding human tasks in egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.287162Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:fd6c01fca2a5443daee384916fd2adc3e4fa38896a20f1ec0e60e8512e1a3eb5","observation_id":"0ecd514b-6dc5-4ef0-8e4b-ceb8e9978819","resolution":{"observed_at":"2026-08-05T12:59:05.287162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T12:59:05.391486Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.391486Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:fe945a5bff517846119c5ad1738a8474a86be32d9b0622d63433fd5c91d954a0","observation_id":"9e5f622c-3afa-44f4-ab52-397b52810164","resolution":{"observed_at":"2026-08-05T12:59:05.391486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:05.549751Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.549751Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:4ee1afc5acd891d02e4b42a4fa4f89adb596816279f5d8a5999cd7d4e518d9db","observation_id":"765ddf6c-2894-427a-b390-edc6697eff64","resolution":{"observed_at":"2026-08-05T12:59:05.549751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09992","last_updated":"2022-01-24T12:11:21Z","snapshot_observed_at":"2026-08-18T17:44:05.644839Z","submitted_at":"2021-10-19T14:04:16Z","title":"ERQA: Edge-Restoration Quality Assessment for Video Super-Resolution","version":2},"cited_work":{"arxiv_id":"2110.09992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.09992","snapshot_observed_at":"2026-08-05T12:59:17.774429Z","title":"ERQA: Edge-Restoration Quality Assessment for Video Super-Resolution","venue":"eess.IV","work_id":"00b09ed3-8f11-493b-a976-6c41f7ff9660","year":2021},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.717695Z"},"links":{"cited_paper":"/paper/2110.09992","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:81e372f8276765e22ac0882bef0c13443191f03706f33916c12affe9f955a3c8","observation_id":"7b74e280-3af4-4bc7-9ce3-b355ac68b416","resolution":{"observed_at":"2026-08-05T12:59:17.838404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:05.862320Z","title":"Cubify anything: Scaling indoor 3d object detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:05.862320Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:b70336ddaccc24fbd21bf73f1cbb2a4752633bb3a55be94962dfda2ca3bbb2dd","observation_id":"cbc0f4ef-bce1-440f-ab87-b6434552034d","resolution":{"observed_at":"2026-08-05T12:59:05.862320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:06.015691Z","title":"Evolvenav: Self-improving embodied reasoning for llm-based vision-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.015691Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:5de84319218ecb54c938244258bffad792631fff4d39ca6e444734a033aca35b","observation_id":"47fbe0a5-24cb-43fc-b46a-7c623c0f7bcc","resolution":{"observed_at":"2026-08-05T12:59:06.015691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:06.184536Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.184536Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:9cc43bf40eb7e93ab727c88bc1848655f61e5de62ded4b362a1bc9706f375081","observation_id":"1997f8ab-9e58-4374-a91b-115e0a234ea7","resolution":{"observed_at":"2026-08-05T12:59:06.184536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17555","last_updated":"2023-10-26T16:46:12Z","snapshot_observed_at":"2026-08-16T14:48:32.838263Z","submitted_at":"2023-10-26T16:46:12Z","title":"Interactive Robot Learning from Verbal Correction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17555","snapshot_observed_at":"2026-08-05T12:59:06.299966Z","title":"Interactive robot learning from verbal correction.arXiv preprint arXiv:2310.17555, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.299966Z"},"links":{"cited_paper":"/paper/2310.17555","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:531656e8784d2b0d3df67707139df3bcba7b76f1a002627ebcd0b6ac92ff188c","observation_id":"3a097d02-edbe-4c27-9f9e-f92ebe6666e9","resolution":{"observed_at":"2026-08-05T12:59:06.299966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-17T00:01:45.419694Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-05T12:59:06.413484Z","title":"Visualwebbench: How far have multimodal llms evolved in web page understanding and grounding?arXivpreprintarXiv:2404.05955, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.413484Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:be1e16870b04190e6caadbcf6ec77f6db752e004f8088dfcaaf11634c33af605","observation_id":"161fceba-5e13-4c5c-bea0-3232da40bec5","resolution":{"observed_at":"2026-08-05T12:59:06.413484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:06.506855Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.506855Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:a1312ec94e9a30f4bfee86d98a9d2c10433ad7d5367905ae93b9c5270bce07eb","observation_id":"1e0e62cd-b014-46db-8553-e43c4c171b21","resolution":{"observed_at":"2026-08-05T12:59:06.506855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:06.681885Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.681885Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:f0d7698830b140fa42768291476fd00409f22033b79f8098162140865a0ba341","observation_id":"84a403b4-b08e-4766-b7cb-31f546c00968","resolution":{"observed_at":"2026-08-05T12:59:06.681885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T12:59:06.825188Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.825188Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:7d41c9441d5f12ce7ea3ed8b1324ef6556d6cc0b61d620a6db34c750825092de","observation_id":"1cccec60-3cb8-4150-86aa-5e14d028f18e","resolution":{"observed_at":"2026-08-05T12:59:06.825188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:06.954473Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:06.954473Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:2378db9d9777d7d4a5540f111631dc05bb07c7f3f5ef674a61193bf5dda82100","observation_id":"eec8f99f-ef83-401c-a577-f590446e0983","resolution":{"observed_at":"2026-08-05T12:59:06.954473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.093528Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.093528Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:04509fa5c290d571cef310710dfdfa12ecfa31b24e005b13b5ca0c65497a2be1","observation_id":"93f56d19-f190-476a-8346-2c0e7e608e1a","resolution":{"observed_at":"2026-08-05T12:59:07.093528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.220897Z","title":"Learning to parse natural language commands to a robot control system","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.220897Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:d733e363c7123d128185caa09ed0c88810b3d49558841b3f472c86d35e71d2ef","observation_id":"841923df-ec75-44db-8fab-4da7da6f2695","resolution":{"observed_at":"2026-08-05T12:59:07.220897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.342984Z","title":"Is feedback all you need? leveraging natural language feedback in goal-conditioned rl","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.342984Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ecb6436d76a3a81f8a8b3b8d31515082685dd87b2d30a07e6ccab677dc86a024","observation_id":"6215af04-1e62-4c06-8691-0b3962c83f18","resolution":{"observed_at":"2026-08-05T12:59:07.342984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.441350Z","title":"Replanvlm: Replanning robotic tasks with visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.441350Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:3c040205ff9244a8bb1475d3e8de74b333a351405fe7c022c465dfd05d690aa1","observation_id":"6d6d9773-67ed-4d07-b990-9c072a628796","resolution":{"observed_at":"2026-08-05T12:59:07.441350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.580936Z","title":"Learning neuro-symbolic programs for language guided robot manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.580936Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:0e5d76e4b8980b02e80a867bc217b0195e92e3aa0eec690f76f577b473352e30","observation_id":"3956df26-9c4d-4595-a7e5-5367d4bb48ed","resolution":{"observed_at":"2026-08-05T12:59:07.580936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:07.745114Z","title":"Inferring compact representations for efficient natural language understanding of robot instructions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.745114Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:8e38d81101f1bdcf2e204afd22186baea3eb2c0af4c0a97b342e64f5d073895d","observation_id":"48f608a2-f80e-41b4-a83a-3b1f9bc6ea82","resolution":{"observed_at":"2026-08-05T12:59:07.745114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-08-16T21:34:35.147772Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T12:59:07.911059Z","title":"Ui-tars: Pioneering automated gui interaction with native agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:07.911059Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:de047ab0377cdb244f13f77b7fab890db7ed2efc4e5f62b576b5324c0f84270b","observation_id":"c3ad3db6-bf3a-49b0-b0de-4e15bbfde9be","resolution":{"observed_at":"2026-08-05T12:59:07.911059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:08.068509Z","title":"Sat: Dynamic spatial aptitude training for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.068509Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:6014e20f054096869657eb4f92c02666a6e61405f78eb5ee14377c3cce7d2182","observation_id":"03c2ca66-e163-49f2-b2f2-e9355f092bbd","resolution":{"observed_at":"2026-08-05T12:59:08.068509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:08.185835Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.185835Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:c32d189eb0723a88870411bc24a75bfcf16986ee485a9756c8adb979ad524b84","observation_id":"375c6a84-e61f-48d3-b27b-bc4a21b4f5f4","resolution":{"observed_at":"2026-08-05T12:59:08.185835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06237","last_updated":"2024-10-08T17:52:29Z","snapshot_observed_at":"2026-08-18T09:19:45.451184Z","submitted_at":"2024-10-08T17:52:29Z","title":"BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06237","snapshot_observed_at":"2026-08-05T12:59:08.298139Z","title":"Bumble: Unifying reasoning and acting with vision-language models for building-wide mobile manipulation.arXiv preprint arXiv:2410.06237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.298139Z"},"links":{"cited_paper":"/paper/2410.06237","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:eae32248c8b2bb689422f0e51fba5208bb59dd152fba0efed9bc06b5a92f370d","observation_id":"927c008b-31f1-4c62-a208-4ce12561b9aa","resolution":{"observed_at":"2026-08-05T12:59:08.298139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T12:59:08.410400Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.410400Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:92470a5880f3067231d5b24a1a11358a0e9bfd6bc32aa7a1eb37fef6e9befc89","observation_id":"40a704e9-fd5d-46a9-86fb-92e58a4da28c","resolution":{"observed_at":"2026-08-05T12:59:08.410400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T12:59:08.564582Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.564582Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:c2e06d8c9f7cc940575ed8b691dfdd096500c0ff75a2303fbd21f0eb36ca5d06","observation_id":"da823dbb-82e2-4034-8c5e-9f23e8001ed4","resolution":{"observed_at":"2026-08-05T12:59:08.564582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-16T14:08:19.225762Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-05T12:59:08.695569Z","title":"Yell at your robot: Improving on-the-fly from language corrections.arXiv preprint arXiv:2403.12910, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.695569Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:c23f6cd56f1d0ef6ab6cf35731aaf730015fc71f26598637002a1271d61813b5","observation_id":"7c81220b-2e9c-42ce-8848-932d7cd80413","resolution":{"observed_at":"2026-08-05T12:59:08.695569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:08.856706Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:08.856706Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:0a8ec029829de8e70807cc3097250b387be3838bab447dcaa2b4023f1c0f19cb","observation_id":"6d0800b7-e9c8-45d3-99f2-bc622d9fc4ff","resolution":{"observed_at":"2026-08-05T12:59:08.856706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05881","last_updated":"2026-07-22T01:32:22Z","snapshot_observed_at":"2026-08-16T13:44:44.173490Z","submitted_at":"2024-06-09T18:40:24Z","title":"Training Fast Robot Policies with Slow Foundation Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05881","snapshot_observed_at":"2026-08-05T12:59:09.012697Z","title":"Lgr2: Language guided reward relabeling for accelerating hierarchical reinforcement learning.arXiv preprint arXiv:2406.05881, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.012697Z"},"links":{"cited_paper":"/paper/2406.05881","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:41be37c23704f62af0ba358c67c691773df923605151bf41513bd6c697eb0dd3","observation_id":"5be4fc03-8e36-41fc-bfc4-2332b2f9f9ca","resolution":{"observed_at":"2026-08-05T12:59:09.012697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04157","last_updated":"2024-02-20T11:38:09Z","snapshot_observed_at":"2026-08-18T10:09:52.675307Z","submitted_at":"2024-01-08T18:57:54Z","title":"RePLan: Robotic Replanning with Perception and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04157","snapshot_observed_at":"2026-08-05T12:59:09.161211Z","title":"Replan: Robotic replanning with perception and language models.arXiv preprint arXiv:2401.04157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.161211Z"},"links":{"cited_paper":"/paper/2401.04157","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:3fcab71c2800ecbd785f4af911fdc0eac44442d30ad474eae1c55107e951c827","observation_id":"ef0fbf23-e5d7-46fb-a8af-80845fc76ee6","resolution":{"observed_at":"2026-08-05T12:59:09.161211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:09.332239Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.332239Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ab3d6c3965528c48ea006a0161f439916fb1675575258049896814e682f36abd","observation_id":"5f42247c-9cdc-4ee2-99ca-ac24bb4172f5","resolution":{"observed_at":"2026-08-05T12:59:09.332239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:09.472406Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.472406Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:bba9945f52af5ddfb5403ea1ec18a815cbf63e3ba7e1d8ee7e0c53d52e656996","observation_id":"33708047-ae13-4b53-80c1-131345f2bab0","resolution":{"observed_at":"2026-08-05T12:59:09.472406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:09.635886Z","title":"A computational model for the alignment of hierarchical scene representations in human-robot interaction","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.635886Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:03d98dadca842ff8f780ed3ecc1d1d17563c010f1c103948604a7c9af456e495","observation_id":"f52680d0-0d51-46cb-9967-a78a24b2c9d6","resolution":{"observed_at":"2026-08-05T12:59:09.635886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-05T12:59:09.771943Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.771943Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:7d4e9b52fe6aec4458aa231fbc8a978f19d6cdf63b39b95ca068abff9498938f","observation_id":"a8104a18-b6bd-4ad5-b0a8-412a6d027c3a","resolution":{"observed_at":"2026-08-05T12:59:09.771943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T12:59:09.923338Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.923338Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:2aeb7810156f5bddf6d897a25b100cd7082ad97d2e61b5da8312a13549a99a2a","observation_id":"9b7e8edd-6d59-4e94-8ee6-62cd7e653818","resolution":{"observed_at":"2026-08-05T12:59:09.923338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.029446Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.029446Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:8f00134559ad6c6d97e5c396032d6be8ff9e4a4929420110f85b8e5a760989ac","observation_id":"773bc02a-ff26-4a7b-84dc-9436a726a017","resolution":{"observed_at":"2026-08-05T12:59:10.029446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.157741Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.157741Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:afc7161b4eefbb30aaddaa0f61b524a33142bbf385b76c37c52c903a7b50f815","observation_id":"bc8a0d76-e49e-4afd-95cc-51212d95302b","resolution":{"observed_at":"2026-08-05T12:59:10.157741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.272498Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.272498Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:f0811b9e86222626923bfdaa4ef7501adbcc0366696b44540555cffb806878f5","observation_id":"b4f544af-bfcd-4d53-a5df-ad6cffd961fd","resolution":{"observed_at":"2026-08-05T12:59:10.272498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.391143Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model.arXiv preprint arXiv:2410.08792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.391143Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ee9c1ceb43b27bb269ff073e7258da9d841f6a1e1fe01bc5b7b8e7b9e270c5fe","observation_id":"f3b0586f-5ecc-48bd-b4ba-376076d3d660","resolution":{"observed_at":"2026-08-05T12:59:10.391143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.565490Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.565490Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:1e735e0a9d2038d132f9ec4e93ba27bf865d210addfe2637dfa2a847906decdc","observation_id":"e1296c8f-3acd-4c63-9477-eae58e10f759","resolution":{"observed_at":"2026-08-05T12:59:10.565490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.671368Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.671368Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:3a0b7506d96fa25c405eb7518f213aa0db46d80195ef9d694d1b8ebb75a9ceb4","observation_id":"503be337-6b59-4a2d-8eac-f930b83612a9","resolution":{"observed_at":"2026-08-05T12:59:10.671368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.820418Z","title":"Realworldqa: A benchmark for real-world spatial understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.820418Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:b78925565d9610b41335a0b1742b63ae33d2db1a9b31e020d5ce66308c36c1a1","observation_id":"620ab59e-0483-40c1-882a-867709639a89","resolution":{"observed_at":"2026-08-05T12:59:10.820418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:10.967342Z","title":"Robi butler: Remote multimodal interactions with household robot assistant.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:10.967342Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:596c048415c8820ed406d9bec271c84344ce744f619de03bf4421493c933c9d3","observation_id":"a34f382f-3aae-44c5-b5fc-2e769a9ff4a1","resolution":{"observed_at":"2026-08-05T12:59:10.967342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:11.140530Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.140530Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:98e2ce5207ef0094af4350897559535ad675f61624370bcca04b6d3f3e92c3d7","observation_id":"026ddf75-e6e0-4e01-8e26-25b5ad9a4089","resolution":{"observed_at":"2026-08-05T12:59:11.140530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T12:59:11.249828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.249828Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:54f04cb0ba8b4d0e28a100168b6b402a114e32c89ee7b903680dcea18ba7463e","observation_id":"bf22460e-8335-42ee-a74f-9b975af3fe3f","resolution":{"observed_at":"2026-08-05T12:59:11.249828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:11.408016Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.408016Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:0fb30619e05e68adf8c012be5db76abc760dd232fca17e5abac838c226bf2a0c","observation_id":"30b00689-83ca-4d8b-b053-291e1f744a17","resolution":{"observed_at":"2026-08-05T12:59:11.408016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:11.570280Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.570280Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:29d2ef39584f8c3164aa06131bf66588283d0c960f309912acae9dd00a63017b","observation_id":"1874543e-c9ed-4490-8ced-7391c21209bd","resolution":{"observed_at":"2026-08-05T12:59:11.570280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-18T20:44:38.423700Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-05T12:59:11.689386Z","title":"Guiding long-horizon task and motion planning with vision language models.arXiv preprint arXiv:2410.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.689386Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:8c575f943cd735f19bc63fde60af387989bd7a0ef1eea8fafd08090e41d58822","observation_id":"a9cb9800-7ff5-4f6c-b124-748e3bb55792","resolution":{"observed_at":"2026-08-05T12:59:11.689386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:11.802332Z","title":"React meets actre: Autonomous annotation of agent trajectories for contrastive self-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.802332Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:79f097c6f4b1c46ed78576e10f8dd1f47b02aeb39babbcf0a64292c355726ec7","observation_id":"b243409a-a2b3-4b1f-9d02-3f3a72b93531","resolution":{"observed_at":"2026-08-05T12:59:11.802332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:11.942973Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:11.942973Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:4dbee3750fef30d5faec24a1f81c22a0c80c6d318f1931a1ebd53977ff9099db","observation_id":"4fb06083-efc2-4199-a814-2c775018d03a","resolution":{"observed_at":"2026-08-05T12:59:11.942973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:26.655537Z","title":"Modeling context in referring expressions","venue":null,"work_id":"7eabecdb-9c78-4858-954a-f69f592834b6","year":2016},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.054187Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:35996d7dd835462d6a08f02ba60b70f4a1303385e304a1c69ada023372938b58","observation_id":"c0074c62-8ad1-4985-88e5-030310af1734","resolution":{"observed_at":"2026-08-05T12:59:26.708363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-16T13:42:40.054113Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T12:59:12.140493Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.140493Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:3c583c3f0bdfc990ce817b818fe331196009727763cff1b4d8a1ee89f0ee5fed","observation_id":"84fa15c7-d9e8-47b4-a224-0d2076156adc","resolution":{"observed_at":"2026-08-05T12:59:12.140493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:12.239351Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.239351Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:f3196f9c71f18e872035eded8e69bff73451f4ea3fd56d8b4249b1211b5d84da","observation_id":"4ea46547-e157-4b86-ad75-e983a5750cfd","resolution":{"observed_at":"2026-08-05T12:59:12.239351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-05T12:59:12.357404Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.357404Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:41a3c7a36cdfdc621021f1b7448be1e19641f2b4705386d9cfad0057ca68cf29","observation_id":"df2a021d-6fbe-4c16-8108-5aac4f6f3fa0","resolution":{"observed_at":"2026-08-05T12:59:12.357404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-08-17T01:02:48.636154Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-05T12:59:12.476025Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers.arXiv preprint arXiv:2410.05273, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.476025Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:4a03ea8702226b9b81fde1d05c2c16aa47a2f4879a9c5b75fbce280a5ba85d9c","observation_id":"780fd405-7415-4757-a7b5-5cd6af9ccfa7","resolution":{"observed_at":"2026-08-05T12:59:12.476025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-16T12:46:13.492295Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-05T12:59:12.617700Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks.arXiv preprint arXiv:2503.21696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.617700Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:5bd62061bf91d68a86ac68115eed6ada8b3e63dfbf987f0aa989851733bf55af","observation_id":"9cf4dfdc-b622-4b66-8d4e-ab171b1836fe","resolution":{"observed_at":"2026-08-05T12:59:12.617700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19442","last_updated":"2025-06-05T05:48:26Z","snapshot_observed_at":"2026-08-16T23:40:39.321894Z","submitted_at":"2025-04-28T03:09:22Z","title":"Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19442","snapshot_observed_at":"2026-08-05T12:59:12.728206Z","title":"Triton-distributed: Programming overlapping kernels on distributed ai systems with the triton compiler, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.728206Z"},"links":{"cited_paper":"/paper/2504.19442","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:381e998a5d7e6babb23dd324045433be117bb5783fd1007477d7891569074ecf","observation_id":"22004933-2a11-4577-8921-b843a28ddd72","resolution":{"observed_at":"2026-08-05T12:59:12.728206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20313","last_updated":"2025-04-03T10:23:19Z","snapshot_observed_at":"2026-08-16T12:46:43.833593Z","submitted_at":"2025-03-26T08:25:12Z","title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20313","snapshot_observed_at":"2026-08-05T12:59:12.867258Z","title":"Tilelink: Generating efficient compute-communication overlapping kernels using tile-centric primitives.arXiv preprint arXiv:2503.20313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.867258Z"},"links":{"cited_paper":"/paper/2503.20313","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:dc4e4ceb46960d38717d0a8e6ad61ddece6cfca8ef2285ad06af2eb9c24bbc0d","observation_id":"edc016db-8c0a-4f9b-8538-d196f4b2edd2","resolution":{"observed_at":"2026-08-05T12:59:12.867258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10220","last_updated":"2025-03-07T05:09:28Z","snapshot_observed_at":"2026-08-16T14:00:39.252550Z","submitted_at":"2024-04-16T02:01:56Z","title":"Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10220","snapshot_observed_at":"2026-08-05T12:59:12.992499Z","title":"put tomato into fridge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.992499Z"},"links":{"cited_paper":"/paper/2404.10220","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:7ad8d5bd65a582b1cfdae8711bf57265c3e3a5f187186b48e07ea6c36deccfbb","observation_id":"6183b4dc-5fcc-4896-b618-c7b437d9c4f1","resolution":{"observed_at":"2026-08-05T12:59:12.992499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:26.240326Z","title":"The final answer is: 1.0 User:","venue":null,"work_id":"2c9493a7-7165-48ac-9fc1-ab220ae45225","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.223859Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:367a2f202dad503db2edbc373e5b94b6a50a1d8ae5fbc795fa65e39774dff9cd","observation_id":"dd3a42c0-c976-4ec1-91d0-3dbe33d16844","resolution":{"observed_at":"2026-08-05T12:59:26.330577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:26.029530Z","title":null,"venue":null,"work_id":"dc774d46-1ebf-4544-b282-f5c7f1188b94","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.389796Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:5f0ee10acbf49205224fa1540de266543d2c69595b3449c3e8f85fe0e2205c04","observation_id":"0c13c481-d5e5-48df-9134-ea9a25ed51f5","resolution":{"observed_at":"2026-08-05T12:59:26.153967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:25.857005Z","title":"The final answer is: 1.0 User:","venue":null,"work_id":"a353b7b2-feb9-43de-bf86-f6d82a185a45","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.497427Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:ad2d97627c03c1bd986df037da08bb25edc4e2cbc6efe1505afe26eaae6ba698","observation_id":"931a56ef-03c9-460b-a902-9cfbb5cbaaf7","resolution":{"observed_at":"2026-08-05T12:59:25.913951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:25.569175Z","title":null,"venue":null,"work_id":"3d9f4a62-695d-48c5-a26f-419758562318","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.639778Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:76c64ab58ed199235534c63d77aa4f5c17c691c76c3b61a2f1bbb2c6a8e68125","observation_id":"939c18ae-f4d7-44c9-b6d3-064df300d143","resolution":{"observed_at":"2026-08-05T12:59:25.705208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:25.276768Z","title":"Assistant: Two sentences are the same semantically","venue":null,"work_id":"d70afd4e-6022-4aaa-b0ea-6c464a405940","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.820200Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:636b9e925577992c07e07d1f60511576e0e6947307819bc70bfdf660c44274f5","observation_id":"86c3b57c-5f19-4b71-8e53-2424c01cfbbc","resolution":{"observed_at":"2026-08-05T12:59:25.425349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:24.976416Z","title":null,"venue":null,"work_id":"2a57fa8f-7bd5-4a5d-b668-348dea6aa2d3","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:13.942168Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:e69f431e68e4252f2ab73dc0b1bc0d070c4ac486e6ed213b86e295beb6e49b44","observation_id":"3bd13101-5678-4ea9-879e-6f04ea506de1","resolution":{"observed_at":"2026-08-05T12:59:25.144857Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:24.720083Z","title":"The final answer is: 1.0 User:","venue":null,"work_id":"b96a6f9d-2637-43d2-a2af-d079e54bcb88","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.077855Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:f7a171e4a9df8fa32845815ab297281e2f3cfb1b750b6f82d0c44e7c32facdc6","observation_id":"96a7d1e4-925f-4ba1-b189-f98c66aaceb5","resolution":{"observed_at":"2026-08-05T12:59:24.876262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:24.441736Z","title":null,"venue":null,"work_id":"ba4a5bd9-31fc-476f-a871-7b513f25809b","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.214584Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:22acfa064a607ee7fb4e5f4ba307b5481139f7dc751160dbe4e4d4724d2f9659","observation_id":"9445cfd4-943c-4fa8-8df3-7b245da2ec43","resolution":{"observed_at":"2026-08-05T12:59:24.578564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:24.053215Z","title":"The final answer is: 1.0 User:","venue":null,"work_id":"e908cd79-bdfd-4b32-aa0d-06bd9b693be2","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.395191Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:677241b37654cbdac4998550ed70861c29363ad5694ad344d942bdf41734a44f","observation_id":"1bc0c6d0-617e-47a1-9ea9-f5a695077e7b","resolution":{"observed_at":"2026-08-05T12:59:24.268262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:23.747057Z","title":null,"venue":null,"work_id":"29fb974c-04d4-43d9-86ca-5c453849a0a9","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.508124Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:a43a15ad92ea2044082aba10c6e32938cfb8a1f6b5d51b02e1318675f8d940fa","observation_id":"2685e272-662a-4cce-9660-3e38a6b04b7d","resolution":{"observed_at":"2026-08-05T12:59:23.858322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:23.452006Z","title":"The final answer is: 1.0 User:","venue":null,"work_id":"8fa51501-9187-4ccc-afc7-7854e08b705e","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.646305Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:807c2a87f4a8b281d2fbc5d7a257461c5234c47ec12f81420c25ba06ee9bd4bd","observation_id":"c5cd07f8-bd5c-401d-97da-795532a8a323","resolution":{"observed_at":"2026-08-05T12:59:23.570632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:59:23.141798Z","title":"knife) are different semantically","venue":null,"work_id":"cf88c2af-9d1b-4883-98b8-cc057af1d1fb","year":null},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:14.995680Z"},"links":{"citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:f580173fb3627f869455a237624176470eab0194263c05774dca8dfbee9114ac","observation_id":"25043dd2-bf9c-45dd-be15-1070604ba7cc","resolution":{"observed_at":"2026-08-05T12:59:23.328443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":89,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 11 inbound Pith citation observations for arXiv:2509.01106."}