{"as_of":"2026-08-15T10:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1c35d2f6816eae7a56e55391dc5393c64780ee6254a8810530c86d4321381b2","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:31.149194Z","state":"measured"},{"denominator":143,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":143,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":54,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:36:21.485253Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T12:04:50.478072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-06T04:36:34.405669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03263","last_updated":"2026-06-28T12:48:23Z","snapshot_observed_at":"2026-08-13T08:48:36.784390Z","submitted_at":"2025-08-05T09:39:25Z","title":"Volume-Distance-Ratio Asymptote and Spacetime Inextendibility for FLRW Spacetimes","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:36:34.405669Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2508.03263"},"observation_digest":"sha256:4e581287e56c0251e88727469eebf70dfd6170bd52aab1a8ce96431bdc2ca8ce","observation_id":"1e619059-6be7-4144-bfef-f0c04d9be0bc","resolution":{"observed_at":"2026-08-06T04:36:34.405669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-05T12:59:09.771943Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:09.771943Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:7d4e9b52fe6aec4458aa231fbc8a978f19d6cdf63b39b95ca068abff9498938f","observation_id":"a8104a18-b6bd-4ad5-b0a8-412a6d027c3a","resolution":{"observed_at":"2026-08-05T12:59:09.771943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-04T12:55:08.254972Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-13T20:53:39.091470Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.254972Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:7c57c99b5c4efd93e862adbc670be33558a55d1b8e8fdfe1265ff7d63c3808bd","observation_id":"721b8a4e-f81f-432b-8093-86e6492b33a4","resolution":{"observed_at":"2026-08-04T12:55:08.254972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:72154446a603b460e9b1cdcab5e2afde4b97927e617c58bd12daa1ffcd102e79","observation_id":"5d270656-4c34-4b04-988e-df566723113e","resolution":{"observed_at":"2026-05-14T20:09:40.028188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2511.15669","last_updated":"2026-08-05T03:23:59Z","snapshot_observed_at":"2026-08-14T05:08:01.960027Z","submitted_at":"2025-10-31T05:26:16Z","title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-18T03:09:09.713822Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2511.15669"},"observation_digest":"sha256:8862e60e6755414d9f390f0a731a8e0ad1ce4be11a5535cc6519c0943fea63f8","observation_id":"c6fb03d1-eca1-4379-84f1-a1909f7b60b0","resolution":{"observed_at":"2026-05-18T03:10:48.948121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:0a2eb08e24453cfe63ba27331e421c8bc80004868993354a8e73f73b41fecf13","observation_id":"312253bc-4d71-48ed-bf49-7c0cd97e49b6","resolution":{"observed_at":"2026-05-17T20:42:05.697672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2511.17441","last_updated":"2026-04-13T12:31:35Z","snapshot_observed_at":"2026-08-14T08:08:04.254754Z","submitted_at":"2025-11-21T17:39:22Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T20:16:16.133013Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2511.17441"},"observation_digest":"sha256:96be87f423da3d5538b06937fc7c7cca60044383a5369dea5e51a946ce231db7","observation_id":"1310b23c-6acf-40e2-a448-6ee664d4bf35","resolution":{"observed_at":"2026-05-17T20:20:12.127420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-03T20:42:56.199932Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.199932Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:9a65265ec0c61ce893af19cf69486c434a09f494a560bff42511a3a2539cff7c","observation_id":"d3cd3b4f-b244-4860-961c-2e6fc1eb8c58","resolution":{"observed_at":"2026-08-03T20:42:56.199932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2512.12982","last_updated":"2026-04-12T02:37:04Z","snapshot_observed_at":"2026-08-14T04:54:12.348245Z","submitted_at":"2025-12-15T04:58:08Z","title":"Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T22:06:34.356607Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2512.12982"},"observation_digest":"sha256:dabe349eed79a68a79b73a4baa2b340715ed76999d93baf2807ac566d1487cae","observation_id":"59b7420e-52ac-42cf-b44c-0629262cf52b","resolution":{"observed_at":"2026-05-16T22:08:36.084109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-03T16:27:34.144120Z","title":"Robobrain 2.0 tech- nical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13660","last_updated":"2026-07-03T09:12:21Z","snapshot_observed_at":"2026-08-14T17:09:06.615250Z","submitted_at":"2025-12-15T18:52:43Z","title":"Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:34.144120Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2512.13660"},"observation_digest":"sha256:32c024c6926f08a07674d5cdc9bb45a2ef2dbe31a34d99c78d36243af4279c1f","observation_id":"1e942416-964a-4ecf-a20c-2f39435d7dca","resolution":{"observed_at":"2026-08-03T16:27:34.144120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-03T12:30:33.865225Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.865225Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:2c0d90c3d22648b3d5d195d43a6ace10b47c0a2b8341f5a6f2a8f1a28f7e59f5","observation_id":"40d4743d-ee15-45b4-8475-052663c11788","resolution":{"observed_at":"2026-08-03T12:30:33.865225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-13T23:42:44.515158Z","title":"arXiv preprint arXiv:2507.02029 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16506","last_updated":"2026-03-18T04:22:15Z","snapshot_observed_at":"2026-08-14T22:09:56.142850Z","submitted_at":"2026-03-17T13:36:30Z","title":"VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T23:42:44.515158Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2603.16506"},"observation_digest":"sha256:a15dbc08cfec5884e43484a1d88bec7dd2b0f6fecd472a4dddd4bb09ade07a91","observation_id":"3500d414-05ab-4a48-b91e-94189105986f","resolution":{"observed_at":"2026-07-13T23:42:44.515158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-15T09:17:29.929096Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:fec752bc83b5e2acaa5351f895c5eb7a4643731bd122898cf2434460a9693dde","observation_id":"3c464154-1166-491c-bd68-a4bb32f19043","resolution":{"observed_at":"2026-05-13T21:08:17.391514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:7b766539f6b5c123cbdd8f3098b9366a8aef4c1b1d89905c0681d77b3796e4da","observation_id":"792e59bc-433d-4cc6-84e5-57b6a9705f94","resolution":{"observed_at":"2026-05-11T05:15:57.143333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.08539","last_updated":"2026-04-19T05:24:16Z","snapshot_observed_at":"2026-08-14T16:19:44.882122Z","submitted_at":"2026-04-09T17:59:39Z","title":"OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:33.968186Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.08539"},"observation_digest":"sha256:b546f218cb8a2d86e260f313501181308ffa31bab73aed19804bdf2f952d4df9","observation_id":"116bf40b-0e40-460e-9ac7-9c301b178980","resolution":{"observed_at":"2026-05-11T07:30:58.595352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.08983","last_updated":"2026-06-11T11:03:00Z","snapshot_observed_at":"2026-08-08T18:19:42.023737Z","submitted_at":"2026-04-10T05:43:39Z","title":"AssemLM: A Spatial Reasoning Multimodal Large Language Model for Robotic Assembly","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.800233Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.08983"},"observation_digest":"sha256:ce80782fa0b6ed01204dcf103b191b4dd473c01cf7e17b368de948cf30e94764","observation_id":"184893ee-00ef-4250-97fa-b4bcc3484863","resolution":{"observed_at":"2026-05-11T00:41:02.016734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-12T23:37:01.875768Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08983","last_updated":"2026-06-11T11:03:00Z","snapshot_observed_at":"2026-08-08T18:19:42.023737Z","submitted_at":"2026-04-10T05:43:39Z","title":"AssemLM: A Spatial Reasoning Multimodal Large Language Model for Robotic Assembly","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T23:37:01.875768Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.08983"},"observation_digest":"sha256:a2dbafe191a78a24be592933e30e55340a9a4c0da5af2634e7d665d2cada1cbf","observation_id":"7c981598-7bfe-4828-8115-cb08b43cab03","resolution":{"observed_at":"2026-07-12T23:37:01.875768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.18000","last_updated":"2026-04-20T09:25:30Z","snapshot_observed_at":"2026-08-03T00:50:48.601549Z","submitted_at":"2026-04-20T09:25:30Z","title":"Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:18.284698Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.18000"},"observation_digest":"sha256:47dd33278ba5830fd7e0dc7ef758e0b80f7dc1e15eeb3a87cc9cd19416949e35","observation_id":"c96ee93e-b8a2-4904-8d92-d2025b1fee69","resolution":{"observed_at":"2026-05-11T11:56:28.939398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2604.21924","last_updated":"2026-04-23T17:59:04Z","snapshot_observed_at":"2026-08-11T14:12:44.952595Z","submitted_at":"2026-04-23T17:59:04Z","title":"Long-Horizon Manipulation via Trace-Conditioned VLA Planning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T21:10:03.554504Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2604.21924"},"observation_digest":"sha256:734913ed37fc2ad6a4d6b9659430efbe78feab9b195357456a47f11bf49b20b4","observation_id":"8865ec66-acc0-40a1-b058-ada5ceb91e39","resolution":{"observed_at":"2026-05-11T14:41:38.906730Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2605.01368","last_updated":"2026-05-02T10:25:40Z","snapshot_observed_at":"2026-08-14T00:19:55.399850Z","submitted_at":"2026-05-02T10:25:40Z","title":"Assistance Without Interruption: A Benchmark and LLM-based Framework for Non-Intrusive Human-Robot Assistance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T14:51:10.807902Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2605.01368"},"observation_digest":"sha256:48e79bbeca802e8d18bc49971344616a471fb1b4b69ee9e8091ca30a92d27c47","observation_id":"562395d8-55e6-4094-aced-4014a526ab31","resolution":{"observed_at":"2026-05-11T16:51:06.874405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:e8eca657d3d0d806419154151a40658988de11900ffdb55db843038756ef64ff","observation_id":"be5652f5-c3a7-465d-8802-17a00bfcf6de","resolution":{"observed_at":"2026-05-14T17:57:33.123620Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2605.25802","last_updated":"2026-05-25T12:51:35Z","snapshot_observed_at":"2026-08-14T11:23:24.601918Z","submitted_at":"2026-05-25T12:51:35Z","title":"Rethinking VLM Representation for VLA Initialization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:29.733181Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2605.25802"},"observation_digest":"sha256:6a2c42eea2e0420157dfd54ae0ce83ec67ae9fed650c51d5174e04f0f06339ca","observation_id":"cc82a7c8-12e2-42ec-a883-59a68d12ed19","resolution":{"observed_at":"2026-06-29T22:24:00.048577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-12T17:22:45.772096Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:0a832e23c7ee2714279f673f312bb097dd3addfaefc07494f3bf787e8f23c40b","observation_id":"def6574d-f7bc-4516-84fa-b5d4a983d7fc","resolution":{"observed_at":"2026-06-29T21:33:58.975304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2605.30307","last_updated":"2026-05-28T17:51:38Z","snapshot_observed_at":"2026-08-02T22:39:52.853482Z","submitted_at":"2026-05-28T17:51:38Z","title":"Grounded 3D-Aware Spatial Vision-Language Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T08:08:36.012761Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2605.30307"},"observation_digest":"sha256:08df472d4ad56c727cccfe98fd78c97c7ff2af9da04d7e7410c84804a82f6f39","observation_id":"789c2ad1-2173-4197-8139-3b88c54c1d28","resolution":{"observed_at":"2026-06-29T08:13:15.373936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.01810","last_updated":"2026-06-01T07:27:39Z","snapshot_observed_at":"2026-08-13T23:18:27.909031Z","submitted_at":"2026-06-01T07:27:39Z","title":"Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T14:19:40.492920Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.01810"},"observation_digest":"sha256:324d5083c7708263953633b7c244bde95b92abc2660c2b57f54037e6180f6743","observation_id":"3f16f2a2-b1dc-499f-8ce2-581e53067d84","resolution":{"observed_at":"2026-07-01T23:26:23.011643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.06476","last_updated":"2026-06-04T17:56:36Z","snapshot_observed_at":"2026-08-14T14:49:45.791813Z","submitted_at":"2026-06-04T17:56:36Z","title":"Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:30.998989Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.06476"},"observation_digest":"sha256:5b6cc74b617722b55a0ec9867db09430ba40aa6b65cbad1d6eabf85315d1a337","observation_id":"6e5147c4-8e9e-4803-9239-d81c15592bd9","resolution":{"observed_at":"2026-07-02T12:06:56.199501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:96d464e933eb1f74b6e7d029ac2e085a2b71ab4f716b1bb90ee4425d08350937","observation_id":"321c1fc5-bf7f-4f15-a02b-395bb2b7be90","resolution":{"observed_at":"2026-07-02T22:57:26.661631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:f1cf74832a52f52c9d25c418e74a80abf391ea08d09370ae327e8308312a96f7","observation_id":"1c86762d-7507-4838-a49b-2c4e8bb7adef","resolution":{"observed_at":"2026-07-03T04:27:36.986423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:a3baa7cc829bcf4315ccf5232c6690c001e21c82ceaeddcc3c4d16424137e9e6","observation_id":"b280ef3b-d1f4-4507-b32d-f76ad2c8f552","resolution":{"observed_at":"2026-07-03T06:07:41.253641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:c1f62d2be7d4d395bfd5283ca85bd3bc4e434d78e03c353f0277d5b1d30fb51b","observation_id":"accaf290-34ed-4811-a996-24dba529a17e","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-13T13:59:55.459417Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:59af8624871fc62788859f02c6e51d73c6457a02794528d22edb6c1d25f914bc","observation_id":"d14bc912-963f-4384-bef1-2007f85d81ef","resolution":{"observed_at":"2026-07-03T15:28:34.762558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-02T11:43:49.545830Z","title":"RoboBrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-13T13:59:55.459417Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:49.545830Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:774760b4551a865c6ef1c655d5e1374149b38d9fe3b378450d537ca5e1b2cbd7","observation_id":"8e09e1a5-fbbc-4c8b-96aa-c59eb4f48b7d","resolution":{"observed_at":"2026-08-02T11:43:49.545830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.13497","last_updated":"2026-06-11T15:46:28Z","snapshot_observed_at":"2026-08-14T06:17:42.515809Z","submitted_at":"2026-06-11T15:46:28Z","title":"SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T06:28:14.694168Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.13497"},"observation_digest":"sha256:6928598824bed7d66b8013f5867d7969b4c60d8b035ca09443bf6a1a69902c4b","observation_id":"67811327-e148-4b8a-a6c2-c92a09affd0d","resolution":{"observed_at":"2026-07-03T15:28:34.372338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:17:48.279808Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:77346fd6009cc8f6bdd655d97f271d34457d3246c45c7882d48def44c46e856c","observation_id":"5afc2cf3-1a49-4f3e-b658-38abde83644e","resolution":{"observed_at":"2026-06-30T11:24:38.342268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-02T11:20:27.100594Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T11:20:27.100594Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:02865d0f6d3e0d58e251d59defc53fb7fa6023d3915cbbfb79ef6617c83985e7","observation_id":"7be93e99-e912-46d8-a1e9-be24969da321","resolution":{"observed_at":"2026-08-02T11:20:27.100594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:e109425c093b80eab18d366abb40215f256b78c2eb3fcd955b54e47102ededd5","observation_id":"b0a6796d-6f6e-498f-896d-ebb3505f7740","resolution":{"observed_at":"2026-07-04T04:29:35.627244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.23686","last_updated":"2026-06-26T07:29:00Z","snapshot_observed_at":"2026-08-02T07:49:25.392809Z","submitted_at":"2026-06-22T17:59:53Z","title":"LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T07:55:28.884473Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.23686"},"observation_digest":"sha256:c71b5bbb9d777c4ba0d0a67c20098b1055def4475bbbcd4d553b8dc99e0619b7","observation_id":"c588d71b-7b20-48a4-92ad-439f99dc3459","resolution":{"observed_at":"2026-07-04T11:29:51.478385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.23686","last_updated":"2026-06-26T07:29:00Z","snapshot_observed_at":"2026-08-02T07:49:25.392809Z","submitted_at":"2026-06-22T17:59:53Z","title":"LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T04:41:28.564104Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.23686"},"observation_digest":"sha256:3c1acd1e040eb635deaa1796c1868f02c9d84ca5501d19b8ba1af138687ec23e","observation_id":"24cb4fcb-10bf-48fd-8a4a-65e2b9372917","resolution":{"observed_at":"2026-06-29T19:33:54.753630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.27251","last_updated":"2026-06-25T16:36:35Z","snapshot_observed_at":"2026-08-14T18:00:05.820542Z","submitted_at":"2026-06-25T16:36:35Z","title":"Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T04:52:51.524022Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.27251"},"observation_digest":"sha256:0f04101bf2cfb21ca89ef812a472a56b692d9a89f3faeae4b26f52706178b2ba","observation_id":"4c17d25a-fd0e-4a60-90f7-ddad61284316","resolution":{"observed_at":"2026-07-04T13:49:52.044905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:fdfc0c7f24ce4aa8966bfd54ce48a39b551f6e02470060aab7815119f2f1ff9d","observation_id":"06fed410-4c3c-41b4-9306-01dfa57cda84","resolution":{"observed_at":"2026-06-30T15:44:49.418964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2607.00881","last_updated":"2026-07-01T12:45:12Z","snapshot_observed_at":"2026-08-14T20:35:18.801176Z","submitted_at":"2026-07-01T12:45:12Z","title":"OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-02T14:16:39.649823Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.00881"},"observation_digest":"sha256:e611ad1ed69e696228201e0ded425131cd4b8750dd8b8ad84e2cc8c674e87eaf","observation_id":"897b8aa1-69fd-47f7-8154-e21fb5a12df2","resolution":{"observed_at":"2026-07-02T14:17:02.454959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-12T13:31:45.799876Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f24bc68facc167ae37e76520d81c333e0b3bf56296b338579b4be15245f0ccb8","observation_id":"eddaea49-160f-4f46-b2b9-b8d3487ef1b8","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T12:00:14.336135Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:8d95df6d5ab66eaee6ec1e3a8cac5ea937f728099afaabb10596fad5f4a489d0","observation_id":"c4030680-8200-4dd6-a557-2cc703beefc7","resolution":{"observed_at":"2026-07-08T12:04:50.479862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-02T08:21:36.948882Z","title":"RoboBrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.948882Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:9657ba5424ec49d432a7c2c4485adbf24612672e03f5200c8c5aeb11cf491ab7","observation_id":"08bcabca-1051-4af6-b540-b0d21096afe0","resolution":{"observed_at":"2026-08-02T08:21:36.948882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2607.06537","last_updated":"2026-07-11T15:47:01Z","snapshot_observed_at":"2026-08-15T09:34:04.390154Z","submitted_at":"2026-07-07T17:42:08Z","title":"UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-08T02:41:24.989404Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.06537"},"observation_digest":"sha256:ebaf1281dbfa04d375b9bcd0dbd6370f15b439b4f6c1c6411779a2c339d3cee3","observation_id":"bd05024f-bb2d-4fd8-a1c9-7448c1edee98","resolution":{"observed_at":"2026-07-08T02:44:27.771049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-14T16:00:02.584798Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06537","last_updated":"2026-07-11T15:47:01Z","snapshot_observed_at":"2026-08-15T09:34:04.390154Z","submitted_at":"2026-07-07T17:42:08Z","title":"UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:02.584798Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.06537"},"observation_digest":"sha256:c4e7a3a2394dd5f005057644fbe454db756845147980170efbb46d1a7606f795","observation_id":"98b34350-2ead-4960-abfc-0934a5747fc6","resolution":{"observed_at":"2026-07-14T16:00:02.584798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:5b2a5165909cb0884ed276b0daae84b966245dfa191469a4bfdafd20402c7017","observation_id":"3b298bf2-7407-4c2f-bb5f-bab3dc6a40ab","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-02T07:21:31.686911Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:31.686911Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:14f4bd89ef6e4d28abb421806588a8e2fca23db8018035ea79c31d00467d6a2f","observation_id":"275781c7-e1be-445d-8f89-fd43418dc941","resolution":{"observed_at":"2026-08-02T07:21:31.686911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-01T16:20:28.787487Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18062","last_updated":"2026-07-20T15:30:16Z","snapshot_observed_at":"2026-08-14T00:55:45.008566Z","submitted_at":"2026-07-20T15:30:16Z","title":"UniETP: Unifying Environments for Generalizable Embodied Task Planning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:28.787487Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.18062"},"observation_digest":"sha256:9b23e69248e804872e8e2d40f9a59f59b613bcd12cb075a980491bf54c140f0d","observation_id":"8e10392d-9963-4043-9964-8d0bf5d46972","resolution":{"observed_at":"2026-08-01T16:20:28.787487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-01T14:39:41.142227Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-14T23:38:47.751546Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:41.142227Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:45b69142e237ff1151b32852c5e26789d9854fab1a4648e113262415540888a6","observation_id":"0695f7e4-7f7f-49ba-9bf2-497e60fab566","resolution":{"observed_at":"2026-08-01T14:39:41.142227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-04T00:49:36.759144Z","title":"arXiv preprint arXiv:2507.02029 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00315","last_updated":"2026-07-31T22:00:35Z","snapshot_observed_at":"2026-08-07T01:30:24.546411Z","submitted_at":"2026-07-31T22:00:35Z","title":"Towards General Language-Conditioned Latent Safety Filters","version":1},"reference_index":246,"source":"arxiv_source","source_observed_at":"2026-08-04T00:49:36.759144Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2608.00315"},"observation_digest":"sha256:dae3b3d4f7238b2fd9ac17c529abb950f6484c3d9a00dde21037366e5a417629","observation_id":"57720f11-e530-450d-82e3-d0b31f305f76","resolution":{"observed_at":"2026-08-04T00:49:36.759144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-05T00:54:48.781637Z","title":"Robo- Brain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-12T17:20:07.679215Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.781637Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:d1b87c949687b30c0ddc58166e470ba175701f8b99dc2ac28e46328e3b07d4f6","observation_id":"29606749-d338-4124-8d6e-841411590730","resolution":{"observed_at":"2026-08-05T00:54:48.781637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-07T19:38:41.751687Z","title":"Wang, Z.; Chen, Y.; Liu, Y.; Ye, J.; Chen, P.; Lu, C.; Liu, S.; and Jia, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05999","last_updated":"2026-08-06T13:07:56Z","snapshot_observed_at":"2026-08-13T08:22:20.648035Z","submitted_at":"2026-08-06T13:07:56Z","title":"Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T19:38:41.751687Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2608.05999"},"observation_digest":"sha256:255741b7354a61829d2deef8178dfa76278818c78cef507a981c40cf323ec17e","observation_id":"a1f67bc6-4803-4003-9aae-34437e4bcdcd","resolution":{"observed_at":"2026-08-07T19:38:41.751687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-12T00:36:21.485253Z","title":"Wang,L.;Ling,Y.;Yuan,Z.;Shridhar,M.;Bao,C.;Qin,Y.; Wang,B.;Xu,H.;andWang,X.2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08036","last_updated":"2026-08-08T09:45:01Z","snapshot_observed_at":"2026-08-14T18:44:09.464887Z","submitted_at":"2026-08-08T09:45:01Z","title":"Compiling and Benchmarking Task-State Horizons for Embodied Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:36:21.485253Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2608.08036"},"observation_digest":"sha256:7a1b20189fc17df3ef4736632b3254484f505f9b7305186a5288f7c0cf9b97d6","observation_id":"d0722474-d9b0-4ecd-8677-e418b507e6aa","resolution":{"observed_at":"2026-08-12T00:36:21.485253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02029/citation-record","integrity":"/paper/2507.02029/integrity","json":"/paper/2507.02029/citation-record.json","paper":"/paper/2507.02029"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:26.532740Z","title":"Webdataset: High-performance data loading for deep learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.532740Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6575b776a61bf37ab9f1260a71f8b51d5f194bf3530c5fb466c5afe35221bd70","observation_id":"39906c01-6c21-4128-949a-80cee1babd2f","resolution":{"observed_at":"2026-08-06T20:47:26.532740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:26.647128Z","title":"Claude sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.647128Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:c730e468db92577dbb440bdc0652d33830b6c365bfc68d399379d36fff2775a7","observation_id":"677d2b77-6640-43f0-a663-90604ecedada","resolution":{"observed_at":"2026-08-06T20:47:26.647128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:26.724399Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.724399Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:442dd8e983d9f5619356cf72dfce27449e77bea7af001817081a6a41680665a2","observation_id":"2d2c5fc0-8b1e-4052-ab4c-0b1b6c11e429","resolution":{"observed_at":"2026-08-06T20:47:26.724399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-06T20:47:26.803395Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.803395Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:32e4e2c442139177db49fe3211b00a87a36f640ee2bce0f86c5660ca46ccdb9d","observation_id":"244d8de8-3194-4fdd-a734-be9509806f03","resolution":{"observed_at":"2026-08-06T20:47:26.803395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:47:26.861229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.861229Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:b6f3473df7d7de0e0c07a1733ddc6a2ba386da4828399f00f26082e886c79e32","observation_id":"a17216aa-7d8f-4945-8134-3654cc2ca257","resolution":{"observed_at":"2026-08-06T20:47:26.861229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-06T20:47:26.979701Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:26.979701Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:53ccb9903563e2f86b86358472aa3ddf8b988d93ee5c49ca055af4f261c8bc89","observation_id":"f72dd003-b3e8-4de9-9b7d-1fb15a1c66ad","resolution":{"observed_at":"2026-08-06T20:47:26.979701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.050956Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.050956Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d5bac771c946fd86749207ee3a51aaaf30270d4c992c560eb4142191d4221d1d","observation_id":"0849cc23-5289-46b8-a50a-c9c1a710953a","resolution":{"observed_at":"2026-08-06T20:47:27.050956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.208513Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.208513Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:b0d5b6b392376f30f2c88783c99766d7a3623d02e802a2cbd74ba99a5ba60501","observation_id":"79f26d2a-7a1c-41b2-8ff4-82c0113f6133","resolution":{"observed_at":"2026-08-06T20:47:27.208513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-13T05:05:27.544105Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T20:47:27.281733Z","title":"Egoplan-bench: Benchmarking multimodal large language models for human-level planning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.281733Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:3181f249ebf2a72309840720f558ee11402bda9f791fa103b8b3fb402486901d","observation_id":"ecf0f690-2bb9-40be-8e40-9e22bf23891c","resolution":{"observed_at":"2026-08-06T20:47:27.281733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T20:47:27.373818Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.373818Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:e033fc2e6cd168b1f1f44913ad8d68760beb894563557004c342222c9ee94f71","observation_id":"cc131c5a-11b1-4c06-a342-0008b3b18a14","resolution":{"observed_at":"2026-08-06T20:47:27.373818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.447799Z","title":"Llm agents for education: Advances and applications.arXiv preprint arXiv:2503.11733, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.447799Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:62e96b73f488fdf835117926df33f5afc95145df6aacbea245ae36708d6f6508","observation_id":"5bbf8db0-ef9e-43af-bb5a-fb3b6f9a74cc","resolution":{"observed_at":"2026-08-06T20:47:27.447799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.519289Z","title":"Flagscale: A unified meta-framework enabling adaptive heterogeneous computing for the llm ecosystem.https://github.com/FlagOpen/FlagScale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.519289Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:57e988f64c5462dfa4977576cf69e1cf77fb55bb655c766802277781bed586e2","observation_id":"525205e9-feb2-4aad-b8e7-96342ed3f4d9","resolution":{"observed_at":"2026-08-06T20:47:27.519289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T20:47:27.628877Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.628877Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:36e23e548d17d90a1888db7f638065c2b34851f2f2685bd4f2c0affcd18f2379","observation_id":"b6cfd4bc-253f-4779-a74d-c800be6a9dbc","resolution":{"observed_at":"2026-08-06T20:47:27.628877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.780921Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.780921Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:88652f0f2cb001d1e8537b77abee6bf5cf5f97c0a39c1fe53121cb2cf4ff8667","observation_id":"16e40d10-1250-4016-899c-0ada7d423795","resolution":{"observed_at":"2026-08-06T20:47:27.780921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.854641Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.854641Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:8c2ea58ada83ef1be1fdcb08b17f81cb63695ee58b89ec4d26b257898d3a4db3","observation_id":"d40506a7-e4ba-4a11-b952-94aac606ad7c","resolution":{"observed_at":"2026-08-06T20:47:27.854641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:27.976037Z","title":"Gemini 2.5 pro preview: even better coding performance.https://developers.googleblog.com/en/ gemini-2-5-pro-io-improved-coding-performance/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:27.976037Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:17de8ccdea83b958e3452e1f512de7c5c6e15e5f3bd3d679d7278f6597a17d83","observation_id":"e4ef93e2-9505-4ca9-be1e-d5455f83c727","resolution":{"observed_at":"2026-08-06T20:47:27.976037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:47:28.046364Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.046364Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:63b1ab2f97a8da06baf0e953f82b3de92681ab54ce3c4e4dc31da1a85760ab86","observation_id":"d50f7c05-705e-4c0b-b809-91381ded576b","resolution":{"observed_at":"2026-08-06T20:47:28.046364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T20:47:28.125248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.125248Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:17558524d46fe72949955ff92871b59651e94a5adfd364ca75d0d03fe036eae0","observation_id":"c67bc056-83d2-4264-83f5-d7a24b974d02","resolution":{"observed_at":"2026-08-06T20:47:28.125248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.275139Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"f0febc06-d166-47ca-ad96-1d76f4b1abed","year":2019},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.224406Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d61a4357d299c2d01c0c5cf0dee2574fc2e4e53d52a0056c9c0407b4cc80d840","observation_id":"21c77a9d-7977-47bc-b437-29abdcb4fa9b","resolution":{"observed_at":"2026-08-06T20:47:32.278055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09081","last_updated":"2025-07-28T19:31:25Z","snapshot_observed_at":"2026-08-14T15:34:17.408928Z","submitted_at":"2025-06-10T04:19:02Z","title":"FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation","version":3},"cited_work":{"arxiv_id":"2506.09081","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09081","snapshot_observed_at":"2026-08-06T20:47:31.775994Z","title":"FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation","venue":"cs.CV","work_id":"19a41c4e-12f1-4491-a4bf-705936b9d34b","year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.353756Z"},"links":{"cited_paper":"/paper/2506.09081","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:5291e0b6fc5052677d35e854ad8e976f8351060cbfa4b7d0f16087fb80e26e25","observation_id":"079ee21b-024d-408f-aa54-591abe156fb4","resolution":{"observed_at":"2026-08-06T20:47:31.781244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15777","last_updated":"2024-05-29T15:50:43Z","snapshot_observed_at":"2026-08-13T00:23:09.137603Z","submitted_at":"2024-04-24T09:55:24Z","title":"A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15777","snapshot_observed_at":"2026-08-06T20:47:28.421111Z","title":"A comprehensive survey on evaluating large language model applications in the medical industry.arXiv preprint arXiv:2404.15777, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.421111Z"},"links":{"cited_paper":"/paper/2404.15777","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a4f82617deb30fade7f94f32626cc63fedb852ec06207d95dc304fff8bdfffd6","observation_id":"77a87e03-afaf-4699-9570-43234d43b22e","resolution":{"observed_at":"2026-08-06T20:47:28.421111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T05:02:49.183338Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:47:28.505007Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.505007Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:78ed057bb6a94e567c690506cbdd6f1fc94075ddf3e0dfdba2109f9162f7827d","observation_id":"dfec7ac0-3e6a-4cda-81e7-d2da9b7c947c","resolution":{"observed_at":"2026-08-06T20:47:28.505007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:28.572627Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.572627Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:0da39771a90eb5365fc973a4768bb10a6de4a91880066d1dc91d7bda79626cc9","observation_id":"1f6677a5-f6ce-49cf-a2f9-6ca964fee7fe","resolution":{"observed_at":"2026-08-06T20:47:28.572627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:28.632024Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.632024Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:5467f579e62cbc95a987c228504bcd5cb0e98c640989fc6c3ac11788cb9d5de0","observation_id":"62194061-0669-4ef6-9159-3dd198d0baf1","resolution":{"observed_at":"2026-08-06T20:47:28.632024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-06T20:47:28.735777Z","title":"Ai2-thor: An interactive 3d environment for visual ai.arXiv preprint arXiv:1712.05474, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.735777Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:bb4aca77e53c1cb6c927c97ba82c8146cf4ba663d1ea20dd6dc6abeab0994fac","observation_id":"45924ed9-0e18-4060-a563-080f6458ba87","resolution":{"observed_at":"2026-08-06T20:47:28.735777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-08-13T15:46:09.531243Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T20:47:28.846985Z","title":"Reducing activation recomputation in large transformer models, 2022.URL https://arxiv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.846985Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:fc48c4b1d2df5120b448827ecd2921f7b2909a99e0c445ce0467cc1df44efcd2","observation_id":"56cb0289-22aa-40af-8685-0e92e1d25712","resolution":{"observed_at":"2026-08-06T20:47:28.846985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:28.932959Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.932959Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:e0f54502bfcf968a70e97864a85dc569e7c0805c4e4266e346f58b6e9d1de2c3","observation_id":"be4130e0-c720-492f-8576-ab834e2836ea","resolution":{"observed_at":"2026-08-06T20:47:28.932959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.248157Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.IJCV, 2020","venue":null,"work_id":"bdeb4e44-615f-4999-bb09-6a5e7d946d7e","year":2020},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.014207Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:04c454067e6f0315092ec225313f406b2f210d14dbfc4a5b692f4b846bad64e6","observation_id":"6c47d7e7-270a-4983-8b48-7fed382aa73e","resolution":{"observed_at":"2026-08-06T20:47:32.251143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04458","last_updated":"2024-12-05T18:59:09Z","snapshot_observed_at":"2026-08-14T20:09:22.418658Z","submitted_at":"2024-12-05T18:59:09Z","title":"Cubify Anything: Scaling Indoor 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04458","snapshot_observed_at":"2026-08-06T20:47:29.062663Z","title":"Cubify anything: Scaling indoor 3d object detection.arXiv preprint arXiv:2412.04458, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.062663Z"},"links":{"cited_paper":"/paper/2412.04458","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:b01125403900c125911bf4c3d5695363837e3cdee4bc697a7056f23dd7485ef6","observation_id":"1c4e674b-8d1d-4997-91ff-05bdece189d2","resolution":{"observed_at":"2026-08-06T20:47:29.062663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.239044Z","title":"Energon: Scaling megatron-lm training with data and expert parallelism, 2023","venue":null,"work_id":"51bcf4ae-aaf4-4822-9dfa-f33324eb1193","year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.159824Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:9724746f4c8ba9b5c441774b68cbed9e85ea4443c928df198eb533d26fe83c93","observation_id":"93f1fd8f-a9be-4e03-8992-7ad952de31e7","resolution":{"observed_at":"2026-08-06T20:47:32.241849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:47:29.218019Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.218019Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:37b96f938a4e48f6a31d0b5dd62f50a5227a7dca2b99e9ef70b6587e72b34638","observation_id":"36b5ab3a-f716-4ab1-9df3-cf863982ad9d","resolution":{"observed_at":"2026-08-06T20:47:29.218019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T06:26:48.150151Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T20:47:29.322899Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.322899Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:36a8d2f45cfff50704acf7413e951607bf82f4f3101381505ee8ef52d42d88cd","observation_id":"5658a705-190b-40ed-a03e-de457d93e25d","resolution":{"observed_at":"2026-08-06T20:47:29.322899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:29.449571Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.449571Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:3a3037f2e70d3ba7662d4df5f95145231ea89f5c60400a3451af4cc59a99c95d","observation_id":"8c48df8e-bd7d-49b2-96e2-18730c36fc9c","resolution":{"observed_at":"2026-08-06T20:47:29.449571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.222470Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"197630db-55bb-4c9c-a0f5-4dacb2010f58","year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.528347Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:330b656485e0e780a76a91462a3e24194c6b80dee48b68f8bc554abb240a9847","observation_id":"92ea8b59-4c88-4c0a-b179-f028ac161a1e","resolution":{"observed_at":"2026-08-06T20:47:32.226010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:29.553830Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.553830Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:51e06d37df9dff674c085995f2f7b265bdf7132e3e2673e3d957ff41d30a5c46","observation_id":"3dc12c3f-bc74-4b62-a834-a1ec1e5d00bc","resolution":{"observed_at":"2026-08-06T20:47:29.553830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-12T21:43:57.954411Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-06T20:47:29.605186Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.605186Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:ddcf625cc3227aea8da381da3b18566a997f434b60811f8dacecc912ce0c800e","observation_id":"92387108-7980-4289-8454-b5ce4b3b9582","resolution":{"observed_at":"2026-08-06T20:47:29.605186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-06T20:47:29.712258Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.712258Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:aabe58e832d81d1eb4578e2dd9d20e37d68aa03cf08d92dae12ac96d87e56b5b","observation_id":"9f4eaa05-3c48-4295-867b-5f016dce07cd","resolution":{"observed_at":"2026-08-06T20:47:29.712258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09401","last_updated":"2025-06-09T07:53:16Z","snapshot_observed_at":"2026-08-12T23:43:17.748374Z","submitted_at":"2024-06-13T17:59:30Z","title":"MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09401","snapshot_observed_at":"2026-08-06T20:47:29.800018Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.800018Z"},"links":{"cited_paper":"/paper/2406.09401","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d74660315061ec57064671fe3e3a1d144363136f3bf7bf46e1afa70c21da95c5","observation_id":"b7d85442-4198-47da-8d4a-051b4a91c961","resolution":{"observed_at":"2026-08-06T20:47:29.800018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.205885Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"a524c4e4-b45c-4d60-815b-04e4327357f3","year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.963352Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6b607fba1b5d8743fbb679dc29af66aab279c5c597a86294669ec9fff4160bb9","observation_id":"c2252a69-9cda-4174-8228-8eca3d874cff","resolution":{"observed_at":"2026-08-06T20:47:32.209299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T20:47:30.084151Z","title":"Mixed precision training, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.084151Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:4c233ecaf5fd2bd06d122ce48e6754e035ae9eec44692a7c6493162f9e6937ac","observation_id":"3235eac1-294a-40fc-b1e2-14ef618d2217","resolution":{"observed_at":"2026-08-06T20:47:30.084151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:30.158464Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.158464Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:292b598cba97d46af11976437eda74c048ed639cb4127317b68046a8ab103ed7","observation_id":"6dbc3042-abe1-4d06-8e6e-1d41dbed98ad","resolution":{"observed_at":"2026-08-06T20:47:30.158464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.189147Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"ebe66bc1-bd70-4bab-88bd-9d0312367b50","year":2021},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.293811Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:8c30da58a111d47facaf6b8c7bcb2bd51a5ac434a0259dd699e5ba5f03088dff","observation_id":"06a9e879-b5b4-4a56-b5ee-1a82b12ed39b","resolution":{"observed_at":"2026-08-06T20:47:32.192373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.177828Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2021","venue":null,"work_id":"a1ce807f-0514-4ceb-b944-8af7e0c569a7","year":2021},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.452725Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:3e0981686e37a1219cffd56792f3a24ea8387ca709f7c2eaf45984920f43c00c","observation_id":"722dc628-b96a-42c5-82ef-02ce5b32cc0e","resolution":{"observed_at":"2026-08-06T20:47:32.181339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:47:30.603921Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.603921Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:9a63eaaf696d35b4ea243b797b5945c17530d066360f70ccf818805f30cff828","observation_id":"66980da7-aeb2-4399-ba2f-9c20f51c687d","resolution":{"observed_at":"2026-08-06T20:47:30.603921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.166857Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"d3e58d66-4291-49bc-a585-45b94e53e432","year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.755771Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:083d7a0e872c33af9cc91e2cc8c8d8583978694d536a39b13acd7dc914a562ff","observation_id":"93ee9142-f32d-4fbb-834a-00c070996b00","resolution":{"observed_at":"2026-08-06T20:47:32.169931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-06T20:47:30.915731Z","title":"Spatial-r1: Enhancing mllms in video spatial reasoning.arXiv preprint arXiv:2504.01805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.915731Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:4955a5e520887ba19c2f5c5e79aca79aa159d6f6e8c8b46b5f810f0182b49c45","observation_id":"434bef0a-bcf3-4392-ae1b-d79ef4c3c70b","resolution":{"observed_at":"2026-08-06T20:47:30.915731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:30.976655Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.976655Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d35ceb2ac6b1b4a76e00265e7c110487825ba776d0171fa766cf2a58997437cd","observation_id":"98422b66-815e-4ab5-a764-b357fc839249","resolution":{"observed_at":"2026-08-06T20:47:30.976655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.149451Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.arXiv, 2025","venue":null,"work_id":"37f91d0c-4c9e-4177-8c48-660b30e4d1c6","year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.980578Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:7e62c7669571cc558ec4449a15b104555271624e7bbe5cd591bce6b95f37dabe","observation_id":"63d5768d-ce84-43c8-a18b-371b80610a31","resolution":{"observed_at":"2026-08-06T20:47:32.152636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.139602Z","title":"Cuda memory management, 2023","venue":null,"work_id":"83bd49a1-489d-449d-a150-54de536562ca","year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.984067Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:550f8dc960cc882cab56d8195ac25b03f739a9c7bfb31d5716388e1b2fa9dcc2","observation_id":"3fc90b62-ee1e-4288-a698-b003809ff63d","resolution":{"observed_at":"2026-08-06T20:47:32.142246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.129146Z","title":"Qwen2.5-vl: Multimodal llms from alibaba, 2025","venue":null,"work_id":"7fa4bf97-580a-47d2-8dfb-1f7c1517ab0a","year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.987819Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:c4f9820f1db6a4639c0e1d99712aba96a07cb2600e1811c81d47ddece200c21c","observation_id":"63904301-a55f-459e-978d-2f56f8d39dae","resolution":{"observed_at":"2026-08-06T20:47:32.132077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.119264Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"605fac6a-913d-43c0-9004-d7af7ad7656e","year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.991348Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:18a617268d276ce16157d082639c9c1741f6ff75c87d8ce3e989f982ff7ca85f","observation_id":"9a1d25a4-97f9-4bb7-89d2-fb32017536ff","resolution":{"observed_at":"2026-08-06T20:47:32.122618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.108661Z","title":"Sam 2: Segment anything in images and videos.ICLR, 2025","venue":null,"work_id":"fa7c42ca-bea8-4d8a-b055-28d200ce9aad","year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.995693Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d58b7e46b983e5b42186c5203f19e0fea6bb602f04a4a8438d2144c9b08583d0","observation_id":"efccb56a-0994-459d-8329-e462582d17b7","resolution":{"observed_at":"2026-08-06T20:47:32.111805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:30.998852Z","title":"Sat: Spatial aptitude training for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:30.998852Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:3ec8bc6f1ee67dd98c8506825b7e7619f0eed9cfe537cf433102e6adb4df5465","observation_id":"7d82e8a4-157c-4daa-95df-f7e611df51ae","resolution":{"observed_at":"2026-08-06T20:47:30.998852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.002436Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.002436Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:fec078eed000b8edaae54a2885e44f4acaa53e51a47581b3a79e3a9fe6d2a26a","observation_id":"a0a5c116-98b8-404e-95fa-a049e3bef303","resolution":{"observed_at":"2026-08-06T20:47:31.002436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.092411Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"760d2d08-6cc3-46e3-ae0c-93047de32fa6","year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.005433Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:dd9a0c281fadbae22d92e04a6eb2c824d1178994ecd691ea18b6dd350f353ca0","observation_id":"1c2c044b-5aef-42ff-879d-e3859db2d95b","resolution":{"observed_at":"2026-08-06T20:47:32.095280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.008891Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.008891Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:ec246a7bc10bc913b8eed9b4819535b3300d09bed3287fa09720f206e9c1ca40","observation_id":"47522736-b458-4690-b46a-4353ca7b761f","resolution":{"observed_at":"2026-08-06T20:47:31.008891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.013713Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.013713Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:5e90de44a8d772ba71d7b6d191bb2d363a3dd1fa82a33af9769ae0b244abec2e","observation_id":"fd1a35aa-1e42-47d4-aab2-bd4d01433f9c","resolution":{"observed_at":"2026-08-06T20:47:31.013713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T20:47:31.016748Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.016748Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:1aa2f6ae44334ec4c43c49d705cfb9f026ff49b37d12fa338b852016fbaadd26","observation_id":"9dcd3b63-22cc-4889-9413-54d1c3612abb","resolution":{"observed_at":"2026-08-06T20:47:31.016748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.020517Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.020517Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:da31453f9739c2835ca23c54b4c13760fadb2c50bea77306c369e9bcc9141d1d","observation_id":"75e5e9dd-0aca-4622-bf7b-ed12be3f80a2","resolution":{"observed_at":"2026-08-06T20:47:31.020517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06039","last_updated":"2021-04-13T09:14:28Z","snapshot_observed_at":"2026-08-13T19:40:45.025075Z","submitted_at":"2021-04-13T09:14:28Z","title":"MultiModalQA: Complex Question Answering over Text, Tables and Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06039","snapshot_observed_at":"2026-08-06T20:47:31.024566Z","title":"Multimodalqa: Complex question answering over text, tables and images.arXiv preprint arXiv:2104.06039, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.024566Z"},"links":{"cited_paper":"/paper/2104.06039","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:716c35ed66d734b5e45e2dee726726302221be2c1d3913c70c4e52f89f83b90b","observation_id":"8e506e8c-a861-404e-a997-9e38d5b02cf5","resolution":{"observed_at":"2026-08-06T20:47:31.024566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03673","last_updated":"2025-06-05T23:45:32Z","snapshot_observed_at":"2026-08-13T06:52:24.034921Z","submitted_at":"2025-05-06T16:11:49Z","title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03673","snapshot_observed_at":"2026-08-06T20:47:31.028205Z","title":"Roboos: A hierarchical embodied framework for cross-embodiment and multi-agent collaboration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.028205Z"},"links":{"cited_paper":"/paper/2505.03673","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:e0efc94b582b3cd28019b7a0538c7f21de346eece94ec2b8c2575e99c81e4ee6","observation_id":"dc5661de-b82b-4453-97b1-4facdefd8cd9","resolution":{"observed_at":"2026-08-06T20:47:31.028205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.031498Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.031498Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6f05abfa852db8a837b7a22aef70036cb1fe734e502d4f91b9d3b1852aac0a58","observation_id":"94ff3ac6-ef97-4b1c-af79-3ed3e0d694df","resolution":{"observed_at":"2026-08-06T20:47:31.031498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.034168Z","title":"Video understanding with large language models: A survey.IEEE Transactions on Circuits and Systems for Video Technology, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.034168Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:eb28f3022a64ec292a793722cf5debe62563f1bb92d8da9c5a77271936e7db50","observation_id":"1ecd60d6-94d8-4d48-b674-fe45f3c604b2","resolution":{"observed_at":"2026-08-06T20:47:31.034168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-06T20:47:31.038680Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.038680Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:47cf2d100fe056ecedf956f84018f6b8a086308e666968b63f92d0284d58959f","observation_id":"be8963c2-8f60-44b4-96df-23fb6d9a322e","resolution":{"observed_at":"2026-08-06T20:47:31.038680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T20:47:31.043230Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.043230Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:cb1bb57068811f92429389497257c47da6dd0bdec8a1eb925f93be96e4fa21b7","observation_id":"cac9d90b-871c-408d-b7af-81af1a63183d","resolution":{"observed_at":"2026-08-06T20:47:31.043230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.047827Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.047827Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a5040c1d8184cd5caaff89130d61e881ddd94017f4417cc9eb732ff99092a449","observation_id":"7f133fbf-58a4-4744-bb1d-709678cb675d","resolution":{"observed_at":"2026-08-06T20:47:31.047827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.052452Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.052452Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6b701fe25c4e29f62822f98d1bffd6b4499b6463d993c0e70d7db0810633fa41","observation_id":"d475f2c7-393b-4a55-a68f-386d731bd9ff","resolution":{"observed_at":"2026-08-06T20:47:31.052452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.050828Z","title":"verl: Volcano engine reinforcement learning for llms, 2024","venue":null,"work_id":"731716c2-d7ac-4fc3-b9d0-9a4f6842b9b8","year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.060947Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:c6900cb09f8d91765a14aa51d3e0e5f6d37204ef755d2623235d2583af70c199","observation_id":"50253336-2da7-445b-9c93-ff970d64e1fb","resolution":{"observed_at":"2026-08-06T20:47:32.054021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.041103Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"1d674ac6-b10e-4e88-85ea-370a475ccab0","year":2019},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.068156Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:99bd8e0bd612c3149b1d2be643c3d024fb9bd9f710b5ebd6dfefb413585670d0","observation_id":"913dd2e6-7038-44db-8f2c-675451c9a2b9","resolution":{"observed_at":"2026-08-06T20:47:32.044195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08886","last_updated":"2019-04-06T20:35:54Z","snapshot_observed_at":"2026-08-14T17:55:27.979118Z","submitted_at":"2018-11-21T18:58:14Z","title":"HAQ: Hardware-Aware Automated Quantization with Mixed Precision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08886","snapshot_observed_at":"2026-08-06T20:47:31.071952Z","title":"Haq: Hardware-aware automated quantization with mixed precision, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.071952Z"},"links":{"cited_paper":"/paper/1811.08886","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:91a3617c307e7a73767ba22cdf9c81d1b040df2c27e1f4d18da3307bc3aca3a8","observation_id":"355ff154-54f6-468d-9d2a-cf1a9b7c12af","resolution":{"observed_at":"2026-08-06T20:47:31.071952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04890","last_updated":"2025-02-13T10:09:37Z","snapshot_observed_at":"2026-08-12T22:05:30.395662Z","submitted_at":"2024-11-07T17:28:10Z","title":"GUI Agents with Foundation Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04890","snapshot_observed_at":"2026-08-06T20:47:31.078436Z","title":"Gui agents with foundation models: A comprehensive survey.arXiv preprint arXiv:2411.04890, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.078436Z"},"links":{"cited_paper":"/paper/2411.04890","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:1e9526bc662b5ac2a08d2253e8964df617a83d9b88c99d3ddb0a7215f1265659","observation_id":"fb068da7-b4c8-4806-8f81-2d16971dd52a","resolution":{"observed_at":"2026-08-06T20:47:31.078436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.082918Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.082918Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:dd266d70f87155cc557dafbd363b4f26c626d4fc6b420dc5e2abea504abbdeb1","observation_id":"9b6cb17f-e9e5-48a1-9047-bc052a47239d","resolution":{"observed_at":"2026-08-06T20:47:31.082918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T20:47:31.085978Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.085978Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a358bd0c7d3a2b7c27c3120af1a3db16dccd2f0164abea48073ae52cc9efe0bf","observation_id":"2b6ac7c0-0881-4f2b-babd-4425db39a016","resolution":{"observed_at":"2026-08-06T20:47:31.085978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.092418Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.092418Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:d2ef2d01dc0d4a56223a4c12ee5332d58fec9bc4c039e19bd36032a58f7e26a2","observation_id":"58be3216-1d8d-45c0-ab0e-5d2d615eeecf","resolution":{"observed_at":"2026-08-06T20:47:31.092418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.100133Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.100133Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6626ffc1d1754117306849e13c0f09c7caf5d76637fe39bab311927763af03bb","observation_id":"bfbd99d3-e43e-460a-b0bb-7c491d0731b7","resolution":{"observed_at":"2026-08-06T20:47:31.100133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.011040Z","title":"Modeling context in referring expressions","venue":null,"work_id":"f785b085-ed14-4fef-9484-e6e386d65a31","year":2016},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.103154Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:e100a088c2d0720cd4d187ab1e0b34c2785ae69deff7ff3aaf85ae3e971f275e","observation_id":"8d4193a7-446a-441a-9e79-8037f04ca699","resolution":{"observed_at":"2026-08-06T20:47:32.013979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:32.001800Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":"2639b4a0-46df-4552-b0a3-ff6e41aa0714","year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.106194Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:c02ffa2a2f3a7dd4500273941456445e919d71bfecde911e069cf85217d36bdf","observation_id":"467bcb34-25e3-48b1-a861-3e2ead12dff4","resolution":{"observed_at":"2026-08-06T20:47:32.005019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-07T16:32:15.166320Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-06T20:47:31.113444Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks.arXiv preprint arXiv:2503.21696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.113444Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:61ef56ca61b313d2c059e577eedcbc0f43f1547c903560f80572bf25e12d7c03","observation_id":"77eb9349-8346-4a05-9614-cfb18c4f8996","resolution":{"observed_at":"2026-08-06T20:47:31.113444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.992958Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"4aa6763b-ce1f-4bec-b7cf-98a2c277427d","year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.116414Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:3ecd5568a496cb2b65d7363bda195f98ae6850ffde15330392b0470881cb5c71","observation_id":"9cbe1e21-b169-43ae-a279-94f17ba1a9e2","resolution":{"observed_at":"2026-08-06T20:47:31.995896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04455","last_updated":"2025-03-21T14:54:29Z","snapshot_observed_at":"2026-08-14T06:27:00.768554Z","submitted_at":"2024-12-05T18:58:27Z","title":"Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04455","snapshot_observed_at":"2026-08-06T20:47:31.119288Z","title":"Code-as-monitor: Constraint-aware visual programming for reactive and proactive robotic failure detection.arXiv preprint arXiv:2412.04455, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.119288Z"},"links":{"cited_paper":"/paper/2412.04455","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:8a0ae36bfd23515248e095f1da271ae5ddc364b3d0382ca78a9b3a92521c371a","observation_id":"1c3f9caa-788f-4c8b-aae9-61c6d5482610","resolution":{"observed_at":"2026-08-06T20:47:31.119288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.124480Z","title":"Roborefer: Towards spatial referring with reasoning in vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.124480Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:fc5a1a1f30483c2047a0ac7e421a0ce52bee2130aea27c8e256f8c9830aa59ea","observation_id":"4c8f8020-3653-4925-9c84-bdfc2bee5e80","resolution":{"observed_at":"2026-08-06T20:47:31.124480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.982915Z","title":"Large language model (llm) for telecommunications: A comprehensive survey on principles, key techniques, and opportunities","venue":null,"work_id":"b39ca367-1975-40bc-b286-45191b49377b","year":2024},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.127650Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:1c05f5a71743047c6b55beb7c1ab5a61ab207b7aaf4096c7aba4f767b9bd6183","observation_id":"9ce09e21-fdc9-4c29-839f-f1f87cea34fd","resolution":{"observed_at":"2026-08-06T20:47:31.986318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:47:31.131012Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.131012Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:4037a6db0e0ba9b63dc9aaad86d52b2fd8a32cf381c75dd0d78891ad581bcc2a","observation_id":"152ebfed-9f71-45d7-862a-04f50438a944","resolution":{"observed_at":"2026-08-06T20:47:31.131012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.973759Z","title":"Please point out the orange box,","venue":null,"work_id":"0b4c9506-54f8-494f-a19a-1333d7f9fd73","year":2023},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.133782Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:8c9947fa8b6e838ed950f918c1d6402daab0d04c4ff1ce25fecb03ea031514c9","observation_id":"baa29bac-ba56-488b-9d9a-b09757409be3","resolution":{"observed_at":"2026-08-06T20:47:31.976540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.963792Z","title":null,"venue":null,"work_id":"1de6a63e-903c-452c-a0d9-6afb5437de3a","year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.138713Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a89c5f6534c5fb35f80a490caaa2538ee90a8a7499425d51b31285190215b957","observation_id":"e041b661-cad0-4a2b-a86a-5917f5656bc7","resolution":{"observed_at":"2026-08-06T20:47:31.966825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.953546Z","title":"Never use variable names as the action arguments, use the value instead","venue":null,"work_id":"71227109-229a-442a-8918-a0f897689b6b","year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.142243Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:01cb36cb7e7406d9362b7e3b960a2061c31946a18e570c50b32b9d94c21debf5","observation_id":"f38b44b1-b4f7-48c1-b0cc-271732b62447","resolution":{"observed_at":"2026-08-06T20:47:31.956781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.943603Z","title":"If no tool call is needed, use final_answer tool to return your answer","venue":null,"work_id":"841e665a-f8ab-4567-80a8-ca8cbf1ad5d6","year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.145508Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:5b033d396318e32c55fe7b4d1c6fd4d85f70c6c4156e2d510f541b74ffa59e8d","observation_id":"6b57e33b-0328-4d46-861d-ece54d711147","resolution":{"observed_at":"2026-08-06T20:47:31.946710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:31.932850Z","title":"# Now Begin! If you solve the task correctly, you will receive a reward of $1,000,000","venue":null,"work_id":"3c295802-a262-4b12-b24a-1648d470275c","year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.149194Z"},"links":{"citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:f36f9cd3038e8d3f746d1cbffda65341e0585d20b63dd2e6aa3dc9b6242723d2","observation_id":"bfa14531-053c-4059-b7db-43deb12b9c8f","resolution":{"observed_at":"2026-08-06T20:47:31.936002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-12T23:41:59.753397Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T20:47:31.110057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.110057Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:64d939d450f3e599cda6a6921e460959c1b2c67ef3d18fe2d59433bbcab7b8ff","observation_id":"3fd2d4a8-16fb-4e9f-8587-06bfe8fdcf83","resolution":{"observed_at":"2026-08-06T20:47:31.110057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","latest_version":5,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 54 inbound Pith citation observations for arXiv:2507.02029."}