{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7141ffb2f19c2fd274ce78a9c59cd6ef3a113a033ca9201dece7c214eee71b97","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:09.155546Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19498/citation-record","integrity":"/paper/2506.19498/integrity","json":"/paper/2506.19498/citation-record.json","paper":"/paper/2506.19498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:03.006778Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.006778Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:0d2a82265eb62750fb91663b5f90f0de21910c645280ebb62c7c5f19f0407364","observation_id":"f7dcb54d-4c62-4aef-8593-774b4343b1d4","resolution":{"observed_at":"2026-08-06T23:12:03.006778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-06T23:12:03.047648Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.047648Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e9604b3aa44a26e53a3e4d38549a4d25afb07324876a0ec18caedebcfad8fde6","observation_id":"21aac602-01f4-46c6-9983-57593bd09a5e","resolution":{"observed_at":"2026-08-06T23:12:03.047648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.743095Z","title":"Copa: General robotic manipulation through spatial constraints of parts with foundation models","venue":null,"work_id":"180f6df9-f3b9-400b-9f3a-1bdddd7f58c8","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.087048Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4c1b5bf01bfb904eb795e06902e602b67187030614c001488b68e41a095a2383","observation_id":"a8fc755f-0a12-4267-98cd-080e70e43da0","resolution":{"observed_at":"2026-08-06T23:12:12.746596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03841","last_updated":"2025-01-07T14:50:33Z","snapshot_observed_at":"2026-08-02T20:46:34.046586Z","submitted_at":"2025-01-07T14:50:33Z","title":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03841","snapshot_observed_at":"2026-08-06T23:12:03.142366Z","title":"Omni- manip: Towards general robotic manipulation via object-centric interaction primitives as spatial constraints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.142366Z"},"links":{"cited_paper":"/paper/2501.03841","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ea6a61ba0984db207f65ba5c09ef0249225b67ffe55ab381acc545bfc18b972d","observation_id":"76538e9f-30b3-4326-9c65-c30a45354c5b","resolution":{"observed_at":"2026-08-06T23:12:03.142366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-07-06T20:22:09.358394Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09783","snapshot_observed_at":"2026-08-06T23:12:03.239306Z","title":"Geomanip: Geometric constraints as general interfaces for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.239306Z"},"links":{"cited_paper":"/paper/2501.09783","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:84e8d5c1ff4b38cfad2f392bd9d726391e84882bcedd57323ea28e7fc4459bc2","observation_id":"3cf9391e-3c58-41cf-aaeb-7e7b2b496281","resolution":{"observed_at":"2026-08-06T23:12:03.239306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-06T23:12:03.288372Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.288372Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:920b2c06928708a7ea5e4892918381f68d7b43cdf4a50b5e19320f8a6b72270c","observation_id":"b8cd82c8-14e0-4c5a-9b39-57dd03ce7e62","resolution":{"observed_at":"2026-08-06T23:12:03.288372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-06T03:27:47.616528Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-06T23:12:03.390138Z","title":"Guiding long-horizon task and motion planning with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.390138Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e349f4bf474dbcaf2065c3ac1b6b6c8742de396840f538bd7dce37a5e34b1fbc","observation_id":"976c396b-5b79-49c7-92ee-e309c1a1840f","resolution":{"observed_at":"2026-08-06T23:12:03.390138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.448540Z","title":"Open-world task and mo- tion planning via vision-language model inferred constraints","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.448540Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d4cdfded48b0badff1fa519656915b6f5939a89166a4d0a9a46ea3d56f631ad7","observation_id":"2760d490-e208-4e5d-ab2d-3edd5e53b8ba","resolution":{"observed_at":"2026-08-06T23:12:03.448540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.567384Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.567384Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c539cbf2097bb32e658a7af020fb394c353be265bdbbc0e01dd45ead2407cfa1","observation_id":"11c21ccd-35e1-438d-bb10-5eca6d4f2576","resolution":{"observed_at":"2026-08-06T23:12:03.567384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.613132Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.613132Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:13003bd0c800b35cdc2eb7420952ea2d4859752569be20dabd3850ba6fde2c36","observation_id":"dfc156ef-59c4-42dc-bcb1-abd204d73f86","resolution":{"observed_at":"2026-08-06T23:12:03.613132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.665705Z","title":"Sofar: Language-grounded orientation bridges spatial reasoning and object manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.665705Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:1dee512062f76d360f3fda4d638d0b017faa29f10e2f60a943c3387bac3bae38","observation_id":"729f7f9d-31dd-4201-8883-8523075fde40","resolution":{"observed_at":"2026-08-06T23:12:03.665705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09829","last_updated":"2024-07-13T09:42:02Z","snapshot_observed_at":"2026-08-07T23:48:45.716361Z","submitted_at":"2024-07-13T09:42:02Z","title":"VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09829","snapshot_observed_at":"2026-08-06T23:12:03.746754Z","title":"Vlmpc: Vision-language model predictive control for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.746754Z"},"links":{"cited_paper":"/paper/2407.09829","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e59bfce0f9b7fc483fdf863995e227d929af919bb2eda0d07c9bd1897039f6c2","observation_id":"853f45df-a4e2-43cf-b81b-ee8f622a8357","resolution":{"observed_at":"2026-08-06T23:12:03.746754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10546","last_updated":"2025-03-13T16:59:17Z","snapshot_observed_at":"2026-08-07T17:06:27.434649Z","submitted_at":"2025-03-13T16:59:17Z","title":"KUDA: Keypoints to Unify Dynamics Learning and Visual Prompting for Open-Vocabulary Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10546","snapshot_observed_at":"2026-08-06T23:12:03.801070Z","title":"Kuda: Keypoints to unify dynamics learning and visual prompting for open-vocabulary robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.801070Z"},"links":{"cited_paper":"/paper/2503.10546","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:aeeab22f9923f6145ae1e244da03f348540d385f1160dbf75c76a699fa03c670","observation_id":"a4dba97b-2dcf-4f91-b96b-a501ea8e86d5","resolution":{"observed_at":"2026-08-06T23:12:03.801070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-06T23:12:03.885154Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.885154Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a1f805c3dde24ad55b7ce4629480a37feafaa5af39fa9b68595c4839c7695ad7","observation_id":"580133e2-e101-42c7-85c3-fa14c6b5f52e","resolution":{"observed_at":"2026-08-06T23:12:03.885154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-06T23:12:03.958565Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.958565Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:603b893616c9468251ee213071c48a06383e958d8e4777d5b7c3037adcc15450","observation_id":"995d07c8-f01e-4779-be89-6c9c304d5a5a","resolution":{"observed_at":"2026-08-06T23:12:03.958565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-07T23:55:16.485449Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08643","snapshot_observed_at":"2026-08-06T23:12:03.998541Z","title":"A real-to-sim-to-real approach to robotic manipulation with vlm-generated iterative keypoint rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.998541Z"},"links":{"cited_paper":"/paper/2502.08643","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7f2a1d574376219967bb7c3ad00876fcce24d8fc5011392dea1c8f3034393ba7","observation_id":"b1375379-f124-451c-aa10-bf2537dc0f4e","resolution":{"observed_at":"2026-08-06T23:12:03.998541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.726889Z","title":"Learning to interpret natural language commands through human-robot dialog","venue":null,"work_id":"bd90f7f2-a94e-4146-8fd3-7210ecde59f7","year":1923},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.066584Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:b201ec9f89eff1f9285919448a8ec695381e44147c33a63480219536b43ebb7d","observation_id":"9dafe183-77f9-43a7-b1fb-f0083b08dbf6","resolution":{"observed_at":"2026-08-06T23:12:12.730699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.715658Z","title":"Grounding verbs of motion in natural language commands to robots","venue":null,"work_id":"119d1b54-7749-4c6c-bcdc-9cb9c3c24e24","year":2014},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.142753Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:133bb04cc7b11bb43e8a04aa92d09e1108f873906349ed24cd50b3039a5684af","observation_id":"aab21090-a360-4a35-9eac-4579e90a30e1","resolution":{"observed_at":"2026-08-06T23:12:12.719822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.706331Z","title":"Toward understanding natural language directions","venue":null,"work_id":"40b6ef36-27d5-4459-9676-d06366f5208d","year":2010},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.190234Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:b61f2240d78d50fa76662a11f78571b70b9e9b495647b33f92320f2740ab2290","observation_id":"386300ee-6e29-40fe-9074-074470b7b85f","resolution":{"observed_at":"2026-08-06T23:12:12.709353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.696214Z","title":"Understanding natural language commands for robotic navigation and mobile manipulation","venue":null,"work_id":"1cd98053-a336-4b9a-8862-c5d1daa1543b","year":2011},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.271113Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:2699b8658ed4b6903a50b44b705bfee7e0db575897981f1e2dc277d23cc6b187","observation_id":"c3121184-f8a4-4d0c-b472-90cd1def4285","resolution":{"observed_at":"2026-08-06T23:12:12.699711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-06T23:12:04.326924Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.326924Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f689fdabbfd3747ad3eaa7bad46acf7286a98bca5a3d47494a57ba66f9120ee5","observation_id":"ef9b0120-ba87-41fe-8042-ff94900e6787","resolution":{"observed_at":"2026-08-06T23:12:04.326924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T23:12:04.421149Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.421149Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c92f60fafab54c6fa87f796f0d4f351d073d244bacefd1784254493333ab4d05","observation_id":"0f291216-b1a5-457e-a4a0-125447ba092c","resolution":{"observed_at":"2026-08-06T23:12:04.421149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T23:12:04.499840Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.499840Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:24be03588a07245095a8d9e0b41545732d5d3d4778c5aae45f8641bc8aebdc5e","observation_id":"eba4b8fc-77ba-492f-91d1-011bb97464b5","resolution":{"observed_at":"2026-08-06T23:12:04.499840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T23:12:04.566817Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.566817Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:bfc16f863d4b6e8f5f7e401071a5dfbcbcc6471f48ea824e449edff8ba0a1a70","observation_id":"863da663-d828-452c-a62a-6c80cc8bc02e","resolution":{"observed_at":"2026-08-06T23:12:04.566817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T23:12:04.641939Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.641939Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:95d328559d9c0072ec3d7686f630cbdf3bbbfc7a520bdb03b3e669db3feff1f6","observation_id":"683d88e5-4fa9-4883-b4cf-83956b5d0b60","resolution":{"observed_at":"2026-08-06T23:12:04.641939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-07T20:30:49.785912Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-06T23:12:04.680233Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.680233Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:542498de31641f1ba817244ae8a3a09958c12f6f5943617b0082fd75c4f33512","observation_id":"59868033-286d-4dd9-8f01-30a6cca9c25a","resolution":{"observed_at":"2026-08-06T23:12:04.680233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02292","last_updated":"2024-02-07T23:58:10Z","snapshot_observed_at":"2026-08-03T19:36:04.243051Z","submitted_at":"2024-02-07T23:58:10Z","title":"ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02292","snapshot_observed_at":"2026-08-06T23:12:04.770431Z","title":"Aloha 2: An enhanced low-cost hardware for bimanual teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.770431Z"},"links":{"cited_paper":"/paper/2405.02292","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:36940f2d719561a932380885d8beb7ab0802f19895c1b03797765cc99ba319b9","observation_id":"4fccaf42-5f7c-4145-b561-acea518e2579","resolution":{"observed_at":"2026-08-06T23:12:04.770431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-06T23:12:04.843906Z","title":"Mobile aloha: Learning bimanual mobile manipu- lation with low-cost whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.843906Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7fb53672b53e2b049bde9ea87f840a130b535fdb0a971da38193828f153447c7","observation_id":"173e3d0b-562e-4c94-860b-56bd7c878c87","resolution":{"observed_at":"2026-08-06T23:12:04.843906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-06T23:12:04.884890Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.884890Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:2e330dcc7b1e96c2fefd78cca64ed1d7bbdc2afe154220ab3411bc3e27921c86","observation_id":"bac650b5-f260-44c4-a0b8-30472031daa4","resolution":{"observed_at":"2026-08-06T23:12:04.884890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-06T23:12:04.988783Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.988783Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d4a6b1c6dca508dca25cfc4a09558d98a59c103450428da671f3a3d26d013bf1","observation_id":"1bb37cf4-a892-44fe-9a4d-6c3904cccbdd","resolution":{"observed_at":"2026-08-06T23:12:04.988783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T23:12:05.061262Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.061262Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c946bd2b1d11adce759114f38249a27c54c4c7da8ebc0ffe46f51334bfa8700d","observation_id":"e9f30bba-37a7-4640-9ca3-92b965550e7e","resolution":{"observed_at":"2026-08-06T23:12:05.061262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T23:12:05.111915Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.111915Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e08bf21f60043a1b2cba3c93b976e7ec686293abe27654637c81b48df607bcb4","observation_id":"74e98e85-7c9f-4150-862e-1c6478143aa8","resolution":{"observed_at":"2026-08-06T23:12:05.111915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19510","last_updated":"2025-03-25T10:01:57Z","snapshot_observed_at":"2026-08-07T16:38:50.733709Z","submitted_at":"2025-03-25T10:01:57Z","title":"RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19510","snapshot_observed_at":"2026-08-06T23:12:05.207574Z","title":"Roboflamingo-plus: Fusion of depth and rgb perception with vision-language models for enhanced robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.207574Z"},"links":{"cited_paper":"/paper/2503.19510","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:fae903bc1d30005f2ba2b44fe2bc676bdb557aa75682169c1a43343970e493bb","observation_id":"6d3f8af4-8d51-4a1a-a2ee-f9d3d15fa295","resolution":{"observed_at":"2026-08-06T23:12:05.207574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-06T23:12:05.276267Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.276267Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:2324b2798762373a82c7a0698ab7c53b178c65510bbe73968061c655592bf80e","observation_id":"0019b4a4-5b4e-4be1-a351-23cdb4da1fd4","resolution":{"observed_at":"2026-08-06T23:12:05.276267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-06T23:12:05.316266Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.316266Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:64e4bb9e7f8f4fee7e7b2a9a995119588866039e8de4f66f0a4fbb3a353580a7","observation_id":"431fd637-b19d-4a66-8bf9-2668e5200083","resolution":{"observed_at":"2026-08-06T23:12:05.316266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-06T23:12:05.418519Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.418519Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:15e6e4ef2ebae41ad7495685ee4ea1b84af87af13a0776010038181de1033c69","observation_id":"42b8a48b-fb42-4115-9dd3-18e67ce0d8f7","resolution":{"observed_at":"2026-08-06T23:12:05.418519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T23:12:05.478000Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.478000Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5910bba2d888e32e39355e33b1d00ae986da83b3b9e0117c5a13ac14dd173323","observation_id":"5a081d2e-86fc-45f3-801d-ec30236c942d","resolution":{"observed_at":"2026-08-06T23:12:05.478000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T23:12:05.527284Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.527284Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d804f041a32605197cc9a16f583e4d1431432dacdc5be806a4a6913231f78c60","observation_id":"5053b701-0997-4d04-bd89-610c97133537","resolution":{"observed_at":"2026-08-06T23:12:05.527284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-06T23:12:05.638223Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.638223Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e7506fbf884a165b5001f825aadf40662f33ea6acd6e98a5d4b89ba319665888","observation_id":"792276d5-a035-444e-b92e-4bacef746649","resolution":{"observed_at":"2026-08-06T23:12:05.638223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T23:12:05.690842Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.690842Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e251b1fdbe0771affded6b7be5c49eea3fed078f255b8980d2baf8069b997fbe","observation_id":"9e993ad7-d19a-4958-a9e1-6f1068b6278c","resolution":{"observed_at":"2026-08-06T23:12:05.690842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-06T23:12:05.781091Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.781091Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:425f1139e43015a4ac8ccefd755dc86dd10b7700cda277f1e3e487df2fc9db77","observation_id":"5ebc3e1a-ec6a-40e4-8276-dbf108045ac7","resolution":{"observed_at":"2026-08-06T23:12:05.781091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-01T15:58:01.346044Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-06T23:12:05.850037Z","title":"Llm+ p: Empowering large language models with optimal planning proficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.850037Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4792a7946a0d4eb62c00d9d8815de9a8ddc3e188c0d2f4a0203e7c282c164942","observation_id":"c8e34603-f4c2-4037-8cca-a920b2473925","resolution":{"observed_at":"2026-08-06T23:12:05.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:05.893446Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.893446Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:dbb0f3d86cf0aae109df9f77aade5b55b2d95da84af727442ce057e3310283d4","observation_id":"948a6dba-6d7e-4e96-a0c6-8a10ee1607c8","resolution":{"observed_at":"2026-08-06T23:12:05.893446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:05.953173Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.953173Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:fb4b7f1c4022f6a06b4bab6630a50b92a284099c16b7563efd2bbdc3188680aa","observation_id":"e3447b32-c4e8-4a2d-b955-4ed8aa480917","resolution":{"observed_at":"2026-08-06T23:12:05.953173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.674128Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"1343ff3b-b4fa-4a1c-9ed6-8b40feb34c29","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.080619Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:3eb33d0f8599ea3aa3590ee877abb665f98e1f940268021e823a6e9b96d6f820","observation_id":"e5024913-6ebf-4446-a471-4ceca1687d6b","resolution":{"observed_at":"2026-08-06T23:12:12.677317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.663503Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"2a323430-08e1-4367-a030-abafcb8696e8","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.222417Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c5c1c2188454885f57ff5ea5832493ebdcbc2a3626a8a41373445d4efadfeaf4","observation_id":"782b5a8f-d56f-4d43-85d6-09706f9e0715","resolution":{"observed_at":"2026-08-06T23:12:12.667052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-07-06T17:01:35.415575Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-06T23:12:06.341930Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.341930Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:670ec213f5ee7f382028299046b78607b65844482a87bd48ec10223a051637e7","observation_id":"549d0afc-d638-467f-9554-76eafc693ad5","resolution":{"observed_at":"2026-08-06T23:12:06.341930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.449159Z","title":"Foundation models defining a new era in vision: a survey and outlook","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.449159Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:08e38ba514ee2f21784dc46b8c32e7ba628b86cb2dd6b4c7d00e504139bb6c9b","observation_id":"33ee52c1-a2c9-4f89-9348-2d41e098b838","resolution":{"observed_at":"2026-08-06T23:12:06.449159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.499716Z","title":"Yolov10: Real-time end-to-end object detection","venue":null,"work_id":"36a27194-a980-4630-a475-d33e8a871e87","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.591235Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:12301047f3ef23206ca765651a7f8940cb417122eb8bb2778091691bf42d8808","observation_id":"4f3a9ea5-f4d4-4d98-b2e7-3ce1934b8957","resolution":{"observed_at":"2026-08-06T23:12:12.513413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12524","last_updated":"2025-02-18T04:20:14Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T04:20:14Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12524","snapshot_observed_at":"2026-08-06T23:12:06.730254Z","title":"Yolov12: Attention-centric real-time object detectors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.730254Z"},"links":{"cited_paper":"/paper/2502.12524","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:07c0eb2d34a07b1e55a944e099aed29d4f8fc46c0e286a832dd1cfd4fffc2209","observation_id":"762187bf-5d7a-4126-8efa-83b428afc9f3","resolution":{"observed_at":"2026-08-06T23:12:06.730254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.841797Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.841797Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:6bd0579a6118091fabc54aa10c55b5248ceb03706ccbc5ab8493ea9e4fb7f032","observation_id":"10cdafa9-2d9b-4743-913f-e11df4e5d3cf","resolution":{"observed_at":"2026-08-06T23:12:06.841797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.986608Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.986608Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d81f00c4080f4a36d6931276ed0d64736574d78d59269d79a8a99263be0c625f","observation_id":"06330ba7-25e0-43ef-9875-729e32e584f9","resolution":{"observed_at":"2026-08-06T23:12:06.986608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:12:07.109157Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.109157Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a385655b41f6f58c7bdbf28b4326c97e649158a04a739bf92a4888b837bc8a77","observation_id":"cb635328-fa44-4d6b-81b1-06ef8efcb96f","resolution":{"observed_at":"2026-08-06T23:12:07.109157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T23:12:07.220820Z","title":"Fast segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.220820Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5108a5e59fad64cfebd99aae191977fd67433c952a36746e5b393d50f309e3c2","observation_id":"8b365f20-6304-4397-ab46-0b0f8a3e1c87","resolution":{"observed_at":"2026-08-06T23:12:07.220820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:07.344271Z","title":"Segment everything everywhere all at once","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.344271Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:b8104c68857af1bdb260591c71539c4f3eb78d51045cd901e3bb005a6fa37ed5","observation_id":"e99c5c4b-e05b-42e4-aebb-d10330b70b74","resolution":{"observed_at":"2026-08-06T23:12:07.344271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.278451Z","title":"kpam: Keypoint affordances for category-level robotic manipulation","venue":null,"work_id":"d77cfc4c-5a80-41d3-9fb4-0b1f690dda4b","year":2019},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.470139Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d70113805c6a0693b8ce5c7c122afa07c05c3d1df3497e2c26ee9b6defbcd281","observation_id":"96c81ed4-59b5-4a9c-a761-ad09e2dac5ba","resolution":{"observed_at":"2026-08-06T23:12:12.351801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-06T23:12:07.568520Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.568520Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a541335ce0d388cbf81dc643f9f2f116498d1d34e01039e5b4a0bf62bb7dc44c","observation_id":"c2077bc1-821e-4c72-8444-ed19d164cdc9","resolution":{"observed_at":"2026-08-06T23:12:07.568520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-06T23:12:07.661869Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.661869Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:2bfbfdf2f415e627c51011fe06de66121f0c45703cf1fa03bd05b5bb6499eb58","observation_id":"8da321ad-6616-4dbe-a41e-20a59c43a8cc","resolution":{"observed_at":"2026-08-06T23:12:07.661869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.983256Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"1f6764ed-019c-42ce-8f54-14ee173c3890","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.861016Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4396b25aaccfea275e147ee6ab06dacd44998a38b891beadeea2f1b90cd2240b","observation_id":"8b477562-60e4-4212-88fb-6c53e5443b26","resolution":{"observed_at":"2026-08-06T23:12:12.113415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.784352Z","title":"Sam-6d: Segment anything model meets zero-shot 6d object pose estimation","venue":null,"work_id":"7e6c404c-5597-49f6-baa8-4ab44c7c7ec2","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.911112Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:1d37bd07188ca50776fba81dd841c971312a26437974b4966894f7fd431644dc","observation_id":"ee1f49c4-f2d0-423e-a5db-1332efd13cba","resolution":{"observed_at":"2026-08-06T23:12:11.842969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.594903Z","title":"Omni6dpose: A benchmark and model for universal 6d object pose estimation and tracking","venue":null,"work_id":"ab93f4b3-e0d2-4d01-91cd-3173066e9f9e","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.937920Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:bdcf7f72bb410e7fc0f1b01c56db7d61ae25c8b3948f9de96bedad699f2f7604","observation_id":"a807a592-c2bf-4450-a059-72ad9a73c895","resolution":{"observed_at":"2026-08-06T23:12:11.687810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.379259Z","title":"Gen6d: Generalizable model-free 6-dof object pose estimation from rgb images","venue":null,"work_id":"cab78e7c-80fa-436d-bf68-71b1cd05d05d","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.021674Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a846c984e77f344f784572886a6a0a1e57ffe5c4fda33a3b463bf5fa76cb5812","observation_id":"b6cd504a-d784-4ee8-b767-f44c04bce151","resolution":{"observed_at":"2026-08-06T23:12:11.485692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.176419Z","title":"Onepose: One-shot object pose estimation without cad models","venue":null,"work_id":"7e6d0076-d5a7-443c-842b-191a40b84c3c","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.096588Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:af9f96acdfbb70591d5a500467e7def3d37d48a04b68b74d2a4c67c56ea2096e","observation_id":"b9fca9de-91cb-4823-9fcd-ca78b24839be","resolution":{"observed_at":"2026-08-06T23:12:11.329092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.060712Z","title":"Onepose++: Keypoint-free one-shot object pose estimation without cad models","venue":null,"work_id":"5175e5df-9e20-4f0d-b124-3ac74998eec2","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.158463Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:55bfaa8005bbe1ce66249f6ac00206ff7b6ad54047d3ce01b3e5c9ec0fbeea46","observation_id":"fa9de27d-3787-4f29-a4f2-df1ca297a8f3","resolution":{"observed_at":"2026-08-06T23:12:11.119342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10683","last_updated":"2024-08-14T13:43:28Z","snapshot_observed_at":"2026-08-03T07:38:44.301588Z","submitted_at":"2024-03-15T21:06:14Z","title":"GS-Pose: Generalizable Segmentation-based 6D Object Pose Estimation with 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":"2403.10683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.10683","snapshot_observed_at":"2026-08-06T23:12:09.421296Z","title":"GS-Pose: Generalizable Segmentation-based 6D Object Pose Estimation with 3D Gaussian Splatting","venue":"cs.CV","work_id":"cb7b7449-b590-42c7-b99a-28d98e8b7715","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.250575Z"},"links":{"cited_paper":"/paper/2403.10683","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:56677f328ec52296fc4840bd04d6ef8b8f59528cdb4e834022c0b6cefb816fea","observation_id":"4b407ffb-5d6c-4cca-973e-98c757567aaa","resolution":{"observed_at":"2026-08-06T23:12:09.497856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12716","last_updated":"2022-05-06T14:46:46Z","snapshot_observed_at":"2026-08-07T11:18:45.003229Z","submitted_at":"2022-01-30T03:59:14Z","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12716","snapshot_observed_at":"2026-08-06T23:12:08.280921Z","title":"You only demonstrate once: Category-level manipulation from single visual demonstration.arXiv preprint arXiv:2201.12716, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.280921Z"},"links":{"cited_paper":"/paper/2201.12716","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:0cb4e59e7e4f1a837dd4c6458ef16647c12ec4f8b51bde43980b8be56a4e4709","observation_id":"746ef3ae-d489-4e7a-ba7a-ef9107518ad2","resolution":{"observed_at":"2026-08-06T23:12:08.280921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-02T23:47:39.393363Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-06T23:12:08.358863Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.358863Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:dfdcd8d13fda24f4d32253c66911dc583b7a19210a501be39cf04452983efb22","observation_id":"f33928b8-72ce-43a3-a0f8-3f30a67c1475","resolution":{"observed_at":"2026-08-06T23:12:08.358863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-06T23:12:08.430220Z","title":"Vlm- grounder: A vlm agent for zero-shot 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.430220Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7656b1cce53b1364a18891a47f8897bbfe09fcb24b12ca4a2bb36d7128a79646","observation_id":"6b33626f-3e6d-49ac-a012-b6b4d3b5ab12","resolution":{"observed_at":"2026-08-06T23:12:08.430220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":"2502.10392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10392","snapshot_observed_at":"2026-08-06T23:12:09.275500Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","venue":"cs.CV","work_id":"4b6e69df-4be3-4b5e-a0a4-e34c176a96cd","year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.483436Z"},"links":{"cited_paper":"/paper/2502.10392","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5c0ac5e1d2ab5d022af8afdecb9a383a159e151e1bab33952d0896c5038675ac","observation_id":"c570fe5d-f911-48a9-acee-dc952887e705","resolution":{"observed_at":"2026-08-06T23:12:09.345486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.861917Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"2f76d241-9df1-4c1d-b34b-d191bf46f335","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.570568Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ef65b37f20bdbb3249e92957e04a16cdcba7b0dee1f63e4d25f09cb48d923dcd","observation_id":"c5c84f78-1d05-4bdc-b997-dee6732cd87f","resolution":{"observed_at":"2026-08-06T23:12:10.982349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T23:12:08.608592Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.608592Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7d9d52e4d0cbef51221cf7e172a9e21462eea973207dda0ac190ecf2c53aaf0b","observation_id":"52372e6f-62d9-47c3-ba65-9551ac4a6178","resolution":{"observed_at":"2026-08-06T23:12:08.608592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T23:12:08.686757Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.686757Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4efbacc58ee860ed8aaed0aaadc91c2c269bba0f8a565238318908aabb87b901","observation_id":"3ce2b293-2739-4dba-8e62-d862d532f07d","resolution":{"observed_at":"2026-08-06T23:12:08.686757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04689","last_updated":"2025-01-08T18:52:03Z","snapshot_observed_at":"2026-08-07T12:36:45.592859Z","submitted_at":"2025-01-08T18:52:03Z","title":"SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04689","snapshot_observed_at":"2026-08-06T23:12:08.750059Z","title":"Spar3d: Stable point-aware reconstruction of 3d objects from single images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.750059Z"},"links":{"cited_paper":"/paper/2501.04689","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:0e49e320409b15b3bc1ca5896ab2d0f2538c4c627db96ea1349ccb5df21ff1f9","observation_id":"0a6daf92-271e-4862-b982-7d1c9c3cc231","resolution":{"observed_at":"2026-08-06T23:12:08.750059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.738862Z","title":"9dtact: A compact vision-based tactile sensor for accurate 3d shape reconstruction and generalizable 6d force estimation","venue":null,"work_id":"2abd3df6-afce-4e5e-8161-ca108e9bc31d","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.827515Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:6028e687888d760ee3c31908e398aa8439d965340340a9fda5e28211c90dc2c7","observation_id":"53ca0041-7873-444e-ac7f-7068092a9c50","resolution":{"observed_at":"2026-08-06T23:12:10.785173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06211","last_updated":"2022-02-13T05:14:22Z","snapshot_observed_at":"2026-07-06T12:37:09.865277Z","submitted_at":"2022-02-13T05:14:22Z","title":"Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06211","snapshot_observed_at":"2026-08-06T23:12:08.914602Z","title":"Tac3d: A novel vision-based tactile sensor for measuring forces distribution and estimating friction coefficient distribution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.914602Z"},"links":{"cited_paper":"/paper/2202.06211","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ffa498f060bb1a57adc83e5ee5a0c121328ea1eeabd114df7fb6dc7b6142917e","observation_id":"76c4b5a8-b5b9-4cfe-99ab-e89056c77a1d","resolution":{"observed_at":"2026-08-06T23:12:08.914602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.581244Z","title":"Pointodyssey: A large-scale synthetic dataset for long-term point tracking","venue":null,"work_id":"b5713dad-c9a6-44ea-a257-d3cdd1823f51","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.982750Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7a1040b1d40016f7d37b11007b85a6e9390c667ef272da759a2970f2f7b104ef","observation_id":"daadb4f5-6f63-488a-acb5-81076bc53dda","resolution":{"observed_at":"2026-08-06T23:12:10.666620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:09.050283Z","title":"Cotracker: It is better to track together","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.050283Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:933d29e6f3cfa02994895c496608b350ba40c6bee477105fafe5a239e21ed60c","observation_id":"191d4ab0-115c-4010-960f-05535a61a749","resolution":{"observed_at":"2026-08-06T23:12:09.050283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.431123Z","title":"Robotap: Tracking arbitrary points for few-shot visual imitation","venue":null,"work_id":"5637e281-bf63-4bc5-9347-0e22422d3739","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.075532Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:b8a0e81bf73ca56f31bfa50a04bf96e48148b9cc1df333efa4e7338fc4c6c6d8","observation_id":"ae492222-1f9a-42d4-81cf-495c70edff99","resolution":{"observed_at":"2026-08-06T23:12:10.496351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.292289Z","title":"Recyclable","venue":null,"work_id":"cb1a6fb8-51c8-46c6-8b93-2a63780bfb30","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.155546Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:123ccc912fc053a5516bd231371c3edebadfa7d3dd598b68fc43b2a768b3f83d","observation_id":"83a67dae-83d4-4528-88d5-e146ac0b2397","resolution":{"observed_at":"2026-08-06T23:12:10.345022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T12:37:22.914186Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2506.19498."}