{"as_of":"2026-08-09T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9a5bc4585baa6915c99a8bd3472008a5d82c698420968378f3a4a8e8d2e2d40","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:21:24.869616Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08903/citation-record","integrity":"/paper/2502.08903/integrity","json":"/paper/2502.08903/citation-record.json","paper":"/paper/2502.08903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.753656Z","title":"Embodied intelligence toward future smart manufacturing in the era of ai foundation model,","venue":null,"work_id":"72cdebc3-61c8-4079-9c80-c4443903ef51","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.633975Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:840b5754e2e53b61d69cf34269c2803abee9a511317939c4fabca93f91084268","observation_id":"99e568e2-f83f-431d-ace4-4ad52797d845","resolution":{"observed_at":"2026-08-07T23:21:25.759129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.640204Z","title":"Navigating industry 5.0: A survey of key enabling technologies, trends, challenges, and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.640204Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:d34cc86f69bd86662164cf08b4fd58e4e698fab4e85a347aa19faa0da3774d67","observation_id":"51c0a5fc-055d-4859-a414-5c75c9b916ca","resolution":{"observed_at":"2026-08-07T23:21:24.640204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.728247Z","title":"Advanced manufacturing in industry 5.0: A survey of key enabling technologies and future trends,","venue":null,"work_id":"e0975bdf-800c-47cf-beff-1ea655a9b167","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.645694Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:e1bd95f4e1686a9acfe437f43e35ad1bb3bda4e9455754107373d04d818245cc","observation_id":"3465b0df-345b-40e3-aa67-d38d2d3b8a89","resolution":{"observed_at":"2026-08-07T23:21:25.733182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.711603Z","title":"Large language models for human-robot interaction: A review,","venue":null,"work_id":"c01a09f1-771b-4f8b-9a9d-3f1f117b3401","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.651712Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:0b9081ad6b02e4672257998795e2f21937382f3554bfa3609f0827827bb8d04e","observation_id":"3a4efae1-1a48-41ea-977e-ed6aa77142a7","resolution":{"observed_at":"2026-08-07T23:21:25.716684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.657401Z","title":"A survey of optimization-based task and motion planning: From classical to learning approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.657401Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:506fca74e08491a0beac915db23294cf006adbc5ec6b8f1a0776e5cd65a8c8d4","observation_id":"de8fb097-6b20-4673-a04d-64a6d8db1463","resolution":{"observed_at":"2026-08-07T23:21:24.657401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.669248Z","title":"Computer vision techniques in manufacturing,","venue":null,"work_id":"0ad61325-0163-4dcd-8f28-47c2a7dac47b","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.669227Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:031bb5119ee0924c4a24d7655667b428759fd20ffdee4c3814597bd7af717970","observation_id":"53084b09-2c62-47f4-9372-1669815f2edb","resolution":{"observed_at":"2026-08-07T23:21:25.674499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.653090Z","title":"A comprehen- sive study of 3-d vision-based robot manipulation,","venue":null,"work_id":"7a981b6a-2603-4619-b727-2cecaa5e2a07","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.675049Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:17a5b885bc7a53d015b42ee432df8de5c27e0c78f0ebfc32ad31ae38305b2854","observation_id":"203fdb2d-1d6c-4b6d-9f3c-88b732fd39f0","resolution":{"observed_at":"2026-08-07T23:21:25.658425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.685174Z","title":"Multi-modal 3d object detection in autonomous driving: A survey and taxonomy,","venue":null,"work_id":"74996e64-6976-4b3b-9e07-b7ad8cd4ddc4","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.680327Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:971ad5fe6cbd003cb31e255c69ebffe0bcc83c7aaff792da3cb66b5b4fd6f2e4","observation_id":"e7c61138-a666-4cd9-a763-4f3da896d222","resolution":{"observed_at":"2026-08-07T23:21:25.690542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.636827Z","title":"Human–robot object handover: Recent progress and future direction,","venue":null,"work_id":"e47838df-3b97-4544-b860-8a7a3abfbc04","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.685653Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:e99c66716b3aebc63e2182b94a24897183f9782ce4ff2ce71abb4d1e744394fa","observation_id":"05b98e09-6909-461a-9135-c48742e77be7","resolution":{"observed_at":"2026-08-07T23:21:25.642300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.690968Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmentation with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.690968Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:4f3165f3ab5df9935ecc50e6f351edb71b80627941faaf00e63abd2ce26dfc65","observation_id":"c4234f14-6199-41d4-82f7-9f2161be8ee2","resolution":{"observed_at":"2026-08-07T23:21:24.690968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.609954Z","title":"Multi-modal feature constraint based tightly coupled monocular visual-lidar odometry and mapping,","venue":null,"work_id":"1b97022f-e074-4765-b142-5679c7320253","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.696367Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:ce6f64478a2aa71d697e541046ac64e81d58b04e6953c650bddfed33dd44d9c2","observation_id":"7f89dc9b-5cce-4541-9531-f593264bf14a","resolution":{"observed_at":"2026-08-07T23:21:25.615825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.593061Z","title":"Llm-bt: Performing robotic adaptive tasks based on large language models and behavior trees,","venue":null,"work_id":"0c8bb0a4-dd69-4031-8234-d076fc3b7037","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.701794Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:a2404ee28dc89c2c17640a22102bdff5859a48dd9284c1e833e6504aab29bc37","observation_id":"b6a33347-4d35-4141-b73d-4c17fe331785","resolution":{"observed_at":"2026-08-07T23:21:25.598148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.576954Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning,","venue":null,"work_id":"e0bd93b1-98c6-4c82-aaf9-f2a5eb21ee14","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.706864Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:46fc37ffdc9f20272bc8982d309a7eb3ed400484fc1e7c427c666bad2973c728","observation_id":"2506b0b2-1379-4d9c-8689-affbe82a38dc","resolution":{"observed_at":"2026-08-07T23:21:25.582169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.716904Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.716904Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:657325aa88d82e456f77a254f9b06b5a7752c5a08e38cb46dc3e05dbc14a7da5","observation_id":"be13511d-bc3e-45a3-b473-7bd3ed7a2c0f","resolution":{"observed_at":"2026-08-07T23:21:24.716904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.721994Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.721994Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:570e4726f22182c6f10651cdaa48294de64e7879ad06ec73a86aed9cb2756412","observation_id":"c23206f2-6fca-46f8-9667-86428a6b30aa","resolution":{"observed_at":"2026-08-07T23:21:24.721994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.524838Z","title":"3d- llm: injecting the 3d world into large language models,","venue":null,"work_id":"d639f8f5-368c-4b43-99f6-04e0c5a8aa97","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.727041Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:164cfaa1945bdf993ecd065a535a929fe25e2f0e4783dfb55d4832b958ede072","observation_id":"8b45d3cb-8d91-4180-a3d5-ed4b7341ddf9","resolution":{"observed_at":"2026-08-07T23:21:25.530677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07422","last_updated":"2025-02-13T09:32:44Z","snapshot_observed_at":"2026-07-06T19:00:35.877802Z","submitted_at":"2024-08-14T10:00:16Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07422","snapshot_observed_at":"2026-08-07T23:21:24.732040Z","title":"Llmi3d: Empowering llm with 3d perception from a single 2d image,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.732040Z"},"links":{"cited_paper":"/paper/2408.07422","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:caee74db38acad347437c72ae893363fd6d51b301b4383e2511ced70f7c6f706","observation_id":"9f79243e-13d3-4c04-bda7-0faf4516e5f4","resolution":{"observed_at":"2026-08-07T23:21:24.732040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.508698Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation,","venue":null,"work_id":"72d7f387-d627-4917-9589-35d121f22ad1","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.737749Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:d155fc8eb6d0ef3170dc70f48cca7ef999f566de324722c00f88a7afc6fce5c5","observation_id":"e4303813-9f78-4651-87a1-57c8dd7caa7e","resolution":{"observed_at":"2026-08-07T23:21:25.513861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.742557Z","title":"Efficient prompting for llm-based generative internet of things,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.742557Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:35242d64069e7291ab5dae0f26f91d874c13657d02572c92c6545211659a0a28","observation_id":"db939c55-5a15-45c2-bea6-2a2e39185b03","resolution":{"observed_at":"2026-08-07T23:21:24.742557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11514","last_updated":"2022-12-06T11:09:39Z","snapshot_observed_at":"2026-07-06T13:34:29.673291Z","submitted_at":"2022-07-23T13:10:25Z","title":"Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11514","snapshot_observed_at":"2026-08-07T23:21:24.747622Z","title":"Ha and S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.747622Z"},"links":{"cited_paper":"/paper/2207.11514","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:3cd4f5761ae82d1bd40612c1b471d25a0b0fb0062befec257c1b8d130f4a6d7b","observation_id":"63d58fa0-3574-4969-ac1b-568fd8927efc","resolution":{"observed_at":"2026-08-07T23:21:24.747622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10568","last_updated":"2025-11-14T09:52:46Z","snapshot_observed_at":"2026-08-05T12:56:51.825212Z","submitted_at":"2024-03-14T17:47:10Z","title":"MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10568","snapshot_observed_at":"2026-08-07T23:21:24.753064Z","title":"Mope: Parameter-efficient and scalable multimodal fusion via mixture of prompt experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.753064Z"},"links":{"cited_paper":"/paper/2403.10568","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:757ebc526d31249b291fbd90491009e2ad9186cf5be1751d0481f84c6826d628","observation_id":"b3dd1daa-2245-406c-9a63-245a6f9dc0e8","resolution":{"observed_at":"2026-08-07T23:21:24.753064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T23:21:24.758518Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.758518Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:20dd02332c32250a5cf6aaa06bb223a2fdc7ca0a9b112d93a763897a4c5ed14c","observation_id":"2b21e68d-9dcf-41fb-9b49-debcb5b69290","resolution":{"observed_at":"2026-08-07T23:21:24.758518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.482449Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"10e35576-250d-4dec-af2d-3818240e409c","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.763904Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:fd7a335d9b11c3e1879c49f71f4447a1daeffbd57213def6af373b69451bd436","observation_id":"2edb81ef-8720-445f-ac1b-a00f0160b2a8","resolution":{"observed_at":"2026-08-07T23:21:25.487551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T23:21:24.768834Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.768834Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:698a99f8eec04fd0852be33e1d63d54c2408596d74fc943c7b6cb9db272d65f5","observation_id":"5dac971e-7165-498f-bab5-2a201487cda7","resolution":{"observed_at":"2026-08-07T23:21:24.768834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05779","last_updated":"2023-11-09T22:55:10Z","snapshot_observed_at":"2026-08-01T00:05:48.584603Z","submitted_at":"2023-11-09T22:55:10Z","title":"Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in Clutter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05779","snapshot_observed_at":"2026-08-07T23:21:24.774141Z","title":"Language-guided robot grasping: Clip-based referring grasp synthesis in clutter,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.774141Z"},"links":{"cited_paper":"/paper/2311.05779","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:ead58469eec2b6d851d9dfc5438ff2f1e088009b2a9f20b33788892764c3ddbc","observation_id":"1be82fd3-1d8a-455e-a8f3-e46619735dc8","resolution":{"observed_at":"2026-08-07T23:21:24.774141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.560898Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip,","venue":null,"work_id":"32d0c7eb-8816-4a57-b1e6-f36d62e50f31","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.779551Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:7a5dd96be361008e4ace6e376e2144e46971759a82f5d900c8d0aac29f4390ca","observation_id":"5672150c-e946-4f3c-b69c-2e4663618561","resolution":{"observed_at":"2026-08-07T23:21:25.566103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.465129Z","title":"Survey on large language model-enhanced reinforce- ment learning: Concept, taxonomy, and methods,","venue":null,"work_id":"84707db7-b790-4f84-801b-c3130ae86416","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.783804Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:a2e608ad5ba5777f11459c5bc8edc67092d68b32bc217ecc066ac16ada8fa349","observation_id":"d6f29f30-3c78-4bd7-8c59-bf4e3af90faf","resolution":{"observed_at":"2026-08-07T23:21:25.471120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.447671Z","title":"To boost zero- shot generalization for embodied reasoning with vision-language pre- training,","venue":null,"work_id":"5477590f-4569-4303-a5b4-a016b6a578e5","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.788247Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:23741c03f7170a8a7bceca30387eeb1a3312a92816b1c31b68a3a8b1bb7087e4","observation_id":"d0ee76e6-55ff-4f75-bc82-6464aa67469a","resolution":{"observed_at":"2026-08-07T23:21:25.453133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.431561Z","title":"A survey of visual navigation: From geometry to embodied ai,","venue":null,"work_id":"607e90af-7668-4311-8f89-9d08353423f7","year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.792831Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:a3c189b7400b4e9106351b63a144e35b0fcaf857dcab0b459b0f61eae23280c3","observation_id":"6bdcfdb4-4f9c-43a8-9975-ecc8eeaabb98","resolution":{"observed_at":"2026-08-07T23:21:25.436777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.416116Z","title":"Delving into multi-modal multi-task foundation models for road scene understanding: From learning paradigm perspectives,","venue":null,"work_id":"b50461c5-dc2d-49fe-9cdf-75734bad8ac3","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.797181Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:59a6c754ed2e5ab505fd2c9b82a1116771a905565c55c6f633a3be99f6debbcc","observation_id":"c56990b9-2c38-4115-b99a-27b781f9bc51","resolution":{"observed_at":"2026-08-07T23:21:25.421188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T23:21:24.801646Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.801646Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:74ec15d3994319485f98ddedb31543359a636c4c86a6652edf927316c64b9140","observation_id":"8e710c2c-f061-4eec-bc6b-dd7432edafe1","resolution":{"observed_at":"2026-08-07T23:21:24.801646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T23:21:24.806266Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.806266Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:ae2171aa0a468d12f5b46dc8f9ff040916be1223fdcf70b59fbb557f1e0a08bf","observation_id":"ce9e92b8-da09-4c38-9e66-14355fae9f8e","resolution":{"observed_at":"2026-08-07T23:21:24.806266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T23:21:24.811203Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.811203Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:6119f1b6d14656f21d8ff75e6da8c8694ebdd359ae603197b5a915688c746610","observation_id":"5eef3c2e-3460-4598-bd12-47a07501e139","resolution":{"observed_at":"2026-08-07T23:21:24.811203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.400015Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":"ab7d0ebb-2cd1-434e-8742-dd46d61c5cf4","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.816705Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:4b7974284ede9bd7c1b93e76b64ddecf6bf240f6c01fff6012c91d47d4d80f70","observation_id":"31967dc6-4202-4999-9f0f-f97c8f0ba81a","resolution":{"observed_at":"2026-08-07T23:21:25.405220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T23:21:24.821792Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.821792Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:d3acd652cacaf7b07ebc7fb9d5f9ff1e0d69b38f7ec30bb875f4308b56fdb0f5","observation_id":"a9d24f4f-73ac-4492-aabf-9e8db7fb4ba3","resolution":{"observed_at":"2026-08-07T23:21:24.821792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T23:21:24.826991Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.826991Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:0e92fed3c385c5efdcba4acf531ee7769b233f2f41d01fb3fdc59ae9407d9872","observation_id":"5561590d-e2a0-4435-958a-18c289f144d5","resolution":{"observed_at":"2026-08-07T23:21:24.826991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.384070Z","title":"Visual language maps for robot navigation,","venue":null,"work_id":"e339b777-a652-4283-b8f1-a80d8f95b1d9","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.832463Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:93af487fa4f92d756075325d124478eff8ac51f19d5840bd79398529d69a2861","observation_id":"bf7997dd-d115-4180-8a32-710dd69bab63","resolution":{"observed_at":"2026-08-07T23:21:25.389029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.170837Z","title":"Ving: Learning open-world navigation with visual goals,","venue":null,"work_id":"c296d9c3-1d5c-4770-b746-cd1c19874e67","year":2021},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.837326Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:9b72629dbbabb4a856f19e3d2082d896a2baefd3588d25a5602ee61386c97316","observation_id":"2aed1b5c-b8c2-48d6-948e-8cd12ab6780b","resolution":{"observed_at":"2026-08-07T23:21:25.177254Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T23:21:24.842290Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.842290Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:a9db25e5336e178cd826221f6919261b48cfe117845512b6607ac34ba2970d74","observation_id":"ce7cb4ab-9fb5-4273-b845-f81d216c5e45","resolution":{"observed_at":"2026-08-07T23:21:24.842290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.847764Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.847764Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:df4262bdf0bb98f505742d5af411b0f10f2520e433b7b768583834e12a87d14b","observation_id":"53a05805-5044-4462-ab8f-e913e47f8993","resolution":{"observed_at":"2026-08-07T23:21:24.847764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.357441Z","title":"Patchwork++: Fast and robust ground segmentation solving partial under-segmentation using 3d point cloud,","venue":null,"work_id":"6c934d28-70c4-48e7-b7fb-bb0b4662037f","year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.858979Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:51a663f310dd63240e302f2c9fd956ee8371b59a26820af592d36de50e4b629a","observation_id":"87ac9c5b-7f41-4d79-9682-7f5f6d967e21","resolution":{"observed_at":"2026-08-07T23:21:25.362772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-07T23:21:24.869616Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.869616Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:b2794185cf164e9bcf692dd8e3e225eab4d21463b9f1401d86e2828cd0037b36","observation_id":"ef31a0f3-933b-443c-8e1d-c271e5f3973a","resolution":{"observed_at":"2026-08-07T23:21:24.869616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T23:21:24.853042Z","title":"Available: https://arxiv.org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.853042Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:7543ffe94dd0fe4712410b0439d28ccfe345051abff62a4465d51fe87df2f80d","observation_id":"5f592ef7-a54d-4ce8-9b5a-dab006be4acf","resolution":{"observed_at":"2026-08-07T23:21:24.853042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11919","last_updated":"2022-09-27T04:26:13Z","snapshot_observed_at":"2026-08-04T07:16:09.346579Z","submitted_at":"2022-07-25T06:09:02Z","title":"Patchwork++: Fast and Robust Ground Segmentation Solving Partial Under-Segmentation Using 3D Point Cloud","version":2},"cited_work":{"arxiv_id":"2207.11919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.11919","snapshot_observed_at":"2026-08-07T23:21:24.924937Z","title":"Patchwork++: Fast and Robust Ground Segmentation Solving Partial Under-Segmentation Using 3D Point Cloud","venue":"cs.RO","work_id":"b7ddc203-5f46-4acd-8f40-932c05a7f6b8","year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.864173Z"},"links":{"cited_paper":"/paper/2207.11919","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:365e4d3b42bdbd79f326c4aaffdf57990efa1b11e56e78e1e1d99362b635ba11","observation_id":"bc592cf2-c519-4d80-89cd-abfd98a46259","resolution":{"observed_at":"2026-08-07T23:21:24.932684Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T01:05:19.744627Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2502.08903."}