{"as_of":"2026-08-03T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ae6afaaf72c34e1c02cd81b263951457e5ef62d6da4b042ffb9881c27921e30","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:23:44.253416Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T15:45:43.483298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25360","snapshot_observed_at":"2026-07-11T15:45:43.483298Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04652","last_updated":"2026-07-06T04:17:15Z","snapshot_observed_at":"2026-08-03T09:51:34.889625Z","submitted_at":"2026-07-06T04:17:15Z","title":"KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T15:45:43.483298Z"},"links":{"cited_paper":"/paper/2606.25360","citing_paper":"/paper/2607.04652"},"observation_digest":"sha256:8596cce678650ff004770608e3b7b1cd9a7ea2cf2e874757600f04705e89d41e","observation_id":"eb82373d-f568-47a7-b9b6-aecb5a80be73","resolution":{"observed_at":"2026-07-11T15:45:43.483298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.25360/citation-record","integrity":"/paper/2606.25360/integrity","json":"/paper/2606.25360/citation-record.json","paper":"/paper/2606.25360"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:8b858519d5f94460e9b30239a59f69832a33cd2e1e8920b3cbffceafb6fbc779","observation_id":"fa56e012-6ce6-40a4-b48b-d5e80e006be1","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"OpenVLA: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:150e336f0f81999e1c849cdaadcde2449e441688f2d7c7a251db7a98d19b7bd2","observation_id":"034c7b5b-f9de-4e31-82d0-fc7538c38318","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-10T23:17:45.092545Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:f80eeeb135a205d582bd2e634dfa0c7715bc985965e9338df0694438a99497f7","observation_id":"c6e1ab2f-2136-4386-9e4c-5fea8e64ece3","resolution":{"observed_at":"2026-07-04T19:20:07.157528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"ALVINN: An autonomous land vehicle in a neural network,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:690a6275a27407b51becef55c7beec49629fed96bb638901f1650ed3e06481bd","observation_id":"74b78b5e-a78e-4084-aa7a-c55801a491c4","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-07-06T22:17:26.368596Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"cited_work":{"arxiv_id":"2508.17449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.17449","snapshot_observed_at":"2026-07-09T20:46:33.635839Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","venue":"cs.RO","work_id":"a6a3c7b8-3934-4eb0-bca0-bcb50f12f50b","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2508.17449","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:c34cc84541a8b65e9ca2614e070a3bb04a8380721a0ed9723871bd8a215fa8b8","observation_id":"3239d6f8-2b3f-4200-a385-b3431935b6c8","resolution":{"observed_at":"2026-07-04T19:20:07.152003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:9a24a74833a142dcb867dfa258059d0f38e0be576625b457443aab69b2f67de3","observation_id":"bb255f11-f354-47d4-84f7-7d2e69fc3472","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:fee543a7d0109ce9a821150e4bbfa2cb8ad6ea88d7a535de1e6a23eef8be21a3","observation_id":"6a2444a1-2ec6-403e-b4a2-ba672a804eca","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:1ec9014bc3cf793e802bc214561900f58fe7ba2a911ea9ccab59ae4a7a78d6dc","observation_id":"0d921627-8eff-4cbe-a854-7f02fd358531","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:1784742358aa6ac21c8ad385e519716b09ab41341e04558aab5b6c4872b3acd0","observation_id":"988e34b6-fd3d-4425-9b4a-a98309529043","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-10T23:17:45.135806Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:06d70282b3362ead065206c772dcee2215ba0f63e241c2f4bc6b2cacbf485f9c","observation_id":"fb07ed91-7e93-4a20-a6f1-c0e0ac4f51c6","resolution":{"observed_at":"2026-07-04T19:20:07.149183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"3D diffusion policy: Generalizable visuomotor policy learning via simple 3D representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:3a44c83beabfa8794185e6e6c38da093c4636ec6a7553eea0b7bd99fd7955955","observation_id":"2c10252d-d4a1-421f-a607-2e71311693ec","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"RISE: 3D perception makes real-world robot imitation simple and effective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:b6fa34eb25b933cd8bcb8b19931011a5d39c8ec802aad0e2a66511216d6e65cd","observation_id":"3a72c63c-cce9-42f8-88fb-9f599b8d6e4c","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:29daef8b5bf5505bc0ecc15d8c2129e5de1737f99dd7348c3ac8bc2a434d6c50","observation_id":"ed1ddf3b-764b-42c5-9e64-83c472a43a57","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Dense object nets: Learn- ing dense visual object descriptors by and for robotic manipulation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:09c216e70fa01d84ff9210d9f4e73bcef1eba6160af59ef414a3b63f2f401cfc","observation_id":"e85e71e3-8618-49c5-a24a-8e2cc70719ec","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"VIMA: General robot manipu- lation with multimodal prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:338e41555a0dcbb8f8a374bf6279a3fdc954a6f1d110a8102918dc6653908364","observation_id":"f67ef300-7f55-4893-b806-b931d961480b","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"MOKA: Open-vocabulary robotic manipulation through mark-based visual prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:2c9ab84de4f911d6b58aaab5885511585bf31f7354a0d2f0d54faec7c005f3be","observation_id":"68320909-8301-4fd9-8cb8-0ffbc1d4656d","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"ReKep: Spatio- temporal relational keypoint constraints for generalizable robotic ma- nipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:4a55e0b09fdd864b9235bfcf2d355dbafd3987ddf785d5bfe3addde11ccb9c2e","observation_id":"5ad94462-be3c-472f-a3b8-350a8bda9438","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20014","last_updated":"2024-12-28T04:23:47Z","snapshot_observed_at":"2026-07-06T20:13:58.813488Z","submitted_at":"2024-12-28T04:23:47Z","title":"ProtCLIP: Function-Informed Protein Multi-Modal Learning","version":1},"cited_work":{"arxiv_id":"2412.20014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20014","snapshot_observed_at":"2026-07-04T19:20:07.153269Z","title":"Bring my cup! personalizing vision-language-action models with visual attentive prompting,","venue":null,"work_id":"4a81014f-f6ed-48fa-ad6c-23303b466099","year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2412.20014","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:4d0107c587fbbb990dfa539f99f51f01b9ebd680d98458bba3d71c388537f711","observation_id":"596185ce-c585-4a7d-952d-58411ee7f0e5","resolution":{"observed_at":"2026-07-04T19:20:07.154799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.394965Z","title":"Spatial forcing: Implicit spatial representation alignment for vision- language-action model","venue":null,"work_id":"0de0fc11-052f-4fee-af32-850d60b54a52","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:1a656f1bd8466873a28b348c5e61a76923634d312fe1544ce36afe7e9ab68a13","observation_id":"1001b5fe-7477-4d1d-80f9-c7768c154381","resolution":{"observed_at":"2026-07-04T19:20:07.143749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10912","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:44:59.714149Z","title":"More than a point: Capturing uncertainty with adaptive affordance heatmaps for spatial grounding in robotic tasks,","venue":null,"work_id":"9f3306ef-4f42-448c-9b60-c491fc9dccb0","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:f255ea5c689eeca1c7a40801d1eebf4f535264668e8403fbd139119e5d2b5990","observation_id":"26a75245-f23b-4850-902a-b68bd98c7382","resolution":{"observed_at":"2026-07-04T19:20:07.146577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"SAM2Act: Integrating visual foundation model with a memory architecture for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:f4d1585da8226966a027adbc6c7f841ea4eb5f12025f51f55008a393b866ed91","observation_id":"5d95502a-351d-48bb-abf4-29b917a635b1","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:a80c8b7270d21013465f675d9c7d2e0376479959b1377911529dcd5b7577f738","observation_id":"31ecf627-bde9-4b78-adf1-12745b35a77c","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T14:17:46.383904Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2606.25360."}