{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a96c8426f4332b1ed1d94368febc7d1588a79ad7e4e97528c23c58da4b6266e9","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:59:30.182455Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:18:55.243330Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:00:10.735031Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"cited_work":{"arxiv_id":"2506.06535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06535","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maplegrasp: Mask-guided feature pooling for language-driven efficient robotic grasping","venue":null,"work_id":"abd8f7a1-fc20-4003-a2d5-4d715914c7b8","year":2025},"citing_paper":{"arxiv_id":"2511.16857","last_updated":"2026-04-19T05:15:27Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-20T23:54:15Z","title":"BOP-ASK: Object-Interaction Reasoning for Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T19:58:19.309634Z"},"links":{"cited_paper":"/paper/2506.06535","citing_paper":"/paper/2511.16857"},"observation_digest":"sha256:88821d671e5d05969b5c1339e888fa01e773a75c4e1f57a755da83a2a643a0a7","observation_id":"953c6cb1-efc4-4e48-9d4e-ea5a098e3913","resolution":{"observed_at":"2026-05-17T20:00:10.738442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06535","snapshot_observed_at":"2026-07-31T06:18:55.243330Z","title":"MapleGrasp: mask-guided feature pooling for language-driven efficient robotic grasping","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.243330Z"},"links":{"cited_paper":"/paper/2506.06535","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:257c151c973db7ade61bd01521733302abe02257db7ef89bb327d3674937dbea","observation_id":"405b64ad-7cef-4384-bd3d-931f7f1737c9","resolution":{"observed_at":"2026-07-31T06:18:55.243330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06535/citation-record","integrity":"/paper/2506.06535/integrity","json":"/paper/2506.06535/citation-record.json","paper":"/paper/2506.06535"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.475682Z","title":"End-to-end train- able deep neural network for robotic grasp detection and semantic segmentation from rgb","venue":null,"work_id":"5b4c5002-a963-4023-8829-10cd4654976d","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.608398Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:0222a92b1ea3d331f653244f872f23ee5c6c16fdb4824ab31f45872366eeb629","observation_id":"95d3747e-a435-4af7-819f-b34f2fe1c027","resolution":{"observed_at":"2026-08-07T05:59:38.563723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.333940Z","title":"Hifi-cs: Towards open vocabulary visual grounding for robotic grasping using vision-language mod- els, 2024","venue":null,"work_id":"3d75b1b7-3314-4950-92de-40705c405026","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.722777Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4b654250401cdd37fb01d921d7a08fe1eaf67838982f89bb4a49b5d860ea2379","observation_id":"d5230111-0944-4869-aaa7-51d05ad76cda","resolution":{"observed_at":"2026-08-07T05:59:38.399923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.189839Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"1b7fd5b9-183d-4814-9303-d6a23d6706a8","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.879648Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:cdac715f2bcc09265fad512ebced0b7daccc39f595d61bc5388a40eceb2ad3c8","observation_id":"1d6d9234-71cd-4c17-b891-6ab7bd47d82f","resolution":{"observed_at":"2026-08-07T05:59:38.284066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T05:59:23.007621Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models.https://arxiv.org/abs/ 2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.007621Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:13d846ca266a92d114264d9751e2b5c07370037e14e22a6b7afc1b7439072dd3","observation_id":"9b9661ce-8956-4d31-a4b7-792933afa43c","resolution":{"observed_at":"2026-08-07T05:59:23.007621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.071703Z","title":"Trust the PRoc3s: Solving long-horizon robotics problems with LLMs and constraint satisfaction","venue":null,"work_id":"a3930b45-a948-49a3-aa1b-2c93248f4deb","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.129115Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:b39db39d51c184b420ba4176da31a694a639117ba4b5f598c8d28c1f41cac4a3","observation_id":"8804535b-9083-4b43-ae69-5573142dff35","resolution":{"observed_at":"2026-08-07T05:59:38.116592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.941341Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"7d577475-82ce-4631-aaf1-4d12526bdc65","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.245485Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e731d624090850bed10582caf896d9366c60448f676fcb96c0ad34a41b619ef6","observation_id":"c9c66032-d282-4326-80ec-a5260fcb86e0","resolution":{"observed_at":"2026-08-07T05:59:38.002526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.796107Z","title":"Jacquard: A large scale dataset for robotic grasp detection","venue":null,"work_id":"1d3d43c6-bcf3-4ee1-aa3b-3fbf08bbe741","year":2018},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.383235Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:49602d92ca8a94b51e03f4200caa745442ee0081a21f68f8b4edc684a36d4c86","observation_id":"72636aec-7308-464e-8e8b-98f7078e2290","resolution":{"observed_at":"2026-08-07T05:59:37.873290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13441","last_updated":"2025-09-12T23:19:44Z","snapshot_observed_at":"2026-08-07T15:42:59.268386Z","submitted_at":"2025-05-19T17:59:06Z","title":"GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13441","snapshot_observed_at":"2026-08-07T05:59:23.566111Z","title":"Graspmolmo: Generalizable task-oriented grasping via large-scale synthetic data genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.566111Z"},"links":{"cited_paper":"/paper/2505.13441","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:709a1e74a51238e7cb5e9d20581f3e5ab6f7d5996594ef4503db8a7895756415","observation_id":"4449ba98-7be0-468f-8750-45f386955cb7","resolution":{"observed_at":"2026-08-07T05:59:23.566111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.636059Z","title":"Acronym: A large-scale grasp dataset based on simulation","venue":null,"work_id":"5c129916-17e9-4d18-a912-6616a2350899","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.734957Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:b2e3b3898e7136496dbc0e1248f474f1e69c1768bce039028a1b635c106964c0","observation_id":"c4544b63-71b8-4fb6-a098-b045da646004","resolution":{"observed_at":"2026-08-07T05:59:37.729654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.526172Z","title":"GraspNet-1Billion: A large-scale benchmark for general object grasping","venue":null,"work_id":"f7c6f906-6627-404f-85e6-876fada5531b","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.863902Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:997e293bc5aec6cf354d2a025bff7d2977706b1bda50b6a4869f19819790538d","observation_id":"0058bcd9-a88b-4582-98c9-09c158d40814","resolution":{"observed_at":"2026-08-07T05:59:37.592702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.332643Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":"53a6f02d-01f4-4b9d-a436-279b2a18fa4b","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.974250Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:36eb2919097ed8dee6ca1aed92381652d4f79048592c39dec3b23ef4b52dcfee","observation_id":"80e38701-26c3-4df1-8cc3-b79c95fa4ef2","resolution":{"observed_at":"2026-08-07T05:59:37.421739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.153707Z","title":"Rvt2: Learning precise manipulation from few demonstrations","venue":null,"work_id":"75442317-ec2c-41f3-afd7-0c01f5a3d5fc","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.079791Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:9ffde8042069e8ed06ebfbfa504b4ec4ae2c5502da22f017cb8a621db1b4d0ff","observation_id":"1deaa556-6bb4-422e-8f02-e061f21cff2c","resolution":{"observed_at":"2026-08-07T05:59:37.245120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.005236Z","title":"Language-grounded dy- namic scene graphs for interactive object search with mobile manipulation","venue":null,"work_id":"67c9778c-9210-47e6-8f2b-aab43a114edb","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.256736Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4bbc99caae96652178bb626ab90fcd72a258ee130af194a2398ac986d3d0feff","observation_id":"4377422f-956a-490b-9c78-932e5a1f2b3c","resolution":{"observed_at":"2026-08-07T05:59:37.075236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.805895Z","title":"Inner monologue: Embodied reason- ing through planning with language models","venue":null,"work_id":"6af9d598-1394-4787-9f2c-b9d75acc0ef0","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.387555Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:20bde64b7204ccaa02afa596eda3a8cea73e47c797deed7662e3e1dc824a93bd","observation_id":"98abafa1-c906-46d5-95e6-45a8c9ce0719","resolution":{"observed_at":"2026-08-07T05:59:36.886801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.620329Z","title":"Effi- cient grasping from rgbd images: Learning using a new rect- angle representation","venue":null,"work_id":"ea66d4ab-a258-4c5a-bd0b-b726f52a42fa","year":2011},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.502989Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:b99af0efa865314037631833bea795530623d95c507cbf77107bf2c13e6550a6","observation_id":"e3a2a822-747f-408d-88b2-8dec101af597","resolution":{"observed_at":"2026-08-07T05:59:36.701046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.434632Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"49337841-e451-4e41-93b0-2f66bf8835f2","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.611566Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ef496a2b89d17d268ec680828c7510e410be51224ece03966c0596f431a4074d","observation_id":"ac6541b7-d66c-424f-9970-9ab555c89a33","resolution":{"observed_at":"2026-08-07T05:59:36.504139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T05:59:24.715654Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.715654Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:5565abdb4e4a0de303ff47b7a6ebf13b052636d4696b5e0028d3a0027c6622d2","observation_id":"efc502b1-c795-4751-9c80-ca80a1a1160b","resolution":{"observed_at":"2026-08-07T05:59:24.715654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T05:59:24.756115Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.756115Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:d8492ef7a194ea08b4e3f664bc3a30a0b9aad0dd180873b71b2aa6d75670e52d","observation_id":"64924a4c-7d2e-4595-8831-24af304a44b5","resolution":{"observed_at":"2026-08-07T05:59:24.756115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.247983Z","title":"Segment anything","venue":null,"work_id":"1d75e077-7cfb-4ff2-8c41-871cd221f6be","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.859095Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:5c62408cff7aefd51edae2cdc78b329c69e25591c96e71ba46de925fee1736d8","observation_id":"8acab195-1467-4563-a6c8-7b772ae19fca","resolution":{"observed_at":"2026-08-07T05:59:36.320177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.045024Z","title":"Antipodal robotic grasping using generative residual convolutional neu- ral network","venue":null,"work_id":"f3f15913-f73f-4b30-a148-228c16054d1c","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.973178Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:d515f716584b7d6d84fe84dd8fb1c3bb69f660953d962fc149eae578d4239be8","observation_id":"6a96d6ae-0ffe-4182-b7f6-2a1a65e858ec","resolution":{"observed_at":"2026-08-07T05:59:36.135015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.846376Z","title":"Ovgnet: A unified visual-linguistic framework for open-vocabulary robotic grasping","venue":null,"work_id":"4c2cfee9-42d1-44a5-90c4-8bff426f227f","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.044852Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:3c0194ffa5475be8524781182456bc22c9d52e8b2bc3459776e1d4367c09d1f4","observation_id":"8d15859f-698d-4b35-8eca-405fcc3b0c96","resolution":{"observed_at":"2026-08-07T05:59:35.950064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.603330Z","title":"Ovgnet: A unified visual-linguistic framework for open-vocabulary robotic grasping","venue":null,"work_id":"4e0ba147-df1d-475c-8b43-a9507cb852e1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.210319Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:88ffd32d2349265cbfa8429157b918f0d1a52b1d6594a66bf2eb44e353229d68","observation_id":"a8950cf3-5ee1-4482-b786-7007bb0e4524","resolution":{"observed_at":"2026-08-07T05:59:35.713433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.381539Z","title":"Vision-language foun- dation models as effective robot imitators","venue":null,"work_id":"e99e4034-f4ff-477d-aab1-3285949bfc3a","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.336778Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:2c8984ce2efca98e9399c8af6e14c0f248e0deaeb3c48f26c87e2ad7766dd1b5","observation_id":"31909571-58c9-41a6-b582-3ab879eff332","resolution":{"observed_at":"2026-08-07T05:59:35.488906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.159481Z","title":null,"venue":null,"work_id":"b125573c-b8fa-4767-a705-251cdac74b11","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.480480Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:3789313f84e8abf2734bde96dbd09c40e857585ec3dd31e14f536ea2e2d030d7","observation_id":"15acdb14-72b2-4a3b-9598-749606a6de8d","resolution":{"observed_at":"2026-08-07T05:59:35.267215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-04T04:35:05.950904Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-08-07T05:59:25.594969Z","title":"Ok-robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.594969Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f6ed812e2e1b22311950509617ba1328d5bbb7d4dcf8c53402adea3d5228b702","observation_id":"0c3965e4-eaeb-458b-8cd7-3bf30b0f60a7","resolution":{"observed_at":"2026-08-07T05:59:25.594969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.904422Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection","venue":null,"work_id":"d6e61f48-60f1-42c7-8569-d32754ae440e","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.698166Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:63a11c9f4142a4ba5e6c73b2b34614f0e410a870b283f1a9f34ac8d05265a6a8","observation_id":"4e0eb91f-eaf0-42a7-ac46-1c547ca68b6e","resolution":{"observed_at":"2026-08-07T05:59:35.045677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.720453Z","title":"Gao, Xi Vin- cent Wang, and Lihui Wang","venue":null,"work_id":"b17b3b79-aba6-4dee-8cc6-457605bc5088","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.822106Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4edf7d283f92fd990c6a3027ccf0b115d3a481b7dbe42d01f38649224d88625b","observation_id":"04bbb5e5-bf10-45f8-b658-e3ea8faf660c","resolution":{"observed_at":"2026-08-07T05:59:34.791071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.566652Z","title":"Deepseek-vl: Towards real-world vision- language understanding, 2024","venue":null,"work_id":"3dbc4b42-47c8-4752-b103-e49ccc0e9a27","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.948312Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:43080d8a00193efe5f645f7e1b8348699e3902be21c7aa19f4d80677401f5def","observation_id":"916c6a14-fd01-4e8d-bafa-bbb4aa0e0f7f","resolution":{"observed_at":"2026-08-07T05:59:34.642108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.372388Z","title":"Hybrid physical metric for 6-dof grasp pose detection","venue":null,"work_id":"10f0c752-905b-4e21-9b92-0cdfa70a014a","year":2022},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.088842Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:701ff86183c14c82e37de54c3fd0e9604e8f59b242b0253c31027d338eccdc5d","observation_id":"2d5e4f87-565e-4bc3-8ba6-19c355082e09","resolution":{"observed_at":"2026-08-07T05:59:34.476271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.205889Z","title":"Vl-grasp: a 6-dof interactive grasp pol- icy for language-oriented objects in cluttered indoor scenes","venue":null,"work_id":"f39c1130-e947-4113-808c-2bc404fe578a","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.196122Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:bd00fd17e5190a2dae24e029cd1a8b9366aa25f2282480f41669bd6ed8ca1ccd","observation_id":"bde316c3-db5a-4528-8d4e-2d604cd6a3e7","resolution":{"observed_at":"2026-08-07T05:59:34.294109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14403","last_updated":"2024-09-22T11:45:48Z","snapshot_observed_at":"2026-08-01T16:31:37.681943Z","submitted_at":"2024-09-22T11:45:48Z","title":"GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14403","snapshot_observed_at":"2026-08-07T05:59:26.297329Z","title":"Graspmamba: A mamba-based language- driven grasp detection framework with hierarchical feature learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.297329Z"},"links":{"cited_paper":"/paper/2409.14403","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:8485709cf55bdbecab2cdee7be64f3b037ee8b1366ddd49c4d849cb037fa48e1","observation_id":"7f678d07-53ca-4bb0-b1bd-5ad1f2bd9083","resolution":{"observed_at":"2026-08-07T05:59:26.297329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.073265Z","title":"Lightweight language-driven grasp detection using conditional consis- tency model","venue":null,"work_id":"a863aaa6-2ff3-4da4-8af9-fd01d9803e84","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.411855Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4bc32070cdca62c387c89531d4dd10db105c1c4b953ab93daae7777d839e05e5","observation_id":"1ff06100-d67a-4dd8-920d-72a05779c937","resolution":{"observed_at":"2026-08-07T05:59:34.143028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.908870Z","title":"Language-driven 6-dof grasp detection using negative prompt guidance","venue":null,"work_id":"9308aae1-d0b7-47a0-8f9f-c3e9307e9a62","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.526176Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e8860590caf608a7176c76d570f833377f35a6710806b87638b16f5a6224f431","observation_id":"e4d91950-9375-4366-97b8-dc1d6c167b02","resolution":{"observed_at":"2026-08-07T05:59:33.962764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12521","last_updated":"2024-09-23T06:04:36Z","snapshot_observed_at":"2026-07-06T19:18:00.304916Z","submitted_at":"2024-09-19T07:24:12Z","title":"GraspSAM: When Segment Anything Model Meets Grasp Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12521","snapshot_observed_at":"2026-08-07T05:59:26.631101Z","title":"Graspsam: When segment anything model meets grasp detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.631101Z"},"links":{"cited_paper":"/paper/2409.12521","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f93f9f969a169433783b64278a23e8e9c2217f47f4287b10786c242539b490a4","observation_id":"4382b3af-21e9-4b5c-9450-43b3bd7c59be","resolution":{"observed_at":"2026-08-07T05:59:26.631101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18158","last_updated":"2025-03-24T00:39:57Z","snapshot_observed_at":"2026-08-04T01:16:23.160733Z","submitted_at":"2024-06-26T08:17:59Z","title":"3D-MVP: 3D Multiview Pretraining for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18158","snapshot_observed_at":"2026-08-07T05:59:26.711288Z","title":"3d-mvp: 3d multi- view pretraining for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.711288Z"},"links":{"cited_paper":"/paper/2406.18158","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:3b2410dab66b1bd964f28cc489770540717e03634a013f4ae411afa4b7d5e0fc","observation_id":"84da3673-2a32-4842-8123-6cac36c08c2b","resolution":{"observed_at":"2026-08-07T05:59:26.711288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:26.875867Z","title":"Sayplan: Ground- ing large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.875867Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:cf19b25efba8658fec9e7052ae4cba13cba24d6b13c8812b28d02622fcd01501","observation_id":"ad675a5d-fbb1-496c-a3a1-c096f658dc72","resolution":{"observed_at":"2026-08-07T05:59:26.875867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.761866Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":"cd97a6ee-194c-498a-9f41-dea0a0b1ce4f","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.961017Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:7f3395f4789d03b9da763912ecbcce5ad8c551624467e7d801c8cbe0b767e288","observation_id":"874fc6f0-5cf7-43b7-a473-b25a0c20b72b","resolution":{"observed_at":"2026-08-07T05:59:33.836594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:27.082005Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.082005Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4f2ea5a615a012c3792858eb7ed881e974954e474091429e67f5c66cf6a7c9e3","observation_id":"ba039e28-f965-4619-a1ee-96657594658f","resolution":{"observed_at":"2026-08-07T05:59:27.082005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.568567Z","title":"Grasping in the wild: Learning 6dof closed- loop grasping from low-cost demonstrations","venue":null,"work_id":"2e03c114-bd9c-42fd-9c4c-424883521ffa","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.203026Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:8ce7cabffb48314e5b20ad4c7325587e8bdc10a8c795f4b9de6189f2d2aceeca","observation_id":"90556185-0a7f-4436-8081-5fa6887a1a1d","resolution":{"observed_at":"2026-08-07T05:59:33.685490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.336638Z","title":"Contact-graspnet: Efficient 6-dof grasp gen- eration in cluttered scenes","venue":null,"work_id":"c7c22880-c87c-4bf5-8363-25d07c5e108c","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.307342Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:0dbf39b54e45522c8095727428944c00a2e4c711d926272ede4ebf70f6c3a7a7","observation_id":"aeb9fe25-0073-4a06-bcf6-a018aabd0836","resolution":{"observed_at":"2026-08-07T05:59:33.460345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.208922Z","title":"Foundationgrasp: Generalizable task-oriented grasping with foundation models","venue":null,"work_id":"ee6e4677-9a8b-42fd-8be8-609ebee1aff7","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.457409Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4992e1ddb1b888fd806ad0f3e07b71c83e3604675957b8c46aafd93988a229f5","observation_id":"1ae8b650-b462-4bc5-ae8c-32693fb1adb5","resolution":{"observed_at":"2026-08-07T05:59:33.269395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.041296Z","title":"Mlp-mixer: An all-mlp ar- chitecture for vision","venue":null,"work_id":"a16bd5fc-395e-4446-af8b-de44efe09ad3","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.584816Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:7cdf6f43f570a417e5d5a24f3ca7ecb186cfa1da2e8b5802a956154e4b771f91","observation_id":"01eadda2-9a00-4ffc-834c-36c28cbcae26","resolution":{"observed_at":"2026-08-07T05:59:33.161225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.795901Z","title":"Towards open- world grasping with large vision-language models","venue":null,"work_id":"4b2a3b4d-cb08-41f0-b47a-a9c245d8fa1b","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.686069Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:05c6c7a2ec4b7397324109abeb1f50058ba466dfea04ed383ba3833c6623ca11","observation_id":"ffc1c13a-1cc4-4606-bcef-97a24d047f52","resolution":{"observed_at":"2026-08-07T05:59:32.918336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.657011Z","title":"Language-guided robot grasping: Clip-based referring grasp synthesis in clutter","venue":null,"work_id":"844c59d1-3149-44e0-a47a-195d489ffac6","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.827578Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:2da222e4f4aafb53d46112cd4bb21cbf9cc422865ed15a316b83ec7fe4e7fa3d","observation_id":"6be11674-9bb7-44c0-8bee-7a94c658a422","resolution":{"observed_at":"2026-08-07T05:59:32.698032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.540453Z","title":"Language-driven grasp de- tection with mask-guided attention","venue":null,"work_id":"faa950b5-d978-48b4-a312-54f0a3f680a9","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.949297Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f4f90cc15e0b6053e53d40ee2658636d0f8948ed80c19e82f6058444e471df0a","observation_id":"43d95ba8-604b-4d8d-80a3-acabd87a550a","resolution":{"observed_at":"2026-08-07T05:59:32.596186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.412107Z","title":null,"venue":null,"work_id":"5276c2c6-12fc-45f7-9c1c-aa08e5cb9f4e","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.038044Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:514720fcfd06bf545c0227ef76a593921a4ab2dc8d9c43a39584b123599534d9","observation_id":"6e81fb7e-166a-43db-88ca-6573b096d7f6","resolution":{"observed_at":"2026-08-07T05:59:32.492609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.313502Z","title":null,"venue":null,"work_id":"b399afbe-1464-4989-a811-23489ce138ca","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.161716Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:62f4e4b363d3202c0bd52364a122b713256073af6184734c39d02e1485b336e3","observation_id":"641a213e-9eda-4e76-a227-60a72c8335e4","resolution":{"observed_at":"2026-08-07T05:59:32.368506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.240729Z","title":"Gpt-4v(ision) for robotics: Multimodal task planning from human demonstration","venue":null,"work_id":"4e8ffa6f-0f07-4e37-9e18-994d17347d95","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.290693Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:0630d20ff51a0fd33a7c98c5f4074a355c885bb0382ae60416bc0591e7ea993c","observation_id":"1af2a83d-7d1c-480e-95d7-9343529fd530","resolution":{"observed_at":"2026-08-07T05:59:32.271887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.130414Z","title":"Grasp as you say: Language-guided dexterous grasp genera- tion","venue":null,"work_id":"90735fc5-150e-4e7e-9d93-b8e2fe6c46e7","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.362358Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:36a425b7946a6e76f1297d6b64501053f802d29f739c73a3d240ff63c13784c9","observation_id":"1a56d105-9007-4492-b106-b077948e6287","resolution":{"observed_at":"2026-08-07T05:59:32.171500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.091246Z","title":"Tidybot: Personal- ized robot assistance with large language models","venue":null,"work_id":"c142c54b-e808-4fd3-a3a2-a1f185c4dc81","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.524037Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c0d38e730314dff939937aa36f1afee89a82f3210615025d7a79e195225b829e","observation_id":"294416c8-393b-4a14-829c-747a29c4fe17","resolution":{"observed_at":"2026-08-07T05:59:32.105335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.052866Z","title":"A joint modeling of vision-language-action for target-oriented grasping in clutter","venue":null,"work_id":"2eec07a3-7680-4124-a13b-d7938ff01c79","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.668792Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:a1ebc38398ca55672e43f300f1d1f18371f3ce7094c650b62f2b9a596d31bca5","observation_id":"3ef0dfe0-0ff4-4228-8fc4-dc9fe8b725c4","resolution":{"observed_at":"2026-08-07T05:59:32.069134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07824","last_updated":"2023-02-15T18:13:10Z","snapshot_observed_at":"2026-07-06T14:52:11.722960Z","submitted_at":"2023-02-15T18:13:10Z","title":"Instance-wise Grasp Synthesis for Robotic Grasping","version":1},"cited_work":{"arxiv_id":"2302.07824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07824","snapshot_observed_at":"2026-08-07T05:59:30.394946Z","title":"Instance-wise Grasp Synthesis for Robotic Grasping","venue":"cs.RO","work_id":"15b9da59-8a06-48c9-9d12-4cfed9ba6282","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.814172Z"},"links":{"cited_paper":"/paper/2302.07824","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e05d66b0c8d937a551ddf60c9945320edda62269a3c93029f20236f023ee616f","observation_id":"6f45701b-fde2-4643-8fcf-3e20fe3915a1","resolution":{"observed_at":"2026-08-07T05:59:30.485178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.016729Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"ee152d85-8017-40f8-8589-e36b5408d116","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.954588Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e53a6f8769af379098ccc9de6c0cf81c30a887f9993a4fafd6ed9e11d5aebcc0","observation_id":"e1fa16b9-38dc-463b-b2b2-f403246a2b57","resolution":{"observed_at":"2026-08-07T05:59:32.030130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.986374Z","title":"Ground4act: Leveraging visual-language model for collaborative pushing and grasping in clutter","venue":null,"work_id":"81fdc03c-9872-4a05-ba8c-ab13c8e7ba77","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.021121Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:7ad059d73d769c9d9a4245ab020672aba47c5029af4ee25989e67f632b5833f8","observation_id":"9f23039d-fbc9-44a0-934d-a1738bf971a6","resolution":{"observed_at":"2026-08-07T05:59:31.998882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19457","last_updated":"2025-02-07T05:10:48Z","snapshot_observed_at":"2026-07-06T19:23:54.455374Z","submitted_at":"2024-09-28T21:11:25Z","title":"A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19457","snapshot_observed_at":"2026-08-07T05:59:29.189968Z","title":"A parameter-efficient tuning framework for language-guided object grounding and robot grasping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.189968Z"},"links":{"cited_paper":"/paper/2409.19457","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:56a74ccc4019a11a6f37bc9870b87c9208d74f42186ca4d00741cf08f9642a70","observation_id":"2470b129-8cad-4f0c-a086-f2b7fc481499","resolution":{"observed_at":"2026-08-07T05:59:29.189968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.945758Z","title":"Se-resunet: A novel robotic grasp detection method","venue":null,"work_id":"3c6213b9-1e2c-4b63-aad6-24eb03195379","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.307333Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c1f631ac35abe79040ca968da817b4b246a4568b562b79fe2c049f4595e4526a","observation_id":"ae0cf24b-1a09-40af-8434-edc2065200ef","resolution":{"observed_at":"2026-08-07T05:59:31.973274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.840801Z","title":"GLiNER: Generalist model for named entity recognition using bidirectional transformer","venue":null,"work_id":"154d2d91-d176-4a10-97e2-bb838c0432d1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.380199Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:819e3e1a966dc1c6c7a1725d9f9f318d1679865650d56414a1d63dab51acdde4","observation_id":"7396091c-f77e-448b-adbd-dbc59406fb45","resolution":{"observed_at":"2026-08-07T05:59:31.887794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.663924Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"800ef375-1b16-4f02-b6d2-e054b9a115f2","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.522314Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:927d2e5746d790028837355597bc6b74fc17d4f5b337c30b3780c7feddf9e69e","observation_id":"0434e761-0c96-4fda-9833-7318bb7ef5d8","resolution":{"observed_at":"2026-08-07T05:59:31.742129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.412705Z","title":"Roi-based robotic grasp detection for object overlapping scenes","venue":null,"work_id":"a0b1b997-3174-4572-affe-67c4a2b446b1","year":2019},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.630514Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:edcabebd2ee887964fc4aa485cd84079627821a49d2f83fd890c7ba8f4d52c28","observation_id":"98014d88-fc38-407f-8456-6851306eaac8","resolution":{"observed_at":"2026-08-07T05:59:31.517765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T05:59:29.719733Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.719733Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4d5c4827c697acf14d24bb7db83c9814e41f92c92905cb6808d627600dd83eee","observation_id":"6c734f9e-ea84-4ac8-a2e5-80d9356fc318","resolution":{"observed_at":"2026-08-07T05:59:29.719733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.184219Z","title":"Language-guided cat- egory push–grasp synergy learning in clutter by efficiently perceiving object manipulation space","venue":null,"work_id":"50175d0b-9800-4055-a29c-1eccbc40b05b","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.848669Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:2ea3449de45439c81cfac2a81f50830645a3f7eac2c6ed96ed3ce4199dfe48f6","observation_id":"37f2c474-a2c0-495b-ac14-5ce4b1aac357","resolution":{"observed_at":"2026-08-07T05:59:31.296924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:30.962332Z","title":"Vlmpc: Vision-language model pre- dictive control for robotic manipulation","venue":null,"work_id":"f740c174-6e31-4c3d-8ae2-72af8d0376e1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.952184Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ea44b94e66163139ac0cacd8e4b2a0396d4e3a0b2099195eec451576c78839a9","observation_id":"ea22c6f7-ecd9-47cf-af37-89e8b7bf70da","resolution":{"observed_at":"2026-08-07T05:59:31.051808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:30.715950Z","title":"Grasping detection network with uncertainty estima- tion for confidence-driven semi-supervised domain adapta- tion","venue":null,"work_id":"2daccd13-e579-4576-a059-c4c4749b677f","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:30.182455Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e8bb937e1736794763fa1a04a4664575875a34c266658e2bf3cf224c5985d0e7","observation_id":"e4fa7e13-3078-47fa-8767-b217232b7b8e","resolution":{"observed_at":"2026-08-07T05:59:30.848781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 2 inbound Pith citation observations for arXiv:2506.06535."}