{"as_of":"2026-08-19T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e9328b9bb183e74127e6db32a4973d0419a6cff1637b2e289dda9f606bfa5d8","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:53:06.792201Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T12:52:15.138790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:53:17.381905Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"cited_work":{"arxiv_id":"2501.00510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00510","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vint-6d: A large-scale object-in-hand dataset from vision, touch and proprioception","venue":null,"work_id":"b238212e-b146-4a5e-893a-4822a0bdc845","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2501.00510","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:4518dbdba229149aef61099458ed485b668f19c012416efb0793f08b85e233b1","observation_id":"afef0867-5d2e-4ce2-a4c5-4c8db5e74efc","resolution":{"observed_at":"2026-05-20T12:53:17.383723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00510/citation-record","integrity":"/paper/2501.00510/integrity","json":"/paper/2501.00510/citation-record.json","paper":"/paper/2501.00510"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.249707Z","title":"https://polyhaven.com","venue":null,"work_id":"9f2fb489-4d31-42dd-bec5-82363e3e1380","year":2024},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.698629Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:4891c2643d3bc332677ae0b291cfdc5054b7d4dbea2332227ee97bd7473109ee","observation_id":"666a7316-de87-41b1-bcba-d6cd65a08b5d","resolution":{"observed_at":"2026-08-10T22:53:07.254902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13469","last_updated":"2023-12-20T22:36:37Z","snapshot_observed_at":"2026-08-18T02:28:58.143175Z","submitted_at":"2023-12-20T22:36:37Z","title":"Neural feels with neural fields: Visuo-tactile perception for in-hand manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13469","snapshot_observed_at":"2026-08-10T22:53:06.726354Z","title":"Neural feels with neural fields: Visuo-tactile perception for in-hand manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.726354Z"},"links":{"cited_paper":"/paper/2312.13469","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:25de658b28f0571cf1b180dc7fcd99f76fe2ed67244e29e6b93804a10682cccb","observation_id":"4acd3479-055d-43d4-85b6-d4afd9523ad3","resolution":{"observed_at":"2026-08-10T22:53:06.726354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.171953Z","title":"In the upper row, we have an AllegroHand equipped with whole-hand tactile sensors, while in the lower row, we have a Trx-hand with sensors","venue":null,"work_id":"21f21cdb-4e02-43a0-afa4-922c9e9e79cc","year":2023},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.754284Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:eb5e2f161c54a68cedc9a0939b13754c1e07d960eea0cbcf748d3eaaa115bc60","observation_id":"8d10f87b-96ce-4ea5-93a8-3babc0353160","resolution":{"observed_at":"2026-08-10T22:53:07.177228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00464","last_updated":"2023-04-04T03:05:50Z","snapshot_observed_at":"2026-08-16T15:43:27.956578Z","submitted_at":"2023-04-02T06:32:19Z","title":"UniDexGrasp++: Improving Dexterous Grasping Policy Learning via Geometry-aware Curriculum and Iterative Generalist-Specialist Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00464","snapshot_observed_at":"2026-08-10T22:53:06.740556Z","title":"Unidexgrasp++: Improving dexterous grasping policy learning via geometry-aware curriculum and iterative generalist-specialist learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.740556Z"},"links":{"cited_paper":"/paper/2304.00464","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:3f90a2af963c15a66012ae7177a8afb6634c491898d3222cebf58a02eb09cbfb","observation_id":"69100ff1-03ec-41e5-8129-205e4215c038","resolution":{"observed_at":"2026-08-10T22:53:06.740556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.187251Z","title":null,"venue":null,"work_id":"2c860247-f3b2-4016-ab17-307db2fda47f","year":2020},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.745215Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:04d25a085c39f5de63a836dee1f55b0ee8c4fed28fe4886dba303430c9102897","observation_id":"ca5ae062-b5ab-4263-b851-9f58a562b093","resolution":{"observed_at":"2026-08-10T22:53:07.192113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00199","last_updated":"2018-05-26T07:34:09Z","snapshot_observed_at":"2026-08-15T01:40:54.703697Z","submitted_at":"2017-11-01T04:10:58Z","title":"PoseCNN: A Convolutional Neural Network for 6D Object Pose Estimation in Cluttered Scenes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00199","snapshot_observed_at":"2026-08-10T22:53:06.749871Z","title":"Posecnn: A convolutional neural network for 6d object pose estima- tion in cluttered scenes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.749871Z"},"links":{"cited_paper":"/paper/1711.00199","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:7968d9c3d44a0a9468a799cd47a4d6fda519f70f8849a3a7f9e46007caeef5e3","observation_id":"928556ce-6dc1-44c0-b2d1-9c3b5e5fc05d","resolution":{"observed_at":"2026-08-10T22:53:06.749871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.158138Z","title":"(2) (Dikhale et al., 2022; Li et al., 2023; Rezazadeh et al.,","venue":null,"work_id":"a1d74564-e3b5-4463-8147-de8240b75265","year":2022},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.759114Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:3b21cdf7a14c169071433a5c5454c0f2ab47c129b55b301327a479578f780783","observation_id":"91e95be2-3494-44dc-a554-9d2d4b9ceb71","resolution":{"observed_at":"2026-08-10T22:53:07.162629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.142706Z","title":null,"venue":null,"work_id":"490afea2-d511-4c64-93d5-e68de32f22dc","year":2012},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.763702Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:b403bb6eaed72f54ae98795de512e6a47725a1c68062ce45d22739f6a007c512","observation_id":"adac323f-a0ae-4eb5-aafc-8ab872d35186","resolution":{"observed_at":"2026-08-10T22:53:07.148525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.128067Z","title":"However, these approaches often do not address the critical aspect of stable holding in hand and readiness for manipulative actions, which are key focuses of our research","venue":null,"work_id":"2e70d888-9787-4249-bfa6-efd35c774e56","year":2023},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.768472Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:da9f62f671c7bbcc3daa4c0fb632389287f911d67709f317ccd2b56a23c8d51e","observation_id":"be2256af-2e51-4c3e-8400-967e3cd1160f","resolution":{"observed_at":"2026-08-10T22:53:07.133016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.113581Z","title":"We present a set of photo-realistic rendered images that depict objects held in hand","venue":null,"work_id":"9ff50818-a02a-4894-a632-7bb8b0c27d3b","year":2021},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.772581Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:388945b9746f8b9ffd1f2c0ef2b6ee06bb986fab5e280c067d03e47fc2493f64","observation_id":"d3c566f5-8399-428a-8d18-231e994527b5","resolution":{"observed_at":"2026-08-10T22:53:07.118350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.098576Z","title":"The motion capture system accurately captures the poses of the object, hand, and robot base","venue":null,"work_id":"8969bbce-c538-4408-9215-b1e8e6840d75","year":2014},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.777561Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:d489b98a5a772c3cd2b09be77f794d8644748975057d1768134ae0d9d0550c24","observation_id":"31be5084-c1a9-4bdb-bc07-3f301224d834","resolution":{"observed_at":"2026-08-10T22:53:07.103785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.054615Z","title":null,"venue":null,"work_id":"d572572b-6864-49a0-925b-19fc84e402a5","year":2017},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.792201Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:d6ef2b0835c457feeae5087e3ad503e4927685592dd18b6d214981a677339392","observation_id":"d21fa7be-229a-4e38-ba5a-e9b952afb8c6","resolution":{"observed_at":"2026-08-10T22:53:07.059212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.084057Z","title":"After distortion correction, we reproject the depth image into the right camera’s frame, resulting in two well-aligned vision images with resolutions of 640 x 400,","venue":null,"work_id":"1fbdac42-3552-4e79-91e0-eb798dc2183b","year":2023},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":565,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.782168Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:18ffde5d4d7963601abc9720ad2999c166fbab7c19c3c5fa66e34ac666989a97","observation_id":"5ec26a06-1034-4ae4-b4e8-aceab0e66bff","resolution":{"observed_at":"2026-08-10T22:53:07.089123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10685","last_updated":"2022-03-21T00:35:46Z","snapshot_observed_at":"2026-08-16T17:13:09.217600Z","submitted_at":"2022-03-21T00:35:46Z","title":"Tactile Pose Estimation and Policy Learning for Unknown Object Manipulation","version":1},"cited_work":{"arxiv_id":"2203.10685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10685","snapshot_observed_at":"2026-08-10T22:53:07.040499Z","title":"Tactile Pose Estimation and Policy Learning for Unknown Object Manipulation","venue":"cs.RO","work_id":"a3c3a9ff-3e92-41ca-b835-6ecc3423200a","year":2022},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.703397Z"},"links":{"cited_paper":"/paper/2203.10685","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:39aacf5720d3de4b4ff4ef961160c5f59cee4fb0941bd6af7e6134b789b6adcc","observation_id":"810b5c62-ac58-4dda-98d5-58095b25e236","resolution":{"observed_at":"2026-08-10T22:53:07.045312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.220226Z","title":"Learning a state estimator for tactile in-hand manipulation","venue":null,"work_id":"55a031bd-876f-4b34-990a-d71d35da45d4","year":2022},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.717746Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:49aa1e98c388f48dfdd420e9e087cdcf5b2c435bd48c74ad32780e5ef6394035","observation_id":"d576de0d-1f54-4f60-856f-5ab6706f43e6","resolution":{"observed_at":"2026-08-10T22:53:07.225242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.204341Z","title":"Smith, E., Calandra, R., Romero, A., Gkioxari, G., Meger, D., Malik, J., and Drozdzal, M","venue":null,"work_id":"8d84507b-4982-40ef-b2ff-16da07938006","year":2020},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.722087Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:9a6f97f74b9dd9494263ffaa5dafa2c03b6452f6b03f6b41a4a53d7f2a58ad24","observation_id":"63c9aa5e-7acd-4e44-a150-d0f10b2ef7ac","resolution":{"observed_at":"2026-08-10T22:53:07.208955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.068717Z","title":"However, we believe that simply sticking markers on objects may not yield high-quality pose data due to the uncertainty in marker positions relative to the object frame","venue":null,"work_id":"4f1ef80d-afe6-415a-b481-5fb04d0c9c4f","year":2022},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.787336Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:8d23ed7b6da19ef412ad059caaf0204be6aceca2ce342fd71c8b83dcc67d614e","observation_id":"7e6c5da5-4bb0-47f4-a421-f26a0cbea85c","resolution":{"observed_at":"2026-08-10T22:53:07.073368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:53:07.236010Z","title":"Tracking object’s pose via dynamic tactile interaction","venue":null,"work_id":"d846dca9-c91a-4348-9d65-1dd9f7d367da","year":2023},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.713303Z"},"links":{"citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:de71b31ca19d4f2f86b56423f8aeb42c425396c8c726d67dd3712ad2d34ccd44","observation_id":"e2afa834-ffef-4175-9a8e-30ee7089598c","resolution":{"observed_at":"2026-08-10T22:53:07.240535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04523","last_updated":"2023-04-10T11:38:52Z","snapshot_observed_at":"2026-08-16T15:41:36.741646Z","submitted_at":"2023-04-10T11:38:52Z","title":"PoseFusion: Robust Object-in-Hand Pose Estimation with SelectLSTM","version":1},"cited_work":{"arxiv_id":"2304.04523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.04523","snapshot_observed_at":"2026-08-10T22:53:06.986907Z","title":"PoseFusion: Robust Object-in-Hand Pose Estimation with SelectLSTM","venue":"cs.RO","work_id":"97182a7a-faed-45c5-9c6a-7ec07e68efdf","year":2023},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.730772Z"},"links":{"cited_paper":"/paper/2304.04523","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:0c00c312dff607b5263aaf9ee09679271a27a0fdb032cdcdced029e5138b9351","observation_id":"cf1e99c9-ea1f-4a0e-a11e-7f4f460dad33","resolution":{"observed_at":"2026-08-10T22:53:06.995626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T22:53:06.708310Z","title":"C., Lo, W.-Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.708310Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:0f89a7b6b1c9058db38f445d2ff1f15e9aabbfd1ecf7cb171af9b489f48cacf7","observation_id":"a29da9b6-3d7b-4ecf-b7f1-33f0ffd39a62","resolution":{"observed_at":"2026-08-10T22:53:06.708310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08132","last_updated":"2023-06-13T20:54:07Z","snapshot_observed_at":"2026-08-16T15:24:09.682745Z","submitted_at":"2023-06-13T20:54:07Z","title":"Fast-Grasp'D: Dexterous Multi-finger Grasp Generation Through Differentiable Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08132","snapshot_observed_at":"2026-08-10T22:53:06.735353Z","title":"Fast-grasp’d: Dexterous multi-finger grasp gener- ation through differentiable simulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:06.735353Z"},"links":{"cited_paper":"/paper/2306.08132","citing_paper":"/paper/2501.00510"},"observation_digest":"sha256:fc915bf4ff60fbf3bbef30c8d7b85b87ec289f21d1694c4ec7c9bdb5b5e572aa","observation_id":"80f6faa6-7224-4f0f-a8cf-4349805614c6","resolution":{"observed_at":"2026-08-10T22:53:06.735353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2501.00510."}