{"as_of":"2026-08-08T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4a8bcc18a82d6929e8ed2b622bdac834c8fb088fef0288b7439df0f39ae1358","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:47:45.226599Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T12:52:15.138790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:53:17.415884Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"cited_work":{"arxiv_id":"2506.20757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convitac: Aligning visual- tactile fusion with contrastive representations","venue":null,"work_id":"bb56fd0e-c3b4-4dc2-8c98-01541cfc0192","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-02T12:21:23.782064Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2506.20757","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:1d367cbfce31d4bc886fd3a17fa3e81c6b75c13c03abcc6b7d9dffb27b4000ca","observation_id":"c06afac8-7083-4411-baa8-72f1f7235935","resolution":{"observed_at":"2026-05-20T12:53:17.418098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20757/citation-record","integrity":"/paper/2506.20757/integrity","json":"/paper/2506.20757/citation-record.json","paper":"/paper/2506.20757"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:48.450933Z","title":"The objectfolder benchmark: Multisensory learning with neural and real objects,","venue":null,"work_id":"ecd16835-b9cc-4938-8a39-3e05be652d05","year":2023},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:41.983648Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:13fb426b6ff459460809ab23695cb277884db7b2caa5713b1a232cfd580c19eb","observation_id":"a2dbe33b-d4a9-4342-a152-74f7379a3cd3","resolution":{"observed_at":"2026-08-06T22:47:48.530388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:42.042535Z","title":"Robotic tactile perception of object properties: A review,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.042535Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:4fd4cab32d342f609c051439907201eb2388336e884e90d0b466fe9c175ee4cb","observation_id":"4da439d4-45c3-426e-9b5f-4cbab7ba9f81","resolution":{"observed_at":"2026-08-06T22:47:42.042535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:48.310017Z","title":"Deep domain adaptation regression for force calibration of optical tactile sensors,","venue":null,"work_id":"a6beaed2-2b72-4d19-87b6-54f13d7aec4c","year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.108192Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:37751f00d7e1a6b4d4c1d9aded936b81755e0b1b44cc58de83edd4dcd5923eff","observation_id":"4154fa40-a8a9-4c4e-acb7-d99e1b294349","resolution":{"observed_at":"2026-08-06T22:47:48.371959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:48.179801Z","title":"The feeling of success: Does touch sensing help predict grasp outcomes?","venue":null,"work_id":"4ab71e1d-24d4-4ef5-9a6b-97d90684ae8e","year":2017},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.160106Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:35d9e5e5fd2a555a0f297cbacd4c61d0f95f573fb8dc728aeefb1954031be5e5","observation_id":"f520930e-25ab-4f94-8a02-e95d851df094","resolution":{"observed_at":"2026-08-06T22:47:48.247438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:48.029282Z","title":"Spatio-temporal attention model for tactile texture recognition,","venue":null,"work_id":"2797a643-fb97-4c0e-8e7e-f399078b7a32","year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.288000Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:4d09ffbe7be39796306e282ca6b030fad5c9ea5abc2d6e8594628ca1e8cacbcb","observation_id":"edc4bb20-8b94-496a-a9f9-77f94d135ff3","resolution":{"observed_at":"2026-08-06T22:47:48.114054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12024","last_updated":"2024-01-22T15:11:57Z","snapshot_observed_at":"2026-08-04T12:25:17.068585Z","submitted_at":"2024-01-22T15:11:57Z","title":"Multimodal Visual-Tactile Representation Learning through Self-Supervised Contrastive Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12024","snapshot_observed_at":"2026-08-06T22:47:42.351404Z","title":"Multimodal visual-tactile rep- resentation learning through self-supervised contrastive pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.351404Z"},"links":{"cited_paper":"/paper/2401.12024","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:e4a2cb613981347b08f22f4d2acea25c6797f4e037ff98c8e705a60b7e8d2792","observation_id":"277a0eba-7f2b-4917-8425-ffd971fa4dea","resolution":{"observed_at":"2026-08-06T22:47:42.351404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.887719Z","title":"Vitac: Feature sharing between vision and tactile sensing for cloth texture recognition,","venue":null,"work_id":"51daebfa-7a80-4957-9d03-c71648d8fc92","year":2018},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.441201Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:430e364154fd42f839e5974f12ad1c0ed4379d1876ca95e15c41f86449c6ec4f","observation_id":"6afc803a-f56e-4201-82ed-1c0a607cfcaa","resolution":{"observed_at":"2026-08-06T22:47:47.957776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:42.536949Z","title":"Gelsight: High-resolution robot tactile sensors for estimating geometry and force,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.536949Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:d003f9b1135fb1e36b6d12efea828144c2d55e8f12b7ffdb1acef33c87a1d87d","observation_id":"1a79521f-a2b5-4693-ae2a-35fa4ef736d8","resolution":{"observed_at":"2026-08-06T22:47:42.536949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.751400Z","title":"Geltip: A finger-shaped optical tac- tile sensor for robotic manipulation,","venue":null,"work_id":"52c3e3e3-0af6-42c2-9d0e-8458b2bc73cf","year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.616582Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:a8ae8db96008f77f24ea7e64e75e88c87f51e1ebb5c4979a6e02accee905cec5","observation_id":"1e81ef4f-8dd5-4088-912e-a1d52e5782ee","resolution":{"observed_at":"2026-08-06T22:47:47.793020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00595","last_updated":"2021-02-28T19:21:34Z","snapshot_observed_at":"2026-08-08T11:55:31.673551Z","submitted_at":"2021-02-28T19:21:34Z","title":"TouchRoller: A Rolling Optical Tactile Sensor for Rapid Assessment of Large Surfaces","version":1},"cited_work":{"arxiv_id":"2103.00595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.00595","snapshot_observed_at":"2026-08-06T22:47:45.606152Z","title":"TouchRoller: A Rolling Optical Tactile Sensor for Rapid Assessment of Large Surfaces","venue":"cs.RO","work_id":"9efce476-505f-4954-aff1-c516139e8f7c","year":2021},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.696229Z"},"links":{"cited_paper":"/paper/2103.00595","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:1213cbf24e69e9a312e43109894f1dc8e008affac66ec30c2368e472bea855df","observation_id":"c5e5deb8-56ed-4fb3-8588-be017b34e46a","resolution":{"observed_at":"2026-08-06T22:47:45.654026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:42.822767Z","title":"Self-attention based visual-tactile fusion learning for predicting grasp outcomes,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.822767Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:628af10c0b3a7ba9f8aafc114e9f5d3834ff4879cb589faef1ce44ec156e8260","observation_id":"7a537dac-b045-47d4-9ab7-91796330a325","resolution":{"observed_at":"2026-08-06T22:47:42.822767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.604541Z","title":"Touch and go: Learning from human-collected vision and touch,","venue":null,"work_id":"ac9bd7ec-4235-4320-81ee-40041e106207","year":2022},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:42.915679Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:bac9d1a32208732ffcabd1630b4c9ec2012896ab8dcf84238d757277a8ea6f4a","observation_id":"bfea05a0-45bb-440d-b8d0-ebf764fb2b5f","resolution":{"observed_at":"2026-08-06T22:47:47.666861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13042","last_updated":"2023-07-31T17:47:27Z","snapshot_observed_at":"2026-07-06T13:56:34.336341Z","submitted_at":"2022-09-26T21:50:39Z","title":"Self-Supervised Visuo-Tactile Pretraining to Locate and Follow Garment Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13042","snapshot_observed_at":"2026-08-06T22:47:43.020932Z","title":"Self-supervised visuo-tactile pretraining to locate and follow garment features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.020932Z"},"links":{"cited_paper":"/paper/2209.13042","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:5085dd3e639985724e7c5d93f0ae7251c08fd267393385c58d4f5299b767d88a","observation_id":"5ed7388f-1502-4e34-a916-254c4ab1ec05","resolution":{"observed_at":"2026-08-06T22:47:43.020932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.480934Z","title":"Multisensory integration: How visual experience shapes spatial perception,","venue":null,"work_id":"20c60c89-e674-49ef-a25f-a4473208971d","year":2004},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.126146Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:05bee473eefb9e9031cb7400843f8084378b8f837513b830ed411f88a8a1467a","observation_id":"4c423e40-77c8-47bd-b4e6-86222056ff5e","resolution":{"observed_at":"2026-08-06T22:47:47.538582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.379658Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"402779c6-276e-487c-864e-0d2d855026a6","year":2021},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.234130Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:a85a38bd2337cea7337ba8a762eeeb91a327c63f1f735c54c7a9672b04025246","observation_id":"fecdef0c-f844-4c2a-93b1-70f248893e7c","resolution":{"observed_at":"2026-08-06T22:47:47.420916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:43.342993Z","title":"A simple frame- work for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.342993Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:d55a10406ad66c71a7b55cf3f39d562c9c8f6b4802ee76688d5997aa770e7a6e","observation_id":"9fe73797-e9b0-42da-85fb-d504923d5cb2","resolution":{"observed_at":"2026-08-06T22:47:43.342993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09870","last_updated":"2025-02-26T02:00:29Z","snapshot_observed_at":"2026-08-02T07:50:26.806015Z","submitted_at":"2024-09-15T21:28:41Z","title":"TransForce: Transferable Force Prediction for Vision-based Tactile Sensors with Sequential Image Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09870","snapshot_observed_at":"2026-08-06T22:47:43.488139Z","title":"Transforce: Transferable force prediction for vision-based tactile sensors with sequential image translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.488139Z"},"links":{"cited_paper":"/paper/2409.09870","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:1e278991568cc24c2d54c593d8081c29d41df1fa40e0c0953b60e1073afe985d","observation_id":"77264659-08b8-4501-a9ac-e35cdfdabde9","resolution":{"observed_at":"2026-08-06T22:47:43.488139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.240766Z","title":"Learning continuous grasp stability for a humanoid robot hand based on tactile sensing,","venue":null,"work_id":"4738bcf6-8169-4c4b-b9d7-91c28a90df9c","year":2012},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.601123Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:ae33888d99a6f9cfc35673014e7f97b12a5555ffd903c2a4f01c67336fec0101","observation_id":"209146a6-735f-48e4-a417-f406356d5e28","resolution":{"observed_at":"2026-08-06T22:47:47.295965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:43.736262Z","title":"Visuo-tactile transformers for manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.736262Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:7050e6b93ef145102e62c666b4d6ecbfcf739ab0b7e6374e106e957b1f010e48","observation_id":"acb6eae7-dcae-46a7-b277-dbda8000389a","resolution":{"observed_at":"2026-08-06T22:47:43.736262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:47.072261Z","title":"Contrastive multimodal fusion with tupleinfonce,","venue":null,"work_id":"bccf886e-bb32-4b9b-8b5b-2332d97f87c7","year":2021},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.846608Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:3c6973b78573e1710907b7bf0511894ee0aa470659183b58620c4f65fd4ea136","observation_id":"34c90ca0-09da-47ac-b1b9-3a46c6a3f1a6","resolution":{"observed_at":"2026-08-06T22:47:47.138633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T22:47:43.932874Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:43.932874Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:94a5c2a47d3c0813157a34d0afa3194595bdc73c2bb053b5e05a824d49433dec","observation_id":"4e0d04e6-a7da-4f75-bf9a-66dbd6ece3e3","resolution":{"observed_at":"2026-08-06T22:47:43.932874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:44.016226Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.016226Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:135351f942186948ebbcfb65f14e5f4a122af0621a4bacaf6c0b222e2116bcf3","observation_id":"96e95bd5-fecf-4862-aa4f-412e83c8d28a","resolution":{"observed_at":"2026-08-06T22:47:44.016226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:46.943191Z","title":"Binding touch to everything: Learning unified multimodal tactile representations,","venue":null,"work_id":"ea7fb04d-8710-4b06-bad1-46d977b9bf2c","year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.126289Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:84338a43e661970f97389b1c6f4771fecf51c2c58acd7a0e0054c89765ef9920","observation_id":"4399acf3-4313-4f3e-8a82-550143f4b944","resolution":{"observed_at":"2026-08-06T22:47:46.979552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:44.205254Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.205254Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:75a8d89233396abf8a34f0619e3dd27b45110d2d38babca0de94fc49c3fee382","observation_id":"604c3d6b-cc03-4bfe-86e7-1876adb6feb8","resolution":{"observed_at":"2026-08-06T22:47:44.205254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:44.257788Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.257788Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:803a7577ddc66d999c87bc8dfbf259e6b5a05dcb66fe013216aed8f85ae1d912","observation_id":"bcf0d628-84e7-4567-8b88-0153adc2d775","resolution":{"observed_at":"2026-08-06T22:47:44.257788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:46.641576Z","title":"S 3m- net: Joint learning of semantic segmentation and stereo matching for autonomous driving,","venue":null,"work_id":"c1202343-f54f-44fe-8b19-d72086c04daf","year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.368680Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:02e090fb21c6b69d8b458bc695c69740bb631282f9cdf9f2e91596cf78d6e033","observation_id":"370b9bfd-4228-467e-b109-830a7d19d7c1","resolution":{"observed_at":"2026-08-06T22:47:46.785858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:46.354338Z","title":"Sg- roadseg: End-to-end collision-free space detection sharing encoder representations jointly learned via unsupervised deep stereo,","venue":null,"work_id":"ec9d64a4-47d3-4061-88f4-5123ddc93356","year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.475352Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:6c262573fb22c0aedc992dcf38ddfc00d6c51c1df53ac0f973442e3d9346c1f1","observation_id":"f4bebb64-4940-4939-a984-b952d7bff1b3","resolution":{"observed_at":"2026-08-06T22:47:46.460813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:44.592287Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.592287Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:d4182fb12c5d4a56327bc64a966802567a88c5fe2de55cffc419e095319cff81","observation_id":"9746fc29-52e7-43bb-ad21-6aecfcf96e4b","resolution":{"observed_at":"2026-08-06T22:47:44.592287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08005","last_updated":"2025-03-12T03:56:38Z","snapshot_observed_at":"2026-08-08T03:40:52.088637Z","submitted_at":"2025-03-11T03:08:43Z","title":"CDI3D: Cross-guided Dense-view Interpolation for 3D Reconstruction","version":2},"cited_work":{"arxiv_id":"2503.08005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08005","snapshot_observed_at":"2026-08-06T22:47:45.377664Z","title":"CDI3D: Cross-guided Dense-view Interpolation for 3D Reconstruction","venue":"cs.CV","work_id":"3e5ca46d-16a8-475d-a3f8-fca4ea9ae3fb","year":2025},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.668987Z"},"links":{"cited_paper":"/paper/2503.08005","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:4cbcfe9809e83c690f37fa18005ec62c399df278cfb8cf78f41b78985813a814","observation_id":"6050e495-9d76-49cc-8835-4ef550030496","resolution":{"observed_at":"2026-08-06T22:47:45.452456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T22:47:44.736918Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.736918Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:5425db21495d78867f82574d4e1291c9857bdc7a319760900db12de95c6799b3","observation_id":"2f76bac4-72bc-4363-ab31-105ee86d963f","resolution":{"observed_at":"2026-08-06T22:47:44.736918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T22:47:44.818022Z","title":"Adam: A method for stochastic optimiza- tion,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.818022Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:552bd1a8ee12fe2cd32c230e35f6bbdb245fe9cf90e6d0245a5cfffd38677640","observation_id":"2a1bb092-e85e-4dc5-bc38-0a6b68b2f7e2","resolution":{"observed_at":"2026-08-06T22:47:44.818022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:44.938411Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:44.938411Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:2027d59838c40a2e34cef04f5639879af54d2843e7c1306fe68ab80d9cc1be32","observation_id":"a484fe48-fcb4-4b23-a25e-a1833cb1e7d8","resolution":{"observed_at":"2026-08-06T22:47:44.938411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:46.097363Z","title":"Two-dimensional pca: a new approach to appearance-based face representation and recognition,","venue":null,"work_id":"e1ae91a8-3e71-4d32-81b6-4d27488cd97b","year":2004},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:45.024772Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:9ecc2e7e753966f1a8fabd96797871f2f317f2f8cb9dc08a4ecdc5ae4d86b003","observation_id":"6fc08bea-2af6-445f-b57e-f9346f54b3b7","resolution":{"observed_at":"2026-08-06T22:47:46.207111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:45.797155Z","title":"Learning deep multimodal feature representation with asymmetric multi-layer fusion,","venue":null,"work_id":"32a6c77f-ddd9-44d6-9dd2-8b6f3471fff6","year":2020},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:45.135455Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:68a228a0f50d0c821d22d64b9297fd47c11ebaa3618836bff233371a797ae474","observation_id":"39b5e1df-51b7-47c5-92d7-ed1f48250906","resolution":{"observed_at":"2026-08-06T22:47:45.949918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:45.226599Z","title":"Multimodal zero- shot learning for tactile texture recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:45.226599Z"},"links":{"citing_paper":"/paper/2506.20757"},"observation_digest":"sha256:34a4e877d0c28fd266bf83d0563af41d8f2eb1846b67b2af1461abdbecf08bc2","observation_id":"bc42c198-51b5-42c7-9bcf-e870d74da517","resolution":{"observed_at":"2026-08-06T22:47:45.226599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:40:17.546583Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2506.20757."}