{"as_of":"2026-08-20T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b34bffeec4faf8f9e6167a2a261d98f66ec0a2de0949874f9bbd3132a26f1ce","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T12:52:15.138790Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T08:56:16.261660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17336","snapshot_observed_at":"2026-07-31T08:56:16.261660Z","title":"Tactile-BasedMultimodalFusionin Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28391","last_updated":"2026-07-30T15:47:01Z","snapshot_observed_at":"2026-08-19T04:15:45.719019Z","submitted_at":"2026-07-30T15:47:01Z","title":"TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction","version":1},"reference_index":3307,"source":"pdf_text","source_observed_at":"2026-07-31T08:56:16.261660Z"},"links":{"cited_paper":"/paper/2605.17336","citing_paper":"/paper/2607.28391"},"observation_digest":"sha256:58eef22f82795de6823ff6adae8655ff229ad38f25e9b2652275e159628c4890","observation_id":"8bb4da49-7a63-44f1-a5c3-543fd3315938","resolution":{"observed_at":"2026-07-31T08:56:16.261660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17336/citation-record","integrity":"/paper/2605.17336/integrity","json":"/paper/2605.17336/citation-record.json","paper":"/paper/2605.17336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal visual- tactile representation learning through self-supervised con- trastive pre-training","venue":null,"work_id":"04c236d0-ac6e-46ce-8a7b-da2ad919dfed","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:364d373e18c9521103d300f889e6c9f243460dea5d7b8372e4eb6bcd26b0e4ce","observation_id":"73b197c5-73c6-4e9d-93e1-e22169c2f196","resolution":{"observed_at":"2026-05-20T12:53:18.313189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bind- ing touch to everything: Learning unified multimodal tactile representations","venue":null,"work_id":"07c2df44-5095-4e25-80a7-7af40e6a7f7f","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:9749104aad37a32787713b50807f0b8d5f52fc67d866f8ceeb06861bfedf696b","observation_id":"adf387c3-8eda-4de0-aa5f-9ee7ba3ee031","resolution":{"observed_at":"2026-05-20T12:53:18.332574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13232","last_updated":"2024-02-20T18:47:56Z","snapshot_observed_at":"2026-08-20T08:51:18.943770Z","submitted_at":"2024-02-20T18:47:56Z","title":"A Touch, Vision, and Language Dataset for Multimodal Alignment","version":1},"cited_work":{"arxiv_id":"2402.13232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13232","snapshot_observed_at":"2026-07-03T09:47:59.675659Z","title":"A touch, vision, and language dataset for multimodal alignment","venue":null,"work_id":"d31525ce-36e3-4896-a8b7-06ca37ff822c","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2402.13232","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:868033f6a2bd0bdaa2877f560a183d77d34a555e609643d2fdffa15549a77050","observation_id":"2b9098bd-d404-46b5-8fe2-18a1a02738fa","resolution":{"observed_at":"2026-05-20T12:53:17.469458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09813","last_updated":"2024-06-17T13:19:26Z","snapshot_observed_at":"2026-08-16T14:09:41.426910Z","submitted_at":"2024-03-14T19:01:54Z","title":"Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset","version":3},"cited_work":{"arxiv_id":"2403.09813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09813","snapshot_observed_at":"2026-07-01T10:35:41.328785Z","title":"Towards comprehensive multimodal perception: Introducing the touch- language-vision dataset","venue":null,"work_id":"f3dc5b11-33ff-4460-b243-2a4214c83e94","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2403.09813","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:7425a85a0deb9fb6bfcc7a03b3edb8aa43b150356716c886720ead20f5ac3517","observation_id":"6ba9885e-dfb5-41ea-9ee5-fdb1faf2e382","resolution":{"observed_at":"2026-05-20T12:53:17.444946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08194","last_updated":"2025-05-13T03:02:36Z","snapshot_observed_at":"2026-08-15T21:58:54.721464Z","submitted_at":"2025-05-13T03:02:36Z","title":"CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding","version":1},"cited_work":{"arxiv_id":"2505.08194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.08194","snapshot_observed_at":"2026-07-01T10:05:40.676725Z","title":"Cltp: Contrastive language- tactile pre-training for 3d contact geometry understanding","venue":null,"work_id":"86937181-ff85-4092-9c65-4fea9f7664a2","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.08194","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:6c5d46128d541388805d1b0165eda47e23a82c070377388f5259624d9aa5bfb8","observation_id":"f713ced7-563e-4082-9f38-a98503453aac","resolution":{"observed_at":"2026-05-20T12:53:17.441507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Touch100k: A large-scale touch-language-vision dataset for touch-centric multimodal representation","venue":null,"work_id":"d8521c0e-886d-4335-9616-a719446b4dcd","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:173f9850800e861fae55550cd776f12dd0e202034041d8437a70bad44ed66117","observation_id":"b0b65d4d-e417-4d76-bf5c-82aa7c0b8a5c","resolution":{"observed_at":"2026-05-20T12:53:18.261989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09577","last_updated":"2025-05-14T17:29:35Z","snapshot_observed_at":"2026-08-16T01:02:50.753208Z","submitted_at":"2025-05-14T17:29:35Z","title":"VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation","version":1},"cited_work":{"arxiv_id":"2505.09577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09577","snapshot_observed_at":"2026-07-03T17:48:45.818442Z","title":"Vtla: Vision- tactile-language-action model with preference learning for insertion manipulation","venue":null,"work_id":"041b7d2c-2bd2-404b-9fd1-bba9dc42b727","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.09577","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:aef0c9cedd67ba3e89ba4612fc9c1995fdaced54dad39cae60d366c3c8185089","observation_id":"5cc4fca7-2ba3-4457-8197-de2dad359cf1","resolution":{"observed_at":"2026-05-20T12:53:17.455775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-18T03:57:22.879757Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:c4588cba43eb722707c4b0a9679a54fae6992685e1dbd94a7b58e2322ddc9a30","observation_id":"0fdca6f4-85a3-4da9-adb4-c103fec5f06d","resolution":{"observed_at":"2026-05-20T12:53:17.369400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12191","last_updated":"2025-04-01T08:17:30Z","snapshot_observed_at":"2026-08-20T09:41:05.039865Z","submitted_at":"2025-02-15T08:33:25Z","title":"AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors","version":3},"cited_work":{"arxiv_id":"2502.12191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12191","snapshot_observed_at":"2026-07-04T20:10:07.283000Z","title":"Anytouch: Learning unified static-dynamic repre- sentation across multiple visuo-tactile sensors","venue":null,"work_id":"9ad48032-b187-41aa-b4b5-f6912ef5c7a0","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2502.12191","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:b1e1fc11288c438abc62a2920c9960eeb8593459ee070d101af0918830233b18","observation_id":"053b0f1b-396c-4ab1-b1bd-ea3a3a42a4e7","resolution":{"observed_at":"2026-05-20T12:53:17.424927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vitac: Feature sharing between vision and tactile sensing for cloth texture recognition","venue":null,"work_id":"ba47c0a7-510d-4c63-b26e-f3fd4d28f66b","year":2018},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:cbe4429b90925086e0b116c5e7879663d67d65eee27f45caf44bb70041d8d626","observation_id":"2f92aeea-fef1-49d9-8b22-ff6079330066","resolution":{"observed_at":"2026-05-20T12:53:18.242822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can vision feel touch? tactile-aware visual grasping for transparent objects","venue":null,"work_id":"2afa52b4-93ba-4918-9f7b-5d614baed2f0","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:32685d43066b6520cbf4fffc2079f510142d72050e1a1d29fb596a3d1b5f8810","observation_id":"f6060e86-4763-4035-89aa-975db3b13e26","resolution":{"observed_at":"2026-05-20T12:53:18.256409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surformer v1: Transformer-based surface classification using 18 tactile and vision features","venue":null,"work_id":"90e807a3-3dd9-4d13-9be7-4cf5b0269990","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:977773b238d79abe9d12d145141dbb4ddae95e527f7e6ac621a5112813616cab","observation_id":"876a8f97-99a6-4170-ad27-e55f9a8fa318","resolution":{"observed_at":"2026-05-20T12:53:18.272654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ra- touch: Retrieval-augmented touch understanding with enriched visual data","venue":null,"work_id":"c38d1b01-5bed-44cd-8f3c-d01c8e5eb373","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:82b7f0429d22a62fcfa5c9c46c48ccc835b38d2a8944ccd44ed9d8bcbe3cb5b6","observation_id":"3123f774-dbc7-4db8-88c4-c134580d2e6d","resolution":{"observed_at":"2026-05-20T12:53:18.335353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of deep learning and its applications: a new paradigm to machine learning","venue":null,"work_id":"aeff44e3-ed24-4c24-9a31-1dbe020f2ecb","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:79651ce5bcdcf78a8722284c17171ee01105869a58f759c981d8eba1ddaa827c","observation_id":"2d1e9918-18cd-4fe4-a8ac-22a3e43ac760","resolution":{"observed_at":"2026-05-20T12:53:18.224263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:07:06.849417Z","title":"Attention is all you need","venue":null,"work_id":"4f585692-8ef8-4f20-8f75-5e0e32647d76","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:3eb3c79576c4511079b982bf797df486226c07ae8026a5765ef4595b0c069c21","observation_id":"024ce2a7-5c48-4f46-b36a-383dafab748d","resolution":{"observed_at":"2026-05-20T12:53:18.219299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:085094f430035b6d8fb87e297b9ffb27905c789e66cb06410e19fca81314b69f","observation_id":"b9daba0d-2468-4aa1-9842-3f7e6767f438","resolution":{"observed_at":"2026-05-20T12:53:17.476296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"d3036794-0a0a-48b7-87f5-8ae834e1d987","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:19d5eed8ca8cd7b114118a7464f195d366401c3ae7ea114c6e78144ac433d3b0","observation_id":"8c5af53e-3c63-4831-935e-a6b0015ab036","resolution":{"observed_at":"2026-05-20T12:53:18.226512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12779","last_updated":"2024-05-21T13:26:27Z","snapshot_observed_at":"2026-08-16T13:50:57.967064Z","submitted_at":"2024-05-21T13:26:27Z","title":"Transformer in Touch: A Survey","version":1},"cited_work":{"arxiv_id":"2405.12779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.12779","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer in touch: A survey","venue":null,"work_id":"96671afe-51da-42d5-a9fd-dba880475999","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2405.12779","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:cc38ebc9bd5190c582b66165bdd98f9c09207df73858977ee36c4fe2378c61ec","observation_id":"13763f84-16cc-469e-874b-16ebf216c2cd","resolution":{"observed_at":"2026-05-20T12:53:17.358964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tactile data generation and applications based on visuo-tactile sensors: A review","venue":null,"work_id":"a744d2c6-0b37-448c-a61e-756d428af800","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:9f45195b9e098cd38e581489b34a89ef97ef926dfae87d38765a8664aca9250c","observation_id":"4d8ed6f1-95f4-42eb-8df0-916f05e72178","resolution":{"observed_at":"2026-05-20T12:53:18.214178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"de8bcdba-266c-4358-b3e7-d80af48eadd5","year":2016},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:3aad83a67de5a2aa2297b61fee6094437a326f94c448eaa373e65a8ce65f1b3b","observation_id":"4fa798e2-829e-4e91-9529-28a09ec146d7","resolution":{"observed_at":"2026-05-20T12:53:18.216941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:7420bf9b7d555bbd5f40dc94b6c3f07a96f3862c6654f0750491909253bb85da","observation_id":"02b30ea2-6b8b-447e-ae3e-5542016dec47","resolution":{"observed_at":"2026-05-20T12:53:17.431364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"48f162a7-0f7e-4360-aed9-2b8785f9fbbb","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:6338f123fc1924b32e94ac747c211632b3017dae1fcfb067f5490e1102657874","observation_id":"3fa16c51-3ef9-4360-918e-0f31498fd5fd","resolution":{"observed_at":"2026-05-20T12:53:18.206747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:04.531897Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"0c972fd9-514c-4534-a4d4-07a79bb836a6","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:e69fd2117c1815fc38ba226579ca13eae6b18c58c338284db6e91fb94c262f80","observation_id":"55a30c0e-0784-4986-823e-f12d8a458fb9","resolution":{"observed_at":"2026-05-20T12:53:18.211914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent progress in pressure and temperature tactile sensors: principle, classification, integration and outlook","venue":null,"work_id":"8f802af4-8583-4968-869e-a56c4bd13128","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:e5157be96da1240cc370e6657f1efb306af92a9145d7078f71a90e87a99f5ee0","observation_id":"2a553c4a-33c5-49f5-8367-5d1545baf7db","resolution":{"observed_at":"2026-05-20T12:53:18.162201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classification of vision-based tactile sensors: A review","venue":null,"work_id":"4a89da43-5e48-4346-af3d-65d52deb8cb6","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:2ffac1f3fd049a7bc276967f979cfc6ede6427ca560da719b0d6a992e14cf37f","observation_id":"1670e543-c02c-4337-94df-03731d6fb6f0","resolution":{"observed_at":"2026-05-20T12:53:18.195251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tactile sensors: A review","venue":null,"work_id":"251e1b33-ec45-494f-87eb-0bc41a71abb6","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:b91d92b9dda68193fb076795de5ba08e414f96af28d04cc93d772ce67ca03b77","observation_id":"a55e4c2d-8e4f-48cb-a9a3-60d138ce9de3","resolution":{"observed_at":"2026-05-20T12:53:18.197831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent progresses on flexi- ble tactile sensors","venue":null,"work_id":"8bd17e3a-1908-422c-b668-691dad18709d","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d3371eeb8887129255ceb739576eafc19c33ba2c29b5ef35c3130fc1d6dd848b","observation_id":"e5dacb2a-2de9-4efb-b22e-c8f45905d93f","resolution":{"observed_at":"2026-05-20T12:53:18.203467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review of tactile information: Perception and action through touch","venue":null,"work_id":"b58c117a-5b04-42be-a211-f78aaa4c2c6d","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:e7a52d151e2d561b87ac65376731e0109f7ad57e88e3544f1a78f6324172de3f","observation_id":"58e2d5c0-6e37-4e9a-a7c6-318571f8119d","resolution":{"observed_at":"2026-05-20T12:53:18.200276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biomimetic tactile sensors and signal processing with spike trains: A review","venue":null,"work_id":"26ef1cdc-f6b0-4fab-afb9-38f0b806c349","year":2018},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:392bb9610d85f70eb05de7ecd4c2955f035a169afa35eb1ef237369220a7b6b0","observation_id":"8de26369-785f-4e6e-aa26-05687eef0d4a","resolution":{"observed_at":"2026-05-20T12:53:18.154933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gelsight: High- resolution robot tactile sensors for estimating geometry and force","venue":null,"work_id":"ef7a960d-b208-48d9-bd19-5f3ac5f6065e","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:9b1e521430448467c49f949d80d26e2de6bf960d470d3d7a9df8550bccd654a5","observation_id":"ac83c240-11db-4286-b9ae-8071b23269a5","resolution":{"observed_at":"2026-05-20T12:53:18.186907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Digit: A novel design for a low-cost compact high-resolution tactile sensor with application to in-hand manipulation","venue":null,"work_id":"085a01bb-19b9-4ebc-93b1-dbd660a2794c","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:374dd7f2101cd9a1ea797ef651cb05878ed9b38795cd9024cc13fadfcda40f3c","observation_id":"154c7375-7705-4291-8b9a-f76092fc3eea","resolution":{"observed_at":"2026-05-20T12:53:18.179856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06211","last_updated":"2022-02-13T05:14:22Z","snapshot_observed_at":"2026-08-16T17:21:43.142585Z","submitted_at":"2022-02-13T05:14:22Z","title":"Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution","version":1},"cited_work":{"arxiv_id":"2202.06211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06211","snapshot_observed_at":"2026-06-29T19:03:51.592757Z","title":"Tac3d: A novel vision- based tactile sensor for measuring forces distribution and estimating friction coefficient distribution","venue":null,"work_id":"f31ffff6-1e66-465a-a1f2-49425373bb63","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2202.06211","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d55374e91899ca536cea7fbc0ecddcddd8617ce481403718003b611c136d0b59","observation_id":"25da002a-eba1-4c43-a234-b8f8fb15ea81","resolution":{"observed_at":"2026-05-20T12:53:17.397992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gelstereo 2.0: An improved gelstereo sensor with multimedium refractive stereo calibration","venue":null,"work_id":"1c5e841a-cb55-49f1-887d-f33e9140e5fb","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:67c8cfd24348864ccb4b12660e666419f0ca12980e51a20fbb467fcea6e65fa4","observation_id":"672426bd-70d6-4276-9f0b-0731d5ecf46a","resolution":{"observed_at":"2026-05-20T12:53:18.174749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gelslim 3.0: High- resolution measurement of shape, force and slip in a compact tactile-sensing finger","venue":null,"work_id":"3ed200df-d9cb-44be-9de1-37a6bdb0d07c","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:31253d0f872770cd47b2e14c569fd11a65dbed4b58d14941b9d3450cf32a4698","observation_id":"3713c724-ab22-4357-85fc-9d536ec1a20b","resolution":{"observed_at":"2026-05-20T12:53:18.177123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnitact: A multi-directional high-resolution touch sensor","venue":null,"work_id":"6b6f6421-8948-4dcb-ad5c-3d91c5b73d45","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:87f5c64337642444e54ec1f70793a4d31e9f6bfff470e76faa4b8fac077ebc72","observation_id":"c96ad874-460b-41c1-8e57-85232037f780","resolution":{"observed_at":"2026-05-20T12:53:18.182095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seeing through your skin: Rec- ognizing objects with a novel visuotactile sensor","venue":null,"work_id":"01ebee0a-54ce-4a1f-b115-777d13994003","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:af0523d95e3232d75b26b5fc88ce271f2a938eb70672844b3f15c6bd0f70cb9d","observation_id":"39a22fcc-26b9-4f02-a8b7-9dafdda2de5e","resolution":{"observed_at":"2026-05-20T12:53:18.189509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.17040","doi":"10.48550/arxiv.2411.17040","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal alignment and fusion: A survey","venue":"arXiv (Cornell University)","work_id":"d65685bf-40b6-4c71-a9f6-1f20fba52048","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:b0a29faa78e310b45021a8a90daec2ff6c76275779bf0d69c4ce7c9506c46311","observation_id":"57cd68ab-3690-44bc-9600-ebf94cba0b68","resolution":{"observed_at":"2026-05-20T12:53:17.438009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models","venue":null,"work_id":"deea587a-bb84-40ec-84db-fccfee203a2e","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d4e8e0d99653fb468e98e170ef1d5b7006fd22fcd801917ce5bfbc73b53692f6","observation_id":"810e2937-408d-49bb-aa1f-adc64b995e36","resolution":{"observed_at":"2026-05-20T12:53:18.141359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vhtformer: A joint query perception method for visual-haptic- textual information based on transformer","venue":null,"work_id":"de054040-b32b-4687-ab8e-b687a9486376","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:c27b819613846df5b66ccd97f981b7f06f4573cf51651c4f56e551c194921a5b","observation_id":"cb804b5d-9a17-4448-acfe-77880908d79d","resolution":{"observed_at":"2026-05-20T12:53:18.169867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual–tactile fusion for object recognition","venue":null,"work_id":"f3f1ccb0-29a9-451e-a37c-eb3cca61cd32","year":2016},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:de69c42eb5aefec72a4a7acd86fabb1a279ac43e826b6f2acbdd2b5e0c138ffd","observation_id":"94f0dc05-0666-430c-a358-2320e47a5858","resolution":{"observed_at":"2026-05-20T12:53:18.167227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05512","last_updated":"2025-03-04T22:29:30Z","snapshot_observed_at":"2026-08-18T12:58:26.968131Z","submitted_at":"2017-10-16T05:32:38Z","title":"The Feeling of Success: Does Touch Sensing Help Predict Grasp Outcomes?","version":2},"cited_work":{"arxiv_id":"1710.05512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1710.05512","snapshot_observed_at":"2026-07-03T09:47:59.680541Z","title":"The feeling of success: Does touch sensing help predict grasp outcomes?","venue":null,"work_id":"7b6bb02c-b4bb-4b60-9061-a396518b0ab5","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/1710.05512","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:ef84a0de570effd13bd1e030abee0d075bf6220fa9e6228f8dd9ba5decadf4e4","observation_id":"ef08472e-e22d-4dcd-b267-3936354e20a2","resolution":{"observed_at":"2026-05-20T12:53:17.452177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connecting look and feel: Associating the visual and tactile properties of physical materials","venue":null,"work_id":"4f882c38-1e1c-4d5c-818b-54915e22094e","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:184a76d0e8461e9678afc81458f1fdd6d05b89c2e4b56da0e8c42753d6c49f87","observation_id":"c5dcf87d-371b-4b67-9834-c0b6e66ba50b","resolution":{"observed_at":"2026-05-20T12:53:18.164939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More than a feeling: Learning to grasp and regrasp using vision and touch","venue":null,"work_id":"f71a46db-09b3-4d34-a922-69263ebd323e","year":2018},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:23de49a25888b7221912983d98e8b6b9e54a8ed439e082b30b93c97584ade821","observation_id":"7e38ce2b-29ea-43aa-8d73-900ee2a87e8f","resolution":{"observed_at":"2026-05-20T12:53:18.172050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal grasp data set: A novel visual–tactile data set for robotic manipulation","venue":null,"work_id":"e365a558-695e-4eeb-ba5a-b079d278b1ff","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:e6b3ee9a216c676540971c77d70ddd6c047ec18da1aeeff495d1c3bc982e8da9","observation_id":"6b032316-4610-407e-88d1-68530e4039e7","resolution":{"observed_at":"2026-05-20T12:53:18.184429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connecting touch and vision via cross-modal prediction","venue":null,"work_id":"7d981f2a-e59d-480b-b1d1-d1adb6f4993b","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:252f45d9c5f4560d14d1c97a0046a71c6a1bfc63e869e82b6d470f2f67c09eca","observation_id":"dbf6ca89-2639-49f2-be1f-5757b726d16d","resolution":{"observed_at":"2026-05-20T12:53:18.209331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12498","last_updated":"2022-11-29T16:39:06Z","snapshot_observed_at":"2026-08-18T08:45:20.540948Z","submitted_at":"2022-11-22T18:59:32Z","title":"Touch and Go: Learning from Human-Collected Vision and Touch","version":2},"cited_work":{"arxiv_id":"2211.12498","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.12498","snapshot_observed_at":"2026-07-03T10:48:02.165386Z","title":"Touch and go: Learning from human-collected vision and touch","venue":null,"work_id":"c9733790-edf4-4659-8254-2b70c7264133","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2211.12498","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:3a867c03824469f49168cb98cbdbf785e0888a2375cc22ee57bd7ee014d6f61f","observation_id":"46b90da7-386d-4afa-adcf-67ed04b1e28d","resolution":{"observed_at":"2026-05-20T12:53:17.394578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controllable visual-tactile synthesis","venue":null,"work_id":"0ca9f683-8168-4489-b568-68b8c2247ff5","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:4ed57be8537a1f3a948b8eb634621a1947af1a14cca2be92b574666ac6bc2eed","observation_id":"99c83d13-dc32-464c-9978-3cb1add6a24f","resolution":{"observed_at":"2026-05-20T12:53:18.152105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to jointly understand visual and tactile signals","venue":null,"work_id":"d5ec591f-e7b7-46a6-b5ff-3e2977f6c1de","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d1e5da75380653d762de285491d57b27f1fe232d3eb94bd22e94938a1f78a9a9","observation_id":"ca883d37-fb45-4b21-b9b0-b38c67f60d0f","resolution":{"observed_at":"2026-05-20T12:53:18.267627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.15062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.733834Z","title":"Touch in the wild: Learning fine-grained manipulation with a portable visuo-tactile gripper","venue":null,"work_id":"ed4b641d-a1c3-4e2c-a15e-7ff5f3264e86","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:083caf2c636043420f6718beb1de62486039755e3ba012b3daf39a99dce8fbdf","observation_id":"c18a54dc-71f2-4cef-aca0-1266a1a652c7","resolution":{"observed_at":"2026-05-20T12:53:17.427943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-08-20T09:39:39.872537Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":"2405.02794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-07-03T10:07:55.943192Z","title":"Octopi: Object property reasoning with large tactile- language models","venue":null,"work_id":"0640ae1c-4512-4325-9e12-16cde84e0fa8","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:94a3045b3b78f7a694debcb5c17be788a9b62fc5832208deb235b51a281dd8de","observation_id":"0fc18a5f-ebd9-477d-94df-75c80cce0ad2","resolution":{"observed_at":"2026-05-20T12:53:17.490680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.04201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T10:05:40.673592Z","title":"Stola: Self- adaptive touch-language framework with tactile common- sense reasoning in open-ended scenarios","venue":null,"work_id":"e35b6125-92bc-4fb2-9881-d7d33157e5d8","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:5e4aa4998d45a37ff9d98d4a4e603b289b11fe3a156b77475f02f0057465697d","observation_id":"00e1411f-9230-4952-9ec1-a50cb38c57c2","resolution":{"observed_at":"2026-05-20T12:53:17.466118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal representation learning with tactile data","venue":null,"work_id":"5cd04bc2-7edb-43b5-b529-1bf17e951d81","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:73bd0ae85d81cf9d0fdbee6e92268052f53343c63ade40834ccf51969e1bc37b","observation_id":"92fb07c9-f006-4e30-8b3c-e5f9f7d16262","resolution":{"observed_at":"2026-05-20T12:53:18.324386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Damf: A semantic-guided dynamic attention frame- work for visual-haptic-textual multimodal fusion","venue":null,"work_id":"948309cd-c610-40b4-923f-75fd270d2227","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:01d00d8311e9b8097d12452b10cddaf03eb796a58b3136296d9abbd61bd3fe60","observation_id":"a4d80c0f-39c1-45a5-a622-c590365a7c51","resolution":{"observed_at":"2026-05-20T12:53:18.326884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tvt- transformer: A tactile-visual-textual fusion network for object recognition","venue":null,"work_id":"edf222bc-67fe-4232-8351-4d16035793fa","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:f5e7b8834b34470d1d68afd231a8afebb72e5d6b346f5943dbe78096b131f534","observation_id":"cc9b4178-7991-4d81-b02e-5187e6643a23","resolution":{"observed_at":"2026-05-20T12:53:18.329658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08706","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:48:45.799928Z","title":"Omnivtla: Vision- tactile-language-action model with semantic-aligned tactile sensing","venue":null,"work_id":"207598db-38fb-4e7a-bed8-76aef625d3cc","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:ee8281517b5c9bacf47ca5486621c14c07f09044b107a09f050ea4ccb1cbceb3","observation_id":"29dc1dd8-680d-40e4-afc9-dece60c3fdf3","resolution":{"observed_at":"2026-05-20T12:53:17.473136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07991","last_updated":"2021-11-08T00:54:20Z","snapshot_observed_at":"2026-08-16T17:56:07.711338Z","submitted_at":"2021-09-16T14:00:59Z","title":"ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations","version":3},"cited_work":{"arxiv_id":"2109.07991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.07991","snapshot_observed_at":"2026-07-04T20:10:07.349245Z","title":"Ob- jectfolder: A dataset of objects with implicit visual, auditory, and tactile representations","venue":null,"work_id":"2f83b26a-1674-460d-a02e-37796ba786f8","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2109.07991","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:76ef855db68a93f781fe27a652f8fe1eff385083538d96533fb87e34f4a4f951","observation_id":"76baf2c7-8471-43f3-baca-62f51dc01150","resolution":{"observed_at":"2026-05-20T12:53:17.487475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objectfolder 2.0: A multisensory object dataset for sim2real transfer","venue":null,"work_id":"4d1b5ce7-3c6c-43a3-aabc-0841176c04ab","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:0a7d18941574c1b1d4c8dd2b153270d6e10a0bc6347ca9bed722d5080631d3d8","observation_id":"03e78128-9def-422a-aaf8-1e7deaf1c2e4","resolution":{"observed_at":"2026-05-20T12:53:18.321376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The objectfolder benchmark: Multisensory learning with neural and real objects","venue":null,"work_id":"15b00aab-a41f-40ae-bb50-0fe9c7ce0bda","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:c4023b9f68c9246885d08b0adb42341e3ada95808eac0fa9f9be0d90e852bb47","observation_id":"62d8a576-bf60-45dd-b160-f93a21456c43","resolution":{"observed_at":"2026-05-20T12:53:18.318283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08548","last_updated":"2025-03-11T15:36:28Z","snapshot_observed_at":"2026-08-20T04:33:59.158611Z","submitted_at":"2025-03-11T15:36:28Z","title":"TLA: Tactile-Language-Action Model for Contact-Rich Manipulation","version":1},"cited_work":{"arxiv_id":"2503.08548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08548","snapshot_observed_at":"2026-07-03T10:48:02.227853Z","title":"Tla: Tactile- language-action model for contact-rich manipulation","venue":null,"work_id":"36474292-2ce5-4647-a55d-a16a31607e75","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2503.08548","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:2597b3f29b5419f17ae68715abb0aaecc16331b63c6c0e74eeddb572635b8c31","observation_id":"587a85ed-f281-4bd7-806c-d76dc70a4c44","resolution":{"observed_at":"2026-05-20T12:53:17.411212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.781860Z","title":"Freetacman: Robot-free visuo-tactile data col- lection system for contact-rich manipulation","venue":null,"work_id":"ec46ecbe-fe39-46c9-838a-5a6315dea75f","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d4f635ab1cd4b920be1f5c1864ca627104b3a88e63d0c9167ab132bef7270ca4","observation_id":"4d1a7b0d-0d05-4d9c-bd25-c2e2545c1ab4","resolution":{"observed_at":"2026-05-20T12:53:17.484237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:09.168505Z","title":"Opentouch: Bring- ing full-hand touch to real-world interaction","venue":null,"work_id":"9d556191-6b01-4b63-85fc-3516fff177a1","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:751bd0959c15599c37d6011b87801ed15a9b1878b531f25bbce42449e9aeaedd","observation_id":"e4824277-f129-43dd-895c-25278fc67ee7","resolution":{"observed_at":"2026-05-20T12:53:17.421571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04884","last_updated":"2026-04-15T19:55:43Z","snapshot_observed_at":"2026-08-19T11:32:00.989044Z","submitted_at":"2025-12-04T15:11:48Z","title":"Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation","version":3},"cited_work":{"arxiv_id":"2512.04884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04884","snapshot_observed_at":"2026-07-04T16:29:57.305910Z","title":"Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation","venue":"cs.RO","work_id":"58920c92-f1c5-4230-9a01-561d0c42b697","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2512.04884","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:5872d7d606a2b29470cef851829b3d99e555779aa1faae45a4005d029bd806bd","observation_id":"0d1f0295-37c6-419f-9af6-75f66bb10aba","resolution":{"observed_at":"2026-05-20T12:53:17.434522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00510","last_updated":"2025-01-06T16:04:53Z","snapshot_observed_at":"2026-08-15T02:09:37.004018Z","submitted_at":"2024-12-31T15:45:09Z","title":"VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception","version":2},"cited_work":{"arxiv_id":"2501.00510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00510","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vint-6d: A large-scale object-in-hand dataset from vision, touch and proprioception","venue":null,"work_id":"b238212e-b146-4a5e-893a-4822a0bdc845","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2501.00510","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:2422e2a22e963e804ea505ec8905bccdb2b044757373f9f28ac0cf1e1aefa1c5","observation_id":"afef0867-5d2e-4ce2-a4c5-4c8db5e74efc","resolution":{"observed_at":"2026-05-20T12:53:17.383723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnivta: Visuo-tactile world modeling for contact- rich robotic manipulation","venue":null,"work_id":"f8615e9e-ce36-49ed-b2cf-99360fb6e24c","year":2026},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:3bdcb06efacb1593393ec267c5c3873d9f0f713f20f210c1cfe88dc3e7dcf45e","observation_id":"928bc7d3-1046-4f83-88b2-e81db2d2f579","resolution":{"observed_at":"2026-05-20T12:53:18.307814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet clas- sification with deep convolutional neural networks","venue":null,"work_id":"ec3570c7-fb28-4373-959d-79efd9b44f8b","year":2012},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:79d9af4197a89976e94745ab442efbae4674a47e40afebafbe38ffa06571e2a8","observation_id":"0ed9662e-9984-4db7-8834-bc51abbcdbf8","resolution":{"observed_at":"2026-05-20T12:53:18.302359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"See, feel, act: Hierarchical learning for complex manipula- tion skills with multisensory fusion","venue":null,"work_id":"f5fe9f47-e95f-4c3d-9da4-1003fd2fb427","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:bb93a12f80ea4d77329fddb304852682a9b5842a2eae7a03be6620565fdcce6b","observation_id":"6e05a811-cefa-4c8a-a210-a712e6e05c0f","resolution":{"observed_at":"2026-05-20T12:53:18.305163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask r-cnn","venue":null,"work_id":"b08515c1-5c17-49c9-bca1-9015a5e4e4c2","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:fe338c7bb8cabbe3f31be1ca673c28d19e0b2d153dadc583ca9b9a187b357091","observation_id":"4142ea65-3cbc-497d-9d0f-3f37736e257c","resolution":{"observed_at":"2026-05-20T12:53:18.315602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayesian neural networks","venue":null,"work_id":"67176438-2e2f-442d-93fb-1ad210ea4367","year":1989},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d42aa7565b8ba1351ef0683031b85a262ac5d0e21b992698df695bc80b94f995","observation_id":"edbbfebe-4634-4f12-8006-3b9d88f57b71","resolution":{"observed_at":"2026-05-20T12:53:18.296806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning cross-modal visual-tactile representation using ensembled generative adver- sarial networks","venue":null,"work_id":"15235242-9434-4675-b89e-487088228fdc","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:bdb291b34eedf1e2ab107a3ffbf87ada9b4621553549534367db37d4d0575bf1","observation_id":"b7954fb9-28fa-4d0c-8c9e-4251fec120ff","resolution":{"observed_at":"2026-05-20T12:53:18.289223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erative adversarial nets","venue":null,"work_id":"70e7db7c-4810-4aa9-96bf-d075b9530e13","year":2014},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:ef1eaf273df361f9b14fefa07cd81ddd715f35f6bb375ec5c39ec8e44af317f1","observation_id":"2a3d21c6-9589-4fe5-bef3-0b4ed57a0875","resolution":{"observed_at":"2026-05-20T12:53:18.294276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making sense of vision and touch: Self-supervised learning of multimodal representations for contact-rich tasks","venue":null,"work_id":"9c4506f4-02b3-4cb3-ae75-b1c37770e24b","year":2019},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:f4d15d75df6da00186566daf09b858f3b813438623fa28b2deeead7e1e102153","observation_id":"39b1df4a-cf04-472f-9b81-bc74ab882b0d","resolution":{"observed_at":"2026-05-20T12:53:18.310483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flownet: Learning optical flow with convolutional networks","venue":null,"work_id":"cbad976c-0d97-4b2c-9269-11aaadbd7f4f","year":2015},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:13bbcf73113588ed8c04f7a5403d5afcbcd9789b680b28bec3941dcab20fd69d","observation_id":"acd8b079-2cae-4a91-ba0c-7ef6555bd397","resolution":{"observed_at":"2026-05-20T12:53:18.340402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong visual-tactile cross- modal learning for robotic material perception","venue":null,"work_id":"b5661cb0-d6fd-4e87-a553-a6ab42d9c2cb","year":2020},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:6bdb4e3723e8df3f5b2bd5a25959327d789d362f5763124b4310eff6cdc2ee40","observation_id":"bb738793-d227-4401-a657-29d7b91489bf","resolution":{"observed_at":"2026-05-20T12:53:18.286644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":"1409.1556","doi":"10.48550/arxiv.1409.1556","metadata_source":"pith","pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","venue":"cs.CV","work_id":"1c4b4409-c14b-488b-a086-c57a5aab8a29","year":2014},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:4373e4f07253e28c55f8eefb48befe8e43b9bc9185a4c7c08f12098894a430de","observation_id":"858a1ae4-b5eb-49e9-8fa7-57e6cf0d2721","resolution":{"observed_at":"2026-05-20T12:53:17.387438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00121","last_updated":"2022-09-30T22:38:29Z","snapshot_observed_at":"2026-08-16T16:27:42.761890Z","submitted_at":"2022-09-30T22:38:29Z","title":"Visuo-Tactile Transformers for Manipulation","version":1},"cited_work":{"arxiv_id":"2210.00121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.00121","snapshot_observed_at":"2026-06-30T13:24:41.085018Z","title":"Visuo-tactile transformers for manipulation","venue":null,"work_id":"97da9aa1-6a26-43b2-a1fb-c431a16afea3","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2210.00121","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:f0321e9e8db5a617d7a35686aef9a27b7a8e28bcf5ef646eb8da7fe1c388f798","observation_id":"f82398ff-0081-4fb1-ab27-f82298b64b71","resolution":{"observed_at":"2026-05-20T12:53:17.351857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visuotactile-rl: Learning multimodal manipulation policies with deep reinforcement learning","venue":null,"work_id":"382e1d6c-be79-46cf-8ba4-b1d721c71678","year":2022},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:a2f931cc1ba10b91755669fdf0e55c099ef70513505f7641f188dda9a18e2d74","observation_id":"b9f4ce5c-6c55-47f2-aa9d-e1554e458f4e","resolution":{"observed_at":"2026-05-20T12:53:18.157338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-08-16T18:08:43.985218Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2107.09645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-07-04T07:59:40.482533Z","title":"Yarats, R","venue":null,"work_id":"15c4c6c3-a4fd-4b37-97d1-7e67f55a3eef","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:fe8a65016e7d06b6280e59eb81f10a987988dee8391fca7319bc36ac07f46f0f","observation_id":"688ff8ed-21af-4c57-b6bb-5504b6602930","resolution":{"observed_at":"2026-05-20T12:53:17.480649Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vito-transformer: a visual-tactile fusion network for object recognition","venue":null,"work_id":"01c58b9b-c9f3-4587-bb6e-c71eb1b5763e","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:88f9a0e801f69a4e078f5d470c2824d59c7c863809aee97ebf343e7d7585f019","observation_id":"f15f9726-0bce-40a0-ad86-4338bd2a6a2a","resolution":{"observed_at":"2026-05-20T12:53:18.159840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mlp-mixer: An all-mlp architecture for vision","venue":null,"work_id":"29c0b765-1636-464a-86b8-a63cf03b6c52","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:5530c3f74b5193f14506558a78c2a584deceed636707192e7d60a110b352a16e","observation_id":"a8bfa834-3a4a-4838-81ee-1240108815e0","resolution":{"observed_at":"2026-05-20T12:53:18.149818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"35be40ce-53ae-4c1b-ae6a-43a5f65a1cd8","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:b1ba25a7a4bd98a988be1c4ba6577c3a8d9ff957f0abfb36bee9daef811f8ac7","observation_id":"e7453b5b-b37f-4ec4-9c3a-ebf087eda3c1","resolution":{"observed_at":"2026-05-20T12:53:18.192454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"22e42dc6-8f05-4f25-a631-0d970dd193c9","year":2023},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:b24caed98fc4e20d327b0ee0304f0755db7fd1b6cbac64551eb1d70b6a202a75","observation_id":"be6e87de-a4df-48fe-b935-cd669fa50c71","resolution":{"observed_at":"2026-05-20T12:53:18.144579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bidirectional visual-tactile cross-modal generation using latent feature space flow model","venue":null,"work_id":"a272e91d-550d-46b4-9319-c22e716ed9f5","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:84ba6639fe5f3d8c2e8640769e1fe20ab746e59edc3bc496b02bd1770fa1b0c9","observation_id":"b6ef88c6-d68f-453e-80d0-539728edb12d","resolution":{"observed_at":"2026-05-20T12:53:18.147226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09985","last_updated":"2025-07-14T07:05:36Z","snapshot_observed_at":"2026-08-20T09:41:00.942828Z","submitted_at":"2025-07-14T07:05:36Z","title":"Demonstrating the Octopi-1.5 Visual-Tactile-Language Model","version":1},"cited_work":{"arxiv_id":"2507.09985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09985","snapshot_observed_at":"2026-07-03T10:07:55.946433Z","title":"Demonstrating the octopi- 1.5 visual-tactile-language model","venue":null,"work_id":"b1ba2948-7617-4bdc-b872-f97dbda90694","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2507.09985","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:f62fa769c54fd70129573b0efac69ada2e08f34c0d1f1692475d59ae4f25bfc4","observation_id":"4c68853a-ae98-46d6-871b-cec59999d52f","resolution":{"observed_at":"2026-05-20T12:53:17.407959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:01f04dceb3c1b59d681f60afad497306a1c2733d2141a8b5dd9de9dd25dbae03","observation_id":"7c6014b1-8264-4496-a9cd-47a79b93e7f4","resolution":{"observed_at":"2026-05-20T12:53:17.355261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15953","last_updated":"2026-05-13T00:42:26Z","snapshot_observed_at":"2026-08-11T23:07:39.134745Z","submitted_at":"2025-06-19T01:38:13Z","title":"ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation","version":2},"cited_work":{"arxiv_id":"2506.15953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15953","snapshot_observed_at":"2026-07-04T00:39:17.037343Z","title":"ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation","venue":"cs.RO","work_id":"9020730d-85b6-44bc-b66d-9296fc356088","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2506.15953","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:bf79252a7cbdb5ad0dbe7407df1b59e3746d6f65811c665957c2dfe6df83b655","observation_id":"1c403072-4317-447c-b75e-67178daadf6d","resolution":{"observed_at":"2026-05-20T12:53:17.362226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20032","last_updated":"2026-04-29T11:05:46Z","snapshot_observed_at":"2026-07-06T21:30:42.185904Z","submitted_at":"2025-05-26T14:19:29Z","title":"ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers","version":3},"cited_work":{"arxiv_id":"2505.20032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20032","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers","venue":"cs.CV","work_id":"a8e23fc7-969e-4b3c-9c45-f4fe9e85b517","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.20032","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:42a858bd6b84a7c75b0740970f40c2c54037c76048cef6bfdca0a8c02e5c21b0","observation_id":"8a5b76d7-4c90-4e98-84c7-e92f8ae67e85","resolution":{"observed_at":"2026-05-20T12:53:17.414391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object attribute recognition method integrating visual-tactile data and multi- task learning","venue":null,"work_id":"c07c017d-ecf2-47b5-b9a3-f0e12856b3bd","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:d49eb6782405ea13d141484260b8fa3763b83c4c91bbedaddc5807c450f1ed9f","observation_id":"c945e8cd-2c47-4621-b909-37441dfbb7a9","resolution":{"observed_at":"2026-05-20T12:53:18.221772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04658","last_updated":"2025-09-04T21:05:33Z","snapshot_observed_at":"2026-08-18T08:45:49.251756Z","submitted_at":"2025-09-04T21:05:33Z","title":"Surformer v2: A Multimodal Classifier for Surface Understanding from Touch and Vision","version":1},"cited_work":{"arxiv_id":"2509.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04658","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sur- former v2: A multimodal classifier for surface understand- ing from touch and vision","venue":null,"work_id":"f6110c34-c0b8-45cb-bfc5-5da7b6ee7c16","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2509.04658","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:5097da25e3bb2d81aad94dc9d1b13d6fbc25145fe6482a9c8da2680e8f350d43","observation_id":"0ace1f1b-26c1-499b-baa1-0b0bfe490ffc","resolution":{"observed_at":"2026-05-20T12:53:17.404600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficientnetv2: Smaller models and faster training","venue":null,"work_id":"807927f9-a9f1-4301-92dc-4a41c1fa2352","year":2021},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:5f5d1dd45d62b4beb0dd852350b17a972de086cc78c59a536b18ba86fd9bcbfc","observation_id":"f593d785-cc20-467e-90bb-6c264d71bfcc","resolution":{"observed_at":"2026-05-20T12:53:18.291936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ulip- 2: Towards scalable multimodal pre-training for 3d under- standing","venue":null,"work_id":"aa66d899-ac7f-405a-a716-89d56acf2ea5","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:85ae55920d9faef99bed30082d3a1ebd12df32eb9317d066ebf2c611bb7b6d03","observation_id":"1e6cdd75-690d-436f-9b25-4f6cb92e5d26","resolution":{"observed_at":"2026-05-20T12:53:18.299484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20757","last_updated":"2025-06-25T18:43:35Z","snapshot_observed_at":"2026-08-13T03:19:14.517030Z","submitted_at":"2025-06-25T18:43:35Z","title":"ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations","version":1},"cited_work":{"arxiv_id":"2506.20757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convitac: Aligning visual- tactile fusion with contrastive representations","venue":null,"work_id":"bb56fd0e-c3b4-4dc2-8c98-01541cfc0192","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2506.20757","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:aea43a419f4415ffd7569887efff8daa43a8929a0dc33f79a29a5143c998867d","observation_id":"c06afac8-7083-4411-baa8-72f1f7235935","resolution":{"observed_at":"2026-05-20T12:53:17.418098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtlg: A vision-tactile-language grasp generation method ori- ented towards task","venue":null,"work_id":"ddced155-503c-4ffb-bca1-bb50e02d3db5","year":2026},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:16e17c910236f7cf19c20601ce17c996ec9230ae0d7da23dd3b3829530d9b40a","observation_id":"a849b8cf-c4b0-4057-a1ff-15b7ca65662d","resolution":{"observed_at":"2026-05-20T12:53:18.343169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dt-transformer: A text-tactile fusion network for object recognition","venue":null,"work_id":"2217819f-728a-4584-a797-afde877ff22b","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:99db831ea3462e1fd84b3813c3aa629a88897dcc773ad2456dfaa36a952ac9d8","observation_id":"d79f0b80-3cdf-41dd-becb-0fa697b3a754","resolution":{"observed_at":"2026-05-20T12:53:18.280132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Densely connected convolutional networks","venue":null,"work_id":"8a74ad9f-e5b3-447d-b2c3-9213c65f7662","year":2017},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:7f7969ecf4663799598b3e3125a7f96d9dfedddc344a1eff53975036eeef5ab6","observation_id":"9e82bd9d-515c-4190-a492-f3664865aed8","resolution":{"observed_at":"2026-05-20T12:53:18.229033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-15T10:30:47.572456Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":4},"cited_work":{"arxiv_id":"2512.23864","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23864","snapshot_observed_at":"2026-07-04T13:19:50.917081Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","venue":"cs.RO","work_id":"34d7d55c-9981-4921-b590-1eb4926b600f","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2512.23864","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:987726e7d69daa1bda3c6ed8a6ca2c935bcb21d80a1f8b1e239af2954049b6dc","observation_id":"de4803ad-5f51-431a-b09f-6bdcd8812763","resolution":{"observed_at":"2026-05-20T12:53:17.448473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17294","last_updated":"2025-07-29T12:31:26Z","snapshot_observed_at":"2026-08-16T06:51:33.134350Z","submitted_at":"2025-07-23T07:54:10Z","title":"VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback","version":2},"cited_work":{"arxiv_id":"2507.17294","doi":"10.48550/arxiv.2507.17294","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-touch: Enhancing vision-language- action models with dual-level tactile feedback","venue":"ArXiv.org","work_id":"bbc9afdd-1cb4-4efc-9b65-017800c4f773","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2507.17294","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:fa08b633554e4b5b25067093cec891eaffdedc5baca69ac11de775fc19171c68","observation_id":"7c76f681-ae5b-4355-982d-e4760d8409f4","resolution":{"observed_at":"2026-05-20T12:53:17.376885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:336f20d448618ebb00a8e4a2fb31a2173786c5260e94e902ab96e95d32070de5","observation_id":"bf190bc9-9ad9-4306-a3eb-5bebdcbfd2e9","resolution":{"observed_at":"2026-05-20T12:53:17.458924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dextac: Learning contact-aware visuotactile policies via hand-by-hand teaching","venue":null,"work_id":"0b871541-fc58-4bb5-834a-38afec4a86a4","year":2026},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:dd8e15bd012bcaf3cc7fb62baadbd1789ee9e0ed43b19f03c6d9b7818e953733","observation_id":"75175fc8-efd1-480f-bcc8-b5e9a7c88b67","resolution":{"observed_at":"2026-05-20T12:53:17.391165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtam: Video-tactile-action models for complex physical interaction beyond vlas","venue":null,"work_id":"6b599a91-6fb0-4e46-a7b1-4d025336d58f","year":2026},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:0828f1e4bdd0dba88c1f590de6032bfff45939b4d7eca7869257ab22f731b2a1","observation_id":"a105f1ae-f48d-4825-aa06-815d8f554219","resolution":{"observed_at":"2026-05-20T12:53:18.233845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual–tactile fusion material identification using dictionary learning","venue":null,"work_id":"893df773-9380-4389-a100-42d41877ce71","year":2018},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:4ca9003041b8b98bd636d3908363aadff39b08c9d06bd9baa3a0182369474644","observation_id":"1fef7431-2e6a-4122-a5f1-569d44bc8729","resolution":{"observed_at":"2026-05-20T12:53:18.248330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T05:25:37.706248Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":64},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 1 inbound Pith citation observation for arXiv:2605.17336."}