{"as_of":"2026-08-06T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cae5fb897c499e7772e10f381160090480ff30b9a94bf4f62fec73ac2c631b85","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T09:31:34.871215Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2304.11193/citation-record","integrity":"/paper/2304.11193/integrity","json":"/paper/2304.11193/citation-record.json","paper":"/paper/2304.11193"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1710.11252","last_updated":"2018-03-06T16:35:06Z","snapshot_observed_at":"2026-08-03T04:41:23.218059Z","submitted_at":"2017-10-30T21:48:54Z","title":"Stochastic Variational Video Prediction","version":2},"cited_work":{"arxiv_id":"1710.11252","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.11252","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic Variational Video Prediction","venue":"cs.CV","work_id":"2b4f01f7-2946-42ed-ad06-677913824304","year":2017},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1710.11252","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:75db01f487b44a683f7f739f188c2461e2674e241b0b43f6cfe3b0bb531beeef","observation_id":"964f22e7-8ba9-4d64-96dc-440a344e110f","resolution":{"observed_at":"2026-05-24T09:34:16.962494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recognising action as clouds of space-time interest points","venue":null,"work_id":"5916a7c9-d9df-4a12-ba50-2030fb96bd14","year":2009},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:7efff2dd8ad3e140f45ffe301cd0443ef6f051da720c7bec6038a89e0b4b41d3","observation_id":"2b7d0b99-ad1f-466d-ba51-473cbd7140c3","resolution":{"observed_at":"2026-05-24T09:34:17.791172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic object classes in video: A high-deﬁnition ground truth database","venue":null,"work_id":"66999f61-49d9-44f1-b66b-b0a0e9fe0d46","year":2009},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:d6095fc6e94112ce8580edbbf937f59168d40b3b6851a04a39393c418e7c0621","observation_id":"5ae496b3-c122-4aa8-be74-5eacd08ed1ca","resolution":{"observed_at":"2026-05-24T09:34:17.782685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual-tactile cross-modal data generation using residue- fusion gan with feature-matching and perceptual losses","venue":null,"work_id":"926c1b5d-21c1-4dfc-8d0a-b0fcb20898e2","year":2021},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:c5136d1b2d4afe5f3592f674216ee5880c36a7d7d3c515152e2dc4b016cb49e5","observation_id":"b953916f-0ff2-45f8-b0f6-32336ff07726","resolution":{"observed_at":"2026-05-24T09:34:17.857830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The ycb object and model set: Towards common benchmarks for manipulation research","venue":null,"work_id":"ed56c1c1-125c-4ee6-9dac-562a9d778e40","year":2015},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:c29cec30c13d017300e81afaee5fb6680eb7ea066b45154ed50c5c386f6c2cc0","observation_id":"a34cd83c-6674-4c9e-a1b0-8f26d6c487c0","resolution":{"observed_at":"2026-05-24T09:34:17.854696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11215","last_updated":"2020-01-02T06:26:37Z","snapshot_observed_at":"2026-07-06T08:31:59.314616Z","submitted_at":"2019-10-24T15:20:03Z","title":"RoboNet: Large-Scale Multi-Robot Learning","version":2},"cited_work":{"arxiv_id":"1910.11215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.11215","snapshot_observed_at":"2026-07-04T08:59:42.026927Z","title":"RoboNet: Large-Scale Multi-Robot Learning","venue":"cs.RO","work_id":"a19770ba-65e3-409a-8ef4-98ed438c113b","year":2019},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1910.11215","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:6fc58b2f87558089498dd663b2856cd455553d3bc5cf7238b73722b671a79750","observation_id":"99a34c11-a5dc-4acd-bc09-3d1ca1f3b107","resolution":{"observed_at":"2026-05-24T09:34:16.957694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic video gener- ation with a learned prior","venue":null,"work_id":"c1862c26-aa33-4e7f-9b6e-6617e8cc186d","year":2018},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:2b487561ca64a1899bfcf025f7f900bb7a2130557d41fd1b3ee691652d7c3ea8","observation_id":"5578e691-3cd1-4769-8b6d-00274cb976a7","resolution":{"observed_at":"2026-05-24T09:34:17.851135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised visual planning with temporal skip connections","venue":null,"work_id":"d6369bc4-5445-4cb9-8812-84d7c40e3c9b","year":2017},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:f456d89e0d66e55a627d49cb5e778bf4b1e7a5fa051b0e1b84dc7fce4de8e736","observation_id":"9448d66a-71c2-4774-944e-6ea2f062f2d1","resolution":{"observed_at":"2026-05-24T09:34:17.847922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07157","last_updated":"2016-10-17T20:09:56Z","snapshot_observed_at":"2026-07-06T04:57:17.761891Z","submitted_at":"2016-05-23T19:45:55Z","title":"Unsupervised Learning for Physical Interaction through Video Prediction","version":4},"cited_work":{"arxiv_id":"1605.07157","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.07157","snapshot_observed_at":"2026-07-04T06:39:37.255302Z","title":"Unsupervised Learning for Physical Interaction through Video Prediction","venue":"cs.LG","work_id":"6f256b06-896d-4f73-842a-d26a1b101aa5","year":2016},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1605.07157","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:72eccbd56a92791d1c8cd06a1d3210b93ea1cf0e3cace6645741ee51a622a247","observation_id":"a5c53439-2f54-4d7e-9c6c-626c06cfbad8","resolution":{"observed_at":"2026-05-24T09:34:16.971721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"2d46afef-1c6c-41eb-b365-9bf140aecc04","year":2013},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:612f3153ba6ec2d79b069c00a884922463c6bb1ae326f6694c027d35103f8a2b","observation_id":"db3adc37-5836-47c9-8e24-021a0d87a711","resolution":{"observed_at":"2026-05-24T09:34:17.844020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Possible anatomical pathways for short- latency multisensory integration processes in primary sensory cortices","venue":null,"work_id":"672b4818-7b5d-4824-b4fa-8f6eef11932e","year":2014},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:13b5ccbc39794f2ded7b779c719418be6d7ceec0576fb64527376790a8699db4","observation_id":"5218f110-a678-480a-b86f-48bf91337017","resolution":{"observed_at":"2026-05-24T09:34:17.840537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The apolloscape dataset for autonomous driving","venue":null,"work_id":"78e0a1a9-a80d-4df0-aebe-a7aedef496bd","year":2018},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:d6f49a29a48cedb9c3716e427e31184898f383b53231c57b55a7de97f2d3bbd5","observation_id":"f4ede5a6-6f25-4d08-9a44-1cba3bab29b6","resolution":{"observed_at":"2026-05-24T09:34:17.837114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human3.6m: Large scale datasets and predictive methods for 3d human sensing in natural environments","venue":null,"work_id":"235d711c-3516-45e6-b935-d8df4495ce23","year":2014},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:256dba0eed9c79f3865ab2bc15b0bd3dfcefc7061b4056f28f7d6c4d8fc35225","observation_id":"76c725d3-53fc-4db7-bf4f-2a13329619bf","resolution":{"observed_at":"2026-05-24T09:34:17.833796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coding and use of tactile signals from the ﬁngertips in object manip- ulation tasks","venue":null,"work_id":"0e03a73e-cc07-4f10-9358-370a7bf33e5c","year":2009},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:2e79ee719713049e4f5376acb7d86e60191ae6eabb9a35c18f146908f52a838a","observation_id":"fd3dbf21-7e12-4ffa-9af8-6f8a2b117aaf","resolution":{"observed_at":"2026-05-24T09:34:17.829928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On infor- mation and sufﬁciency","venue":null,"work_id":"08688436-2076-4e7b-a7de-a938fe39ccd4","year":1951},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:16eda03b8a169661054884aa6533b8d45eb2faa0637f1b9fa2256171cb9b1b58","observation_id":"0f1044c5-2b59-4bb6-9f93-dcdc7a6969f2","resolution":{"observed_at":"2026-05-24T09:34:17.826494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01523","last_updated":"2018-04-04T17:55:40Z","snapshot_observed_at":"2026-07-06T06:31:45.401940Z","submitted_at":"2018-04-04T17:55:40Z","title":"Stochastic Adversarial Video Prediction","version":1},"cited_work":{"arxiv_id":"1804.01523","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.01523","snapshot_observed_at":"2026-06-29T08:43:15.688169Z","title":"Stochastic Adversarial Video Prediction","venue":"cs.CV","work_id":"79566ba2-e12d-4661-895e-bb788b1108e4","year":2018},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1804.01523","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:535edbfe22a0431e09c58c0264661d3cacde83e5d69150f00dadd91e8508c31d","observation_id":"f6de1a81-8bb8-4b2d-9038-dcc7a20d6ae0","resolution":{"observed_at":"2026-05-24T09:34:16.980675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"touching to see","venue":null,"work_id":"512a1080-a264-4551-95fe-30b639ce6b7f","year":2019},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:3c2200bc6f1cc016f98b98b557dd1e4eee634db5e7c248a91f844cd4f4adb340","observation_id":"6941889e-abd6-45c8-a352-51cd2ad92eb8","resolution":{"observed_at":"2026-05-24T09:34:17.823450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making sense of vision and touch: Learning multimodal representations for contact-rich tasks","venue":null,"work_id":"d0eb2ac3-f0d3-47b3-92d6-7819d2ea9ca3","year":2020},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:6fd0261f157de3968b2b29ccda1a125821361e4f20c287fda3e0964eb152c261","observation_id":"90d91ffd-243f-47be-87cd-10aced3df15d","resolution":{"observed_at":"2026-05-24T09:34:17.820435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connecting touch and vision via cross-modal prediction","venue":null,"work_id":"eabfafdc-3e11-4a70-8891-b6a298f3aaa9","year":2019},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:f1d3ad1b652200f46dd758d156bcb95b3415e836d69ce1c9e5a857e6e4d8b1c4","observation_id":"c767bc88-ad98-42e5-94a5-519d54342266","resolution":{"observed_at":"2026-05-24T09:34:17.817587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action conditioned tactile prediction: a case study on slip prediction","venue":null,"work_id":"2e0cbb20-af41-4132-ac5f-548db5d26df8","year":2022},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:ec00638c7dead07d8589cd613eaa0f8a262af364d416e8a46f82818c5254aabb","observation_id":"7bc49ef1-a5e0-4728-b9f9-f878fe6836e9","resolution":{"observed_at":"2026-05-24T09:34:17.814665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06019","last_updated":"2022-09-13T14:15:34Z","snapshot_observed_at":"2026-07-06T13:51:46.670481Z","submitted_at":"2022-09-13T14:15:34Z","title":"Proactive slip control by learned slip model and trajectory adaptation","version":1},"cited_work":{"arxiv_id":"2209.06019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.06019","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proactive slip control by learned slip model and trajectory adaptation","venue":null,"work_id":"a9af3dcb-c8ba-4cfd-a0ef-ac53e94fbcf6","year":2022},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/2209.06019","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:596b8273cc747cdd88f7ee643c6f9d1b4c57154e938b27a4a3978d3d4586cf0e","observation_id":"60c07f7e-a043-46da-8235-3b6e63793502","resolution":{"observed_at":"2026-05-24T09:34:16.966918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From Active Touch to Tactile Communica- tion: What’s Tactile Cognition Got to Do with It? Danish Resource Centre on Congenital Deafblindness","venue":null,"work_id":"479b6e3a-5296-46c1-942d-437b66b3d713","year":2010},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:35399bb1147b52bc0db6211d396f24a42a108b5fe49af499d4766271c27533df","observation_id":"30d7784d-b8aa-4647-8885-0631bf54234c","resolution":{"observed_at":"2026-05-24T09:34:17.811913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action-conditional video prediction using deep networks in atari games","venue":null,"work_id":"0d948855-7a2d-422b-b84a-06b68c5657d4","year":2015},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:d2d4c0fc91ade004702b57865a3c30222b68f849eccff8bbea2ed70214ef079a","observation_id":"db962440-11c2-4f55-a224-d537bdab7ce3","resolution":{"observed_at":"2026-05-24T09:34:17.808928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sensing characteristics of an optical three-axis tac- tile sensor mounted on a multi-ﬁngered robotic hand","venue":null,"work_id":"029a53db-203f-4576-8867-130a88f182f0","year":2005},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:124c3fe69c6a1660eeb3a23a95e2fc47afe8ae2df5fdcf880d86656dc6ad59b5","observation_id":"eacc901a-6bc7-40f6-9893-2278fe62fe19","resolution":{"observed_at":"2026-05-24T09:34:17.806190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review on deep learning techniques for video pre- diction","venue":null,"work_id":"9ebd8433-06a6-41e1-ae06-b3dcb6d8a051","year":2020},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:dff221c3788e9b4e15f9e640ee7c70f337a278e34963ea3b826fc2d668c1dd7a","observation_id":"0d821e83-0fa5-49ca-ad90-9e6223414eac","resolution":{"observed_at":"2026-05-24T09:34:17.803408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The curious robot: Learn- ing visual representations via physical interactions","venue":null,"work_id":"c163927b-3f8c-4a2f-a255-4becf066224e","year":2016},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:46dc4a30edf6d5d3f0d81bad5953284ea78979221d2326ed3f72653d5aba9496","observation_id":"b844a269-2d30-4c5b-beb8-3dcefc51d41b","resolution":{"observed_at":"2026-05-24T09:34:17.797081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6604","last_updated":"2016-05-04T14:01:42Z","snapshot_observed_at":"2026-07-06T04:04:18.621124Z","submitted_at":"2014-12-20T05:05:51Z","title":"Video (language) modeling: a baseline for generative models of natural videos","version":5},"cited_work":{"arxiv_id":"1412.6604","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.6604","snapshot_observed_at":"2026-07-02T11:56:55.444311Z","title":"Video (language) modeling: a baseline for generative models of natural videos","venue":"cs.LG","work_id":"f734564c-9240-4521-bb3e-c5d2c420789a","year":2014},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1412.6604","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:25f4a95d0defccf8d81d2138ab81c41733b7b5873f96ff0beed44b6aab63f56d","observation_id":"c312b4e0-93cc-4882-bed2-268138f149b5","resolution":{"observed_at":"2026-05-24T09:34:16.952782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xela robotics uskin magnetic tactile sensor","venue":null,"work_id":"4eaeb856-4273-4042-ae46-21463b641107","year":2020},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:cfb06200da042344ba5fdf6d59f929363666ec03519d615075600ab555d537cb","observation_id":"df196a3f-05f7-43cc-9314-63c753b37cff","resolution":{"observed_at":"2026-05-24T09:34:17.793952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recognizing human actions: a local svm approach","venue":null,"work_id":"f307e6ca-3e8c-4f65-adbb-52c5439c4ba9","year":2004},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:1c9a2a5745c45d08cf8c785b033a8b06198125be6dee6fc5e3e64fe5b2305c30","observation_id":"af2eb7c4-8731-4cf8-9bcb-8004e940718c","resolution":{"observed_at":"2026-05-24T09:34:17.788423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the design and development of vision-based tactile sensors","venue":null,"work_id":"b9fc073c-803b-49db-95cb-a594568c8f39","year":2021},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:4f7c17dc1f1e6e1da975e26c8860df145d0ac8d3d47844b210b720da888ca34a","observation_id":"c8c5d036-a710-4354-b4f5-0c0efe207ed8","resolution":{"observed_at":"2026-05-24T09:34:17.785494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of video repre- sentations using lstms","venue":null,"work_id":"81259a6c-1e03-4e27-a094-d7188c340879","year":2015},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:c895ed6b88ab824d18b7315f65e6eddb8925a0460c85b92d1f6ac505f228cdda","observation_id":"6a6584aa-c2df-481c-bb68-278f34aef582","resolution":{"observed_at":"2026-05-24T09:34:17.779801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning of action through adaptive combination of motor primitives","venue":null,"work_id":"11be4536-b402-4425-80b8-74b82ec32850","year":2000},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:480a8e904b4eed4f5259c742f0788c3721f765eca8af0eb422ae428c827df35b","observation_id":"a3fff6a0-01bd-4c32-8e53-f5dc661c8ae9","resolution":{"observed_at":"2026-05-24T09:34:17.776956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review of tactile sensing technologies with applications in biomedical engineering","venue":null,"work_id":"7899b878-4799-4290-b317-6be037477b99","year":2012},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:48bce7ca706a93933d8f971a77d18375a902932eaf43a7936bf4af8e84a9b5d0","observation_id":"bde58240-4083-4de5-8e8a-8e9313b87f51","resolution":{"observed_at":"2026-05-24T09:34:17.774323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sensory prediction errors drive cerebellum-dependent adaptation of reach- ing","venue":null,"work_id":"9d4901b6-7358-48f2-aa2e-00c1bdd54f0c","year":2007},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:70683739217b10cb278075b0a07ed9b2800e0ac2b6bd5a2e4ec75f9e7592eb53","observation_id":"e672871f-6bdf-41b0-9c03-f394cab9bed7","resolution":{"observed_at":"2026-05-24T09:34:17.771500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High ﬁdelity video prediction with large stochastic recurrent neural networks","venue":null,"work_id":"ef79e5d1-c001-4f6e-beb5-758ea6757338","year":2019},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:f372973e6713db99ac15a35d26e0309b7a610e4005a1cb53f3e4953e6639da99","observation_id":"e8687343-b78f-4de5-8ce9-afbfc55d8f9f","resolution":{"observed_at":"2026-05-24T09:34:17.768577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08033","last_updated":"2018-01-08T01:21:32Z","snapshot_observed_at":"2026-08-01T16:57:58.024755Z","submitted_at":"2017-06-25T04:18:12Z","title":"Decomposing Motion and Content for Natural Video Sequence Prediction","version":2},"cited_work":{"arxiv_id":"1706.08033","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.08033","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decomposing Motion and Content for Natural Video Sequence Prediction","venue":"cs.CV","work_id":"5b5bbda9-6c70-480f-9926-fa477830319e","year":2017},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"cited_paper":"/paper/1706.08033","citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:7256ea213f9e6afb530a2688f529cf9a7697934d09a47fc4490692af2832c52f","observation_id":"af9875d5-bba9-43aa-a7c8-18b2bb1aa1b4","resolution":{"observed_at":"2026-05-24T09:34:16.975899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to generate long-term future via hierarchical prediction","venue":null,"work_id":"2ec2a5ae-cb9a-431a-b8ed-7d330b68512d","year":null},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:d354c4f7a8286748bb03dfe54a7fbe4b646930fb71e7801bfcdb420268372cbd","observation_id":"4480048e-1f0c-4e0c-881e-0fbf42cb7970","resolution":{"observed_at":"2026-05-24T09:34:17.765546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tactip—tactile ﬁnger- tip device, challenges in reduction of size to ready for robot hand integration","venue":null,"work_id":"76b7cf66-0b4a-4401-9bdc-8ab0e0d573ee","year":2012},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:03e3a612d20f41a7c8c13d37ba293ec1cc5dfb3e2f4aae5d9e3b141d780c5ff8","observation_id":"3382f763-a802-4bae-8053-111b3121717c","resolution":{"observed_at":"2026-05-24T09:34:17.762015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motor prediction","venue":null,"work_id":"f1cb7c0e-a223-48b2-b9b1-67e32752f58f","year":2001},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:483d095a4b89afb9a99212975eb9d493960bf801cac053b04915c3eeabb453a9","observation_id":"e5ab922e-d5d3-43a3-aa76-6a0d0a7a7322","resolution":{"observed_at":"2026-05-24T09:34:17.758564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gelsight: High-resolution robot tactile sensors for esti- mating geometry and force","venue":null,"work_id":"1b8f6670-89da-4a76-80b8-33305f99798c","year":2017},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:12edc2dc8e55a1986f4bddb73c64df6165df83a6b2356e867509b1a8a9ee32d9","observation_id":"f8f8a923-dace-4328-8b7e-2dfccac9d420","resolution":{"observed_at":"2026-05-24T09:34:17.755442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sen- sorization of robotic hand using optical three-axis tactile sensor: Evaluation with grasping and twisting motions","venue":null,"work_id":"a5fe8c6b-6a6e-48f0-8e27-3fb917ad954c","year":2010},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:310e91d5f1d671e58b647215103824b713d2f93ab6987ca3bb212ae78bb0dec9","observation_id":"cf11080c-3170-44b1-90f5-5ec65dd6c202","resolution":{"observed_at":"2026-05-24T09:34:17.752281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to predict friction and classify contact states by tactile sensor","venue":null,"work_id":"ab5ad2af-0dcf-40cc-8433-6f8207302f53","year":2020},"citing_paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T09:31:34.871215Z"},"links":{"citing_paper":"/paper/2304.11193"},"observation_digest":"sha256:5a737f523739b357f008d410d9fad34bea7c0329c47206b358ff3ea80fb26d98","observation_id":"49c03405-2ce5-4730-a925-a3dd71e0b259","resolution":{"observed_at":"2026-05-24T09:34:17.800362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2304.11193","last_updated":"2026-05-12T21:42:39Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-01T05:03:34.775281Z","submitted_at":"2023-04-21T18:02:15Z","title":"Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":7,"verified_fuzzy":35},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2304.11193."}