{"as_of":"2026-08-13T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4731fd33ad1229dcac91f226f524e989da1cb0f4900dea9d00ff2f14525d647","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:59:11.510737Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09180/citation-record","integrity":"/paper/2507.09180/integrity","json":"/paper/2507.09180/citation-record.json","paper":"/paper/2507.09180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodality Driven Impedance-Based Sim2Real Transfer Learning for Robotic Multiple Peg-in-Hole Assembly","venue":null,"work_id":"e2db379a-b47a-432a-9c27-ed01c6dc4b49","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:84a0aae5f2d7a86c0020c1afd5d418c7d0ddcb70be2ca0b8dfcde5049610f798","observation_id":"819f32f1-4621-4109-a888-b093931d560f","resolution":{"observed_at":"2026-05-22T00:00:48.462630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward Effective Deep Reinforcement Learn- ing for 3d Robotic Manipulation: Multimodal End-to-End Reinforce- ment Learning from Visual and Proprioceptive Feedback","venue":null,"work_id":"295e93c5-0663-4998-8ad2-10dc8290303f","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:23dd31d3448fdab960bf0e660b78febaf959ec703e0af71d42a8312ab509a7a7","observation_id":"8d78e3ad-1c86-4eaf-b309-797e105dcc02","resolution":{"observed_at":"2026-05-22T00:00:48.465276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual-Force- Tactile Fusion for Gentle Intricate Insertion Tasks","venue":null,"work_id":"a976fb9c-8a2e-4042-a774-190edafb443d","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:41bd9570a63d178074b2ff2a3315560942c48a9c1d1063470515230fe8bab17f","observation_id":"510bbe18-c457-486b-a352-19a6d00d963f","resolution":{"observed_at":"2026-05-22T00:00:48.457490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visuotactile-RL: Learning Multimodal Manipulation Policies with Deep Reinforcement Learning","venue":null,"work_id":"cb94e84c-4ac4-4104-9bd4-08780e074df7","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:385a21ed910b135de96fbb00bcb818ea61ccb1ca10c769ccc51e8cdb31cf02d9","observation_id":"aa08801e-49a0-4579-9131-ed5b7c7778cd","resolution":{"observed_at":"2026-05-22T00:00:48.460466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drm: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","venue":null,"work_id":"fccb83d6-e600-4e30-93a6-f665bbf6d363","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:eee072b2d7694a8d9f5f6e933bbec59980fef0da9cf600ea6250d4d72423457d","observation_id":"0a5c09e0-3a73-4c39-978e-5b4af7ad94fc","resolution":{"observed_at":"2026-05-22T00:00:48.451660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Better with Less: Effective Aug- mentation for Sample-Efficient Visual Reinforcement Learning","venue":null,"work_id":"d2a7ed4e-d7d9-4942-abbf-22a16c63ab26","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:1530edcf4b43bdf904b1f250dad3963d50fb55aaf11efae396a1c6fbe4fa8169","observation_id":"1be78e89-8b07-4076-8a3b-5e35c60f0f18","resolution":{"observed_at":"2026-05-22T00:00:48.454738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10190","last_updated":"2020-07-31T13:43:53Z","snapshot_observed_at":"2026-08-09T16:21:48.976373Z","submitted_at":"2020-04-21T17:57:04Z","title":"Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2004.10190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.10190","snapshot_observed_at":"2026-07-04T08:29:41.688986Z","title":"Never stop learning: The effectiveness of fine-tuning in robotic reinforcement learning","venue":null,"work_id":"9e9883b4-bd48-4981-9bf1-798b3e831692","year":2004},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2004.10190","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:94b960b54ce554fd251af7e067021a50653374e1db25396c4b0870772f2686d0","observation_id":"e0548e26-4b01-4c05-ac3c-ca7de706ca46","resolution":{"observed_at":"2026-05-22T00:00:47.815454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Rein- forcement Learning With Self-Supervised 3d Representations","venue":null,"work_id":"59a22b9d-a9bd-4c53-a441-fb5316c32f3f","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:f3d20d5a9fd393265a2519ad5dd1aaec35a4f063cc6d6fd2db23867042cd732f","observation_id":"c07c4075-db03-4749-895b-cd3ce8d6c3b8","resolution":{"observed_at":"2026-05-22T00:00:48.479284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-World Robot Learning with Masked Visual Pre-training","venue":null,"work_id":"a014fffd-1647-4508-b00c-8c377957ab92","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:ab67cb3f7fa63f5a1e6b4f877352402ea6ac617a198b7fcae32575cad6bc3a47","observation_id":"fa0067e0-96f7-41b9-af15-fc49d41facab","resolution":{"observed_at":"2026-05-22T00:00:48.473756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-Trained Image Encoder for Generalizable Visual Reinforcement Learning","venue":null,"work_id":"bd501684-c747-4a4f-af2b-495b3ae1612a","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:78bdcf3f7fdd54b87e0802107a398799825b434e121367cf69cef6f87176bfcc","observation_id":"6af81014-8041-4faf-973a-42cf48a879d1","resolution":{"observed_at":"2026-05-22T00:00:48.484737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient RL via Disentangled Environment and Agent Representations","venue":null,"work_id":"42ec7796-1b43-4675-ba12-37ec215cebee","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:9106f2cc40529f44b8b4a12d8f7e5c1461d6fc3a411f194b8fd3c771f6c3a980","observation_id":"07adfbcc-108a-40ed-9a0b-fd89f18e8c49","resolution":{"observed_at":"2026-05-22T00:00:48.552525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DEAR: Disentangled Environment and Agent Representations for Reinforcement Learning without Reconstruction","venue":null,"work_id":"6d642d03-811f-40d0-ac3d-1f989fba39c7","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:b7d7b4a65b6187a65012366ffcd574e281375ebbecfb5f1faf2eea8fef194cfb","observation_id":"c4c4d2b4-d089-4e9e-9a4c-daa4306e67ad","resolution":{"observed_at":"2026-05-22T00:00:48.544094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim- to-Real Transfer of Robotic Control with Dynamics Randomization","venue":null,"work_id":"4af37898-e996-482f-acd1-3249f41cc971","year":2018},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:464bf947b80af2b72e79699cab62d81884785ffc26bb6c709a35dc7da9cbd7af","observation_id":"9ffc13f5-d2a5-431d-8935-4ece2cdb6a6d","resolution":{"observed_at":"2026-05-22T00:00:48.541096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysis of Randomization Effects on Sim2Real Transfer in Reinforcement Learning for Robotic Manipula- tion Tasks","venue":null,"work_id":"fdce9128-f31e-4508-98ef-c8958c4d4fe0","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:17a012d7489c9b36c683dd22ff49eaec3b1e889d50c05097cefd80859f26e87c","observation_id":"372cd3e8-aad1-4e1a-8052-87b845ba17d4","resolution":{"observed_at":"2026-05-22T00:00:48.538756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation With Trans- formers","venue":null,"work_id":"b0a42331-2d83-4fe9-85cc-bdf58f519080","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:539aba74219329342134278e102aad02f65b0cedb16d9cdeb41a0b22840f3e4f","observation_id":"287b9720-f9a8-47d6-baf6-ccb72dc5781f","resolution":{"observed_at":"2026-05-22T00:00:48.547103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatio-channel attention blocks for cross-modal crowd counting","venue":null,"work_id":"961eabb6-3d3c-4ef3-bc83-2eb7afe3f4a3","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:738cd82d803cc7be9027620c00e2fe70b6e9efabba064686890a221cf6c5da45","observation_id":"4b9af81e-e195-4ef1-9ef4-230290db922b","resolution":{"observed_at":"2026-05-22T00:00:48.481735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"b5b0361e-eae8-49d4-97ed-d037b301dbbc","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:17ac1b3f4f5cfb56fc925dff8ec01ad13d56933c1fd7625622eb61604f9a6fc7","observation_id":"660c378f-e534-4fc6-8c4e-032dfb787225","resolution":{"observed_at":"2026-05-22T00:00:48.532896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look where you look! Saliency-guided Q-networks for generalization in visual Reinforcement Learning","venue":null,"work_id":"325271f3-facc-44cf-8983-fbcaee9fbb28","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:05f511893a16a9a1a81d3830c113b0056f2f225cf2124db123d001746552981f","observation_id":"8f248516-1040-42cb-91c6-cd8d89c16cc3","resolution":{"observed_at":"2026-05-22T00:00:48.524300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RL-ViGen: A Reinforcement Learning Benchmark for Visual Generalization","venue":null,"work_id":"c15bc4e0-eb15-45c4-bd2d-1f2ef938cccc","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:605834ac061402dd99caafb0f2f149fdb2464b17af5cf22bef801acf9cb236d2","observation_id":"eb2cde8e-813b-4a3a-86c6-783959127e92","resolution":{"observed_at":"2026-05-22T00:00:48.526964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Augmented Data","venue":null,"work_id":"19422a85-6c7a-4637-a12c-d120790e7c37","year":2020},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:6fa671d18947a012a82d8799bcd9641534dc38e07c3e770737f542cacd50e68d","observation_id":"c3dce98c-5c9a-4511-a9b0-5912c9d74ecb","resolution":{"observed_at":"2026-05-22T00:00:48.530072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","venue":null,"work_id":"e749c83d-ba04-426a-9162-376ebc2d9d59","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:7c00f62528949c35ca65ff66817f0986eea716402d1aa57dbcde056feff61c1f","observation_id":"36e7d5df-290b-4e26-8594-46669f09c04b","resolution":{"observed_at":"2026-05-22T00:00:48.535815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering Visual Con- tinuous Control: Improved Data-Augmented Reinforcement Learning","venue":null,"work_id":"eaf62a87-5ecb-45e6-ab1f-48b5614a0818","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:3df8ca4eaf436ca49ae70d7b5f64f14224222616160267c47af1c9f77a3d7c92","observation_id":"e5333ba0-176b-4f15-bc4a-1395285169c3","resolution":{"observed_at":"2026-05-22T00:00:48.555546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation","venue":null,"work_id":"9dac63c8-5b9c-4010-8383-12f7304a6e3c","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:c4231e064067d41b1b5ea2c5b0f35f4518d19d42d982e44c6e3dae91652fe014","observation_id":"377dc0ef-2789-4972-91ed-92692b06f24f","resolution":{"observed_at":"2026-05-22T00:00:48.518285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":"322d7ebb-8716-465b-935b-d289fe973e56","year":2016},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:11015fcf141d6f188502b15bfc039567bc7a44c39cf038079ef2fa344ee791f3","observation_id":"530bde21-bfc6-4976-9500-492c596d1dea","resolution":{"observed_at":"2026-05-22T00:00:48.515010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:45e5c454deeb9bbeef53d581679ad43bfa72493a536f58f345b238b86ab83c6b","observation_id":"c3b17517-3b51-487e-8d98-3de0ce097121","resolution":{"observed_at":"2026-05-22T00:00:47.807886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Unsurprising Effectiveness of Pre-Trained Vision Models for Control","venue":null,"work_id":"2f2a791b-2a08-4fbd-8406-65af2f28a883","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:5ad22f971bb9694ef1acc577d2ba25c396c41dd0b386dce53b5b524a83c07f80","observation_id":"4b6b602e-e262-4c37-9079-1815a06132f9","resolution":{"observed_at":"2026-05-22T00:00:48.521463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":null,"work_id":"c98ab9b1-4247-4c8e-b822-c084d3b8d1cd","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:ee74f840ec693565642426fd07fb21d7ec752a01981ca8f1e4a6070aee559b79","observation_id":"aec0c839-1368-42c1-9823-227e0b13837f","resolution":{"observed_at":"2026-05-22T00:00:48.506608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look Closer: Bridging Egocentric and Third-Person Views With Transformers for Robotic Manipulation","venue":null,"work_id":"5b75ad69-8a26-45c7-8a82-92c8e2cee19a","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:73740fa790e9dc433ca36664f235f9a0047432a7ea02d2332f6d1b5dbd005e3c","observation_id":"51b462f2-a171-4ab5-9849-d242070b39ae","resolution":{"observed_at":"2026-05-22T00:00:48.510005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22325","last_updated":"2024-10-30T03:33:08Z","snapshot_observed_at":"2026-08-12T22:12:30.614626Z","submitted_at":"2024-10-29T17:58:13Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets","version":2},"cited_work":{"arxiv_id":"2410.22325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.22325","snapshot_observed_at":"2026-07-03T18:08:46.873665Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Dataset","venue":null,"work_id":"c9285d9b-d37c-480b-bcb7-49e83d78b23d","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2410.22325","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:b8578e725f7bfeab88365fa9ae5e9d0ff98a18f23a5227cfb44134b470b245fc","observation_id":"51050fac-863d-4dcb-9a39-2889c432a0f6","resolution":{"observed_at":"2026-05-22T00:00:47.811883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4ada4eada32f83c188c4458d3a6906e7773a75779be6a93482efa0045f8fcb39","observation_id":"9cb800de-f89b-43ec-a47c-41272866f1ed","resolution":{"observed_at":"2026-05-22T00:00:47.819430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim-to-Real Transfer of Robotic Assembly with Visual Inputs Using CycleGAN and Force Control","venue":null,"work_id":"307ff1a1-4513-44c2-92b7-95b43ed511b4","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:d2d410730bbe4c323d7bd6f2ca3ef5ef49a2780d96770a5eb6d9dc0b45a87c84","observation_id":"73f6c1ee-06f7-4d4e-be03-f6573b0507fa","resolution":{"observed_at":"2026-05-22T00:00:48.512678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":"a9750bb7-146f-4ce6-8b34-d25651d2d60d","year":2017},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:8b5654bf269b94c896c92f1f3b1bde3c5d2aefd7c98ff33f2f6c759a67374eab","observation_id":"092e63b1-6c79-4bd5-ab7b-f2242ff76fe4","resolution":{"observed_at":"2026-05-22T00:00:48.504132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Manipulate Anywhere: A Visual Generalizable Framework For Reinforcement Learning","venue":null,"work_id":"069528f0-fffc-4805-b2a0-d63a3d684cfb","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:2e834e4f14a914a2255e1ab58cc614e22eccfbdef2176d15e58d3770aeb7b9ce","observation_id":"4150663c-7785-4e60-8a48-2a250411e38e","resolution":{"observed_at":"2026-05-22T00:00:48.558548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked Autoencoders Are Scalable Vision Learners","venue":null,"work_id":"56b0eb2e-c108-46f7-83d2-f9c37c435489","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:cb0b7b23f4be69150eae806c31070ca54bb27b7e5a047b38c6c90a1da7c77ee2","observation_id":"aac1a16e-3098-4d89-a2df-b969353f36a7","resolution":{"observed_at":"2026-05-22T00:00:48.498205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Power of the Senses: Generalizable Manipulation from Vision and Touch through Masked Multimodal Learning","venue":null,"work_id":"00145db8-628d-48a3-917a-77e3d9b25efb","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4ecbca74c3c159fb39ee65ac718e95fc944395c2d6ca54eb57d9c52fcef4cbe3","observation_id":"efeedff3-5e4d-4550-a950-082789236f8d","resolution":{"observed_at":"2026-05-22T00:00:48.549670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CURL: Contrastive Unsuper- vised Representations for Reinforcement Learning","venue":null,"work_id":"b432b240-328d-482b-bd6a-fe6f50d7ee2a","year":2020},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:6a813c6ac0323063cc2e21ade22c2b8ea5940c262bafe80b6b4c0ac8681ef58b","observation_id":"fc16e5fa-c481-4d91-9ab9-16de5de6e87f","resolution":{"observed_at":"2026-05-22T00:00:48.495138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras","venue":null,"work_id":"e49d4840-e596-4663-ade2-fe00071b4866","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:9367177fe417beb41375bcf2d92354b4129f5d66f153f8e13224cac44592e558","observation_id":"6a314cfc-55d8-49af-b34b-654321bb534d","resolution":{"observed_at":"2026-05-22T00:00:48.501516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning","venue":null,"work_id":"612bcf2a-bd73-4161-b829-6a18e3b15e78","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:583db278f50a088b9dea828f5a3c5110004e0ae5bebe12ff2020d47ae4a55405","observation_id":"299dd699-b181-48dd-a673-5b1c92e361ad","resolution":{"observed_at":"2026-05-22T00:00:48.470699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":"f0c5dedc-fc4c-43dd-bf57-7c03f6391dba","year":2016},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4177cce014c7342a4f07ef18d022e4204e5f34d590c7f43944d0c8911e9dc3bf","observation_id":"d7a8daee-7227-42b9-a07d-060f3888dbba","resolution":{"observed_at":"2026-05-22T00:00:48.476645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variable Impedance Control in End-Effector Space: An Action Space for Reinforcement Learning in Contact-Rich Tasks","venue":null,"work_id":"341c3b0d-2439-45c2-8cfe-6b0bd9d12807","year":2019},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:b6dfaaf8d903657fa97b283c62fac464ef37886bb072804810e7a2860aa4ac63","observation_id":"086d17ed-75a1-4838-9acf-c9c0f071d749","resolution":{"observed_at":"2026-05-22T00:00:48.492445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization","venue":null,"work_id":"3fc15d5e-e459-45f4-905c-2132fb0753bd","year":2017},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:f4d4b72d3242afb26838465490ce8b8b7f4d714b3bdece39c97ba58a0046810e","observation_id":"e5eb2811-775b-46fe-89b5-38cad8a0611c","resolution":{"observed_at":"2026-05-22T00:00:48.468244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Early Convolutions Help Transformers See Better","venue":null,"work_id":"a9243b91-4a60-4f5f-8439-59bbaef3b4e4","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:b257b14c15532ad2ef281d3dfb6aba75aa205a4b49a48b4d112117b18c8e656e","observation_id":"50cd6993-c053-4ca3-b366-4d134a9c3380","resolution":{"observed_at":"2026-05-22T00:00:48.487384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","venue":null,"work_id":"f80064c0-7f69-4c9a-833d-724ea296d906","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4ae412b475de45e218bc4fcebc7444688449534c3b348f328bc0e19ab2acb8ca","observation_id":"20ac7303-cd56-4cd3-91ab-ea8399408e12","resolution":{"observed_at":"2026-05-22T00:00:48.489897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T11:41:00.501691Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":39},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.09180."}