{"as_of":"2026-08-20T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a240f705ee9a968c025dead9e3ec857ff7c96407e82fcf5b364c01539730a0a3","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:48:41.341989Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14573/citation-record","integrity":"/paper/2504.14573/integrity","json":"/paper/2504.14573/citation-record.json","paper":"/paper/2504.14573"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.300318Z","title":"Language models are few-shot learners,","venue":null,"work_id":"9fe64f9b-9ff8-45dc-be5c-1cda0109d310","year":2020},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:40.881252Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:6715b2ccb3e6889382d228da3f213aac9d9435c476cb62d4d8d09fb2599c125b","observation_id":"f3ff931c-f00f-4cc5-922c-a75b5e134705","resolution":{"observed_at":"2026-08-16T11:48:42.303987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:48:40.959241Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:40.959241Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:a9f676b24f097e35340af96b35231dad2e1e012da792230cf20ecf34161b4c36","observation_id":"1456ca1c-0c80-4692-88ab-440e8bac659c","resolution":{"observed_at":"2026-08-16T11:48:40.959241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.290123Z","title":"Visual instruction tuning,","venue":null,"work_id":"53f29de7-0dea-48a3-a350-9b38cbdf1cf9","year":2023},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.001519Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:e31d99025742e8cf8f5c918e0167efddd1010ee7c318e5676ecab3a3a30b2802","observation_id":"0312281f-c405-4ad3-a12a-3260074ecf4a","resolution":{"observed_at":"2026-08-16T11:48:42.292967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.278673Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":"30197a42-988d-4f6b-8756-f28187fe73c9","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.017834Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:a7efb8441ebc2bd3c19c1810752f72214c834c7ed7d6a92d61afddbad08db01f","observation_id":"132185ce-2eec-4bdc-9d98-c096e9fc073d","resolution":{"observed_at":"2026-08-16T11:48:42.282410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-16T11:48:41.022590Z","title":"Open X-Embodiment: Robotic learn- ing datasets and RT-X models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.022590Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:0f337ef642935ad8c2de7070c409d1849609cee8bd2d88d34c8cf7ac5de29625","observation_id":"04d83750-037d-446c-8fea-f9d6538618fa","resolution":{"observed_at":"2026-08-16T11:48:41.022590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T11:48:41.026512Z","title":"Do as i can and not as i say: Ground- ing language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.026512Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:70ec577a506dae49a351ce0bdbf82fd4eeecdbe24d2ac0d528a0bd0c8593e31a","observation_id":"f3f86c67-9e62-4ee3-a35f-91e98365bc02","resolution":{"observed_at":"2026-08-16T11:48:41.026512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-16T01:02:07.469457Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04693","snapshot_observed_at":"2026-08-16T11:48:41.030514Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.030514Z"},"links":{"cited_paper":"/paper/2501.04693","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:3766e2d39ac6d34754732f34cc4a95c12ac518426a1edc0547ec5af04b67d0b5","observation_id":"d6c1a5a5-7392-4882-9f09-705582fa5819","resolution":{"observed_at":"2026-08-16T11:48:41.030514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.267629Z","title":"Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation,","venue":null,"work_id":"df713fc0-3c22-4446-8c6b-a14cb296be3a","year":2023},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.034679Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:0ae48fa70bcbf8c665ff993d8bb71ee79265c55745167ed131155210c924588c","observation_id":"97f693e8-47d2-426e-ae50-13d62cf63b17","resolution":{"observed_at":"2026-08-16T11:48:42.271338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.256499Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"f7f632fe-63bb-4e86-9659-61a3b61ba321","year":2020},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.038234Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:468293e46bb2b6cc5d6dc77edae34c097074ed37e938cd8e7798e50dbf328efc","observation_id":"3c0c34f4-8ec3-4914-bc50-d17c2e4b6771","resolution":{"observed_at":"2026-08-16T11:48:42.260429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.244898Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":"a33e8316-a145-4e16-8352-df83a845f7e8","year":null},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.042980Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:215dd961e6c8514427afb2a65b8366ccb7ec65b0b58660445bcf47614fef3871","observation_id":"485919a2-0735-44e4-b65a-f05e6a11a542","resolution":{"observed_at":"2026-08-16T11:48:42.248199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.015537Z","title":"Diffusion policy: Vi- suomotor policy learning via action diffusion,","venue":null,"work_id":"b25e0202-891e-499b-83a6-a663a93c9ae0","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.050166Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:cb8fdeaeb80ceb95fed18a63251cab5c0cdef7c8114b958bb798109d3e78b823","observation_id":"eee79cbd-943f-4459-9eb9-e829ef36575b","resolution":{"observed_at":"2026-08-16T11:48:42.094250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-16T11:48:41.053633Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.053633Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:c77e3e10851bf19eb2c042fcfceeb266817b622e35ef7d6707951f069c7a869d","observation_id":"8607ca95-0fb4-45dc-a112-f9857bb109e5","resolution":{"observed_at":"2026-08-16T11:48:41.053633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03729","last_updated":"2024-11-11T14:09:00Z","snapshot_observed_at":"2026-08-16T14:03:31.745838Z","submitted_at":"2024-04-04T18:00:15Z","title":"JUICER: Data-Efficient Imitation Learning for Robotic Assembly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03729","snapshot_observed_at":"2026-08-16T11:48:41.057387Z","title":"JUICER: Data-Efficient Imitation Learning for Robotic Assembly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.057387Z"},"links":{"cited_paper":"/paper/2404.03729","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:1b27a8e1e253837e992fc12b951af3dbf68cfb07434b5f8db57c60ecdd266297","observation_id":"5c05e961-0ebd-4a2b-baca-3fe5046c603d","resolution":{"observed_at":"2026-08-16T11:48:41.057387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.962674Z","title":"Goal con- ditioned imitation learning using score-based diffusion policies,","venue":null,"work_id":"24ebf296-777c-4c41-bf14-494093ceffd5","year":2023},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.060818Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:ac9735a8bffc61c53b919eef6d57abc0ba99e83b48b863fe5670e33e7e1d379f","observation_id":"e472a21f-6103-4384-9459-ef180af2de9b","resolution":{"observed_at":"2026-08-16T11:48:41.965764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-16T11:48:41.064055Z","title":"Diffusion Policy Policy Optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.064055Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:62802eb84ed852e9961756362b2dc32ac563952d310b5b9ec4d0e72bda369cb3","observation_id":"e2ca8cd2-794e-42ee-96c0-830f4d422557","resolution":{"observed_at":"2026-08-16T11:48:41.064055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07991","last_updated":"2021-11-08T00:54:20Z","snapshot_observed_at":"2026-08-16T17:56:07.711338Z","submitted_at":"2021-09-16T14:00:59Z","title":"ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07991","snapshot_observed_at":"2026-08-16T11:48:41.067698Z","title":"ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.067698Z"},"links":{"cited_paper":"/paper/2109.07991","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:44e4f14e0cd6d78997be652383a81ad908fd1bb3bcdc293c8ba423e924a6881d","observation_id":"3a33d714-c958-4556-878c-6e12d413a8f4","resolution":{"observed_at":"2026-08-16T11:48:41.067698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02389","last_updated":"2022-04-05T17:55:01Z","snapshot_observed_at":"2026-08-16T17:09:05.326222Z","submitted_at":"2022-04-05T17:55:01Z","title":"ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer","version":1},"cited_work":{"arxiv_id":"2204.02389","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02389","snapshot_observed_at":"2026-08-16T11:48:41.852465Z","title":"ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer","venue":"cs.CV","work_id":"db82dc2d-f8a8-4d97-8eff-e8d5f407adb5","year":2022},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.071088Z"},"links":{"cited_paper":"/paper/2204.02389","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:3a9419d77fd06b5b7163af94e9887c6b18e7d24124130b1a9850b079670602e2","observation_id":"c14a957b-25b0-4c96-8a0a-e29d21e7775d","resolution":{"observed_at":"2026-08-16T11:48:41.856026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00956","last_updated":"2023-06-01T17:51:22Z","snapshot_observed_at":"2026-08-16T15:27:23.282242Z","submitted_at":"2023-06-01T17:51:22Z","title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects","version":1},"cited_work":{"arxiv_id":"2306.00956","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00956","snapshot_observed_at":"2026-08-16T11:48:41.706436Z","title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects","venue":"cs.CV","work_id":"ff117026-6cef-41b3-a421-f6e1f702070e","year":2023},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.074083Z"},"links":{"cited_paper":"/paper/2306.00956","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:a91f25ac0ca4a7e7d1e3eca90de60dc02a7614315b221e01a65c92cd8e9adffc","observation_id":"1cf824f7-6a74-452c-8078-e54b71b85ad8","resolution":{"observed_at":"2026-08-16T11:48:41.794789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03858","last_updated":"2022-12-08T05:52:16Z","snapshot_observed_at":"2026-08-17T18:13:10.903496Z","submitted_at":"2022-12-07T18:55:53Z","title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03858","snapshot_observed_at":"2026-08-16T11:48:41.077938Z","title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.077938Z"},"links":{"cited_paper":"/paper/2212.03858","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:7cd10012a18a34413656b660dada7a14ab45cf3c6cd6886501d2d7710e1be39e","observation_id":"9869718a-594d-4844-8bea-b42875b80195","resolution":{"observed_at":"2026-08-16T11:48:41.077938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.952144Z","title":"Play to the score: Stage-guided dynamic multi-sensory fusion for robotic manipulation,","venue":null,"work_id":"2e57991c-a6a2-4a4b-b745-5ca7dc2e97fc","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.081930Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:ec297515c378266ab5439b7ce0a99b722dfdfe3127cac3279645e4e59714e6ff","observation_id":"c0b6185d-b6ab-4c2c-8411-093179947ea0","resolution":{"observed_at":"2026-08-16T11:48:41.955930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00084","last_updated":"2022-10-25T15:03:58Z","snapshot_observed_at":"2026-08-14T20:37:08.710376Z","submitted_at":"2017-08-31T21:05:18Z","title":"Behavior Trees in Robotics and AI: An Introduction","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00084","snapshot_observed_at":"2026-08-16T11:48:41.085289Z","title":"Colledanchise and P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.085289Z"},"links":{"cited_paper":"/paper/1709.00084","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:0b1c4705c7fc7995f3147c3acb7b4207ec3f3303b8ffd894c12cd8e9a2e845f6","observation_id":"607a49ca-f059-4917-a83d-2f23aeba9903","resolution":{"observed_at":"2026-08-16T11:48:41.085289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.117470Z","title":"Integrated Task and Motion Planning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.117470Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:5a2b001ed93ed9fb165077a44a260e3f788a748d5a44a975494eea4b4ca21223","observation_id":"fb528617-4384-45b6-8605-4d1a17362d21","resolution":{"observed_at":"2026-08-16T11:48:41.117470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.941496Z","title":"Long-horizon manipulation of un- known objects via task and motion planning with esti- mated affordances,","venue":null,"work_id":"bdfa1185-55b9-4b49-860b-cbb7541f8ed9","year":2022},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.157743Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:54c6968da7aaea25403f766359f0257f2459111f2404662e66a40fe23970660a","observation_id":"a7fb9d10-84c8-499c-91a5-c031e5a75bdb","resolution":{"observed_at":"2026-08-16T11:48:41.945030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9560934","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.627008Z","title":"Learning Geometric Reasoning and Control for Long-Horizon Tasks from Visual Input,","venue":null,"work_id":"195bc1e0-9505-496a-997d-b307b183b614","year":2021},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.201539Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:442682d93c27a1e5e24dede208bcf66c4a454967bf77941db6f504dbdf339a94","observation_id":"fb8d11f5-a5af-4813-800a-9a32cde52ec4","resolution":{"observed_at":"2026-08-16T11:48:41.632710Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1038846","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.552091Z","title":"Multistage Cable Routing Through Hierarchical Imitation Learning,","venue":null,"work_id":"a2de3cc2-259c-4f5a-bd15-9df9463c1fc8","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.233328Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:00a4fe8c48f0661930c669f17e9ce2b2345cad3ac682f9753d4297610cbfdd0d","observation_id":"867c3e7b-69fd-4598-90cf-5f68689fb311","resolution":{"observed_at":"2026-08-16T11:48:41.557398Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1080280","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:41.487323Z","title":"DexSkills: Skill Segmentation Using Haptic Data for Learning Autonomous Long-Horizon Robotic Manipulation Tasks,","venue":null,"work_id":"63459f2d-b063-46c4-aa85-4bc22f651675","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.292311Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:295f9d7cf28b051ef2cc473f9121137a33cdcbb2a585d70d831ca9d3af45f451","observation_id":"73d6397e-a48f-4c02-82ea-b4488c087a5e","resolution":{"observed_at":"2026-08-16T11:48:41.493012Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17684","last_updated":"2024-04-26T20:27:10Z","snapshot_observed_at":"2026-08-16T13:57:26.657998Z","submitted_at":"2024-04-26T20:27:10Z","title":"Generalize by Touching: Tactile Ensemble Skill Transfer for Robotic Furniture Assembly","version":1},"cited_work":{"arxiv_id":"2404.17684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.17684","snapshot_observed_at":"2026-08-16T11:48:41.415175Z","title":"Generalize by Touching: Tactile Ensemble Skill Transfer for Robotic Furniture Assembly","venue":"cs.RO","work_id":"768dfa91-1341-4142-962f-bab309f725ae","year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.330054Z"},"links":{"cited_paper":"/paper/2404.17684","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:ec971b96f13d3ad1cbe77d3eccc356314169b50a92e6ffc4c11ff60dedb9c3b8","observation_id":"47dd1755-0c13-48e5-8095-07418b383477","resolution":{"observed_at":"2026-08-16T11:48:41.421230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16677","last_updated":"2024-12-12T18:40:16Z","snapshot_observed_at":"2026-08-19T00:04:57.769548Z","submitted_at":"2024-07-23T17:44:54Z","title":"From Imitation to Refinement -- Residual RL for Precise Assembly","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16677","snapshot_observed_at":"2026-08-16T11:48:41.334109Z","title":"From imitation to refinement – residual rl for precise visual assembly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.334109Z"},"links":{"cited_paper":"/paper/2407.16677","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:0015c5deae7b245eda385881f25ddc8baf1f5e9a9bc9c056df632e9fc5b36c77","observation_id":"fb2fc65c-2c57-4065-aae4-362ec9278794","resolution":{"observed_at":"2026-08-16T11:48:41.334109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-08-19T15:15:16.812909Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-16T11:48:41.337614Z","title":"Residual policy learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.337614Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:78e557073c850ceb4d9725c20be557a9b85dec6e9a251d977d18175bb3d27621","observation_id":"478db9e1-c3cc-4045-b3ae-7e72cf7c74e8","resolution":{"observed_at":"2026-08-16T11:48:41.337614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-16T11:48:41.341989Z","title":"R3M: A Universal Visual Representation for Robot Manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.341989Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:ab3a30fa33120892981450e3f325bb64f0e5f70521dd1c7e0c7b491383128469","observation_id":"f663ff8d-6d1d-4a2d-ba20-5bd2b1dcced2","resolution":{"observed_at":"2026-08-16T11:48:41.341989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:48:42.156837Z","title":"Available: https://openreview.net/ forum?id=PxTIG12RRHS","venue":null,"work_id":"5cb81d32-314d-48ef-b238-4487528832c4","year":null},"citing_paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:41.046778Z"},"links":{"citing_paper":"/paper/2504.14573"},"observation_digest":"sha256:5f6100dd9e567eddd7dbe0b587fd1a3b313113bb8631be5b6a011e298baa429c","observation_id":"12746526-d93e-4e30-9970-85210a2af237","resolution":{"observed_at":"2026-08-16T11:48:42.198642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14573","last_updated":"2025-04-20T11:32:43Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T15:18:16.063988Z","submitted_at":"2025-04-20T11:32:43Z","title":"Modality Selection and Skill Segmentation via Cross-Modality Attention"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":6,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2504.14573."}