{"as_of":"2026-08-04T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91f9cc6a2526cc5c0bda858e4eb1c22b2a562e14474b313d1ac2f4c775a61632","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T15:44:25.021995Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:28:10.101325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03637","snapshot_observed_at":"2026-07-13T06:16:27.546219Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08857","last_updated":"2026-07-13T16:37:13Z","snapshot_observed_at":"2026-07-16T23:19:40.650747Z","submitted_at":"2026-07-09T18:27:41Z","title":"AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T06:16:27.546219Z"},"links":{"cited_paper":"/paper/2605.03637","citing_paper":"/paper/2607.08857"},"observation_digest":"sha256:8c5b2f6970f240172b998601250c0afe81cba7325888bcb591f60357047fe8f4","observation_id":"75a50c3e-30a1-4e3c-b583-61baa9cbd6f3","resolution":{"observed_at":"2026-07-13T06:16:27.546219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03637","snapshot_observed_at":"2026-07-14T15:28:10.101325Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08857","last_updated":"2026-07-13T16:37:13Z","snapshot_observed_at":"2026-07-16T23:19:40.650747Z","submitted_at":"2026-07-09T18:27:41Z","title":"AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T15:28:10.101325Z"},"links":{"cited_paper":"/paper/2605.03637","citing_paper":"/paper/2607.08857"},"observation_digest":"sha256:f9e697099f38b5862a8b19d5a6bb51c860ecfb5015991a8c388255be6bfa85d9","observation_id":"7f584892-e9a6-4ada-ba96-5c55b2067267","resolution":{"observed_at":"2026-07-14T15:28:10.101325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.03637/citation-record","integrity":"/paper/2605.03637/integrity","json":"/paper/2605.03637/citation-record.json","paper":"/paper/2605.03637"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:5f612ccdf1e742ace40e1c37e903f410f3a0ed97d5d7a18d65b6cd63e92aba51","observation_id":"827612a1-0079-43b8-8226-b35270fc0466","resolution":{"observed_at":"2026-05-12T11:01:31.548286Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03666","last_updated":"2024-05-06T17:43:34Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:43:34Z","title":"ScrewMimic: Bimanual Imitation from Human Videos with Screw Space Projection","version":1},"cited_work":{"arxiv_id":"2405.03666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03666","snapshot_observed_at":"2026-06-29T07:23:12.526801Z","title":"Screwmimic: Bimanual imitation from human videos with screw space projection","venue":null,"work_id":"377f0a9c-8c1d-4956-8312-654397397bd6","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2405.03666","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:dd53e79c23ad0d8edcb2b1410c07ad6f2c37a10b7e3a9cec1b2a44c73a44e0d3","observation_id":"7d317eb4-1997-4ba4-b875-06c7fa58895d","resolution":{"observed_at":"2026-05-12T11:01:31.539086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19167","last_updated":"2025-04-30T13:32:06Z","snapshot_observed_at":"2026-08-02T07:41:45.462049Z","submitted_at":"2024-11-28T14:09:42Z","title":"HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos","version":2},"cited_work":{"arxiv_id":"2411.19167","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19167","snapshot_observed_at":"2026-07-10T23:27:38.901330Z","title":"Hot3d: Hand and object tracking in 3d from egocentric multi-view videos.arXiv preprint arXiv:2411.19167","venue":"cs.CV","work_id":"786567af-8f37-4dee-a9b1-fa28d954fea4","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2411.19167","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:b47f1d9ac1f5828a8f122ab4d867d8b71d77f189186b19df76eace31bd885ea4","observation_id":"096874db-3c42-467f-8d73-433da61f372e","resolution":{"observed_at":"2026-05-12T11:01:31.542416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:6244c1ae6be04ce6547e2123c72082913e55069f1e0bd62ffa37b054722d3eae","observation_id":"07c6e875-c634-4ac8-ace1-057e06b9bade","resolution":{"observed_at":"2026-05-12T11:01:31.545329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions.Computer Sci- ence","venue":null,"work_id":"e720c00a-5517-42af-acd3-a2f36b4098d8","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:bca39853cdbab32ac345310f2b61d91255bd26ea7a66edf88a4cad67ac6c7e48","observation_id":"5cc62dec-6b38-4355-8bd6-3a1d4c7c73d6","resolution":{"observed_at":"2026-05-27T12:24:03.959542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04244","last_updated":"2025-04-09T10:18:05Z","snapshot_observed_at":"2026-07-06T20:02:12.866050Z","submitted_at":"2024-12-05T15:26:51Z","title":"GigaHands: A Massive Annotated Dataset of Bimanual Hand Activities","version":3},"cited_work":{"arxiv_id":"2412.04244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04244","snapshot_observed_at":"2026-07-03T17:48:45.510585Z","title":"Gigahands: A massive annotated dataset of bimanual hand activities.arXiv preprint arXiv:2412.04244","venue":null,"work_id":"31d95897-3804-4a56-beca-a8ca0f34d80d","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2412.04244","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:b7f18aed8f816862ae97e9b806fe27c81dab7630d1286fa5f1f8fd117213848e","observation_id":"cffcf19f-b6ec-4a10-94d3-bfe2b32d95f9","resolution":{"observed_at":"2026-05-12T11:01:31.558785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video depth anything: Consistent depth estimation for super-long videos","venue":null,"work_id":"e57b902b-ddeb-48a9-8b86-517418af83c7","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:0163d3ec988e2deb444c31517cabe8b7d589c93358fec783ceb20c0b5cbf6dd1","observation_id":"d29b6301-b25f-4edf-b952-99846598dd74","resolution":{"observed_at":"2026-05-27T12:24:03.962284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":"2505.11709","doi":"10.48550/arxiv.2505.11709","metadata_source":"pith","pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-07-11T00:07:42.959738Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","venue":"cs.CV","work_id":"4190fb9c-70e0-4388-aa0b-516589489047","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:ca0df7423591fbdae1abfaec4b51b742b74f82283e4df29a264c83f7bf52fee4","observation_id":"623ab139-3a95-4e11-9e51-e459127bd83e","resolution":{"observed_at":"2026-05-15T15:40:29.471447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Club: a contrastive log-ratio upper bound of mutual information","venue":null,"work_id":"0addc2ae-e916-49ff-bca5-aedf897a4bf3","year":2020},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:5e3a7791e970fddb338cece43a9ed3c3913677a94d390108d04b20ecaf3f08fc","observation_id":"8aaa76c3-8fc9-45ad-a5d7-9b1988302356","resolution":{"observed_at":"2026-05-27T12:24:03.964871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:7d405acf2b7884eaebae7479f9ba5e44ee00ccfbb998cc0945d67e7f7edb104a","observation_id":"411e13ff-b86e-4dee-97d6-c190cf691409","resolution":{"observed_at":"2026-05-12T18:38:11.644840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The trimmed iterative closest point algorithm","venue":null,"work_id":"08122d2a-7172-490e-8361-1d6cb213348f","year":2002},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:dc432ff808082278a009bc9605c6f49b93d45db2cab305e6917e528f9c9131df","observation_id":"623f8c52-0de6-41f0-9a16-8f588d2a1b11","resolution":{"observed_at":"2026-05-27T12:24:03.967763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:a614854f71a36460a1fbfc6e877bad80d96550b3ca1afbfd1958723a717d9c55","observation_id":"100584e7-f53a-43c4-b823-e3208d564c15","resolution":{"observed_at":"2026-05-16T00:53:54.408026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding","venue":null,"work_id":"5d26c350-62c2-4068-a268-b610ae50537e","year":2019},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:9c34437f8bb4875615988be0f840d86dc360a3ba78bbee6f8cbc5fc30126988d","observation_id":"4d214dac-365b-4072-8430-673be4fb1ef5","resolution":{"observed_at":"2026-05-27T12:24:03.970453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24221","last_updated":"2024-10-31T17:59:55Z","snapshot_observed_at":"2026-07-06T19:43:05.453551Z","submitted_at":"2024-10-31T17:59:55Z","title":"EgoMimic: Scaling Imitation Learning via Egocentric Video","version":1},"cited_work":{"arxiv_id":"2410.24221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.24221","snapshot_observed_at":"2026-07-10T18:47:31.552848Z","title":"Egomimic: Scaling imitation learning via egocentric video","venue":"cs.RO","work_id":"92a2f39f-9dd2-401e-a854-aab6064581f0","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2410.24221","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:45ca555a8d1e4b6935c6f5a396975d09b5ce4f944ff2247040b7c4bbd37bfe83","observation_id":"7db13b20-5d7f-4f27-b68f-8cc2646410e3","resolution":{"observed_at":"2026-05-12T11:01:31.535838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J., and Hilliges, O","venue":null,"work_id":"cc99e3a0-dbd4-4133-a82d-1b1b0b48aa2d","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:a9258a9d2035a457126670fb0f743aefb1f16e88509475f35dea2251729dfebc","observation_id":"8349e0f5-826a-4ad8-b1f8-953621fa6c1c","resolution":{"observed_at":"2026-05-27T12:24:03.972827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":"2310.08576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-07-04T04:09:35.261339Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":"e2bb8629-96e8-41a3-bfeb-3ece8c4e89f7","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:3484257fe9c78890d3fb2bd673c7f42449b51a851dcd553b1e5361ce45c9d149","observation_id":"9bf3b0d6-1ab6-4762-80b9-821ca37e7586","resolution":{"observed_at":"2026-05-12T11:01:31.562222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:84937d77fcc6a9a146ac52a6591d876b6607458667353d57cb9065c2f54e7961","observation_id":"03333a73-8ddf-4dd5-8d8c-4b42124d0a8f","resolution":{"observed_at":"2026-05-12T11:01:31.515721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The” something something” video database for learning and evaluating visual com- mon sense","venue":null,"work_id":"8f21593f-47eb-4e8a-be4f-5bdd678ddbb3","year":2017},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e74d3cd6e3c7bc698a4cbb941ed0280081d68c74089194115ca3db20e8fc2709","observation_id":"636ac2b2-f3c5-4423-b6b2-75871dd435ce","resolution":{"observed_at":"2026-05-27T12:24:03.975268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:5061336f9fc90bef181d97047222e77512934237944fd41cf84d44ce0b523106","observation_id":"b8b5d8cb-2743-44c8-84ae-91ff6f5d2232","resolution":{"observed_at":"2026-05-12T11:01:31.518757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"2781b1eb-1d08-4a48-b7ae-1b841db07574","year":2022},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:9ae3f77665cd00e88cea756878e92def62527f78e40be38f103229660b0ead6e","observation_id":"2fa89b3d-51f9-4cc8-a196-616e2effa82b","resolution":{"observed_at":"2026-05-27T12:24:03.977664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02704","last_updated":"2024-11-05T01:02:51Z","snapshot_observed_at":"2026-07-30T17:47:10.851530Z","submitted_at":"2024-11-05T01:02:51Z","title":"RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2411.02704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02704","snapshot_observed_at":"2026-06-30T13:24:40.645193Z","title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation","venue":null,"work_id":"81a51f91-c88f-4554-9028-b380c71fa141","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2411.02704","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:ceddcb314d80c1c9631fdb26aa0e84d32512ed02e153f64f6d0dd872991d1dc3","observation_id":"c18e144a-27e8-429f-8c08-7b656dee87de","resolution":{"observed_at":"2026-05-12T11:01:31.522365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:0fe2ac54bbf7685bdb594fdcfa47337fdc3b8d5ef74f546a89a76d6ea0f1ac1e","observation_id":"2f36abad-7ae0-4429-ac31-17aa112b0a56","resolution":{"observed_at":"2026-05-12T11:01:31.528392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-07-06T18:48:04.031944Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":"2407.12957","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Papagiannis, N","venue":null,"work_id":"d807b706-9059-482a-8753-6284b077fe7f","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:972e2676f411534f0efd9cd6da65806592af8ac2236ebf87801d423fcce88a76","observation_id":"10cf7beb-7f86-4f23-af33-dd66878d335c","resolution":{"observed_at":"2026-05-12T11:01:31.504658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vbench: Compre- hensive benchmark suite for video generative models","venue":null,"work_id":"89ed171d-ba1b-4a50-ba91-d8220218ddfd","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:81ce8009f828ded793176b8d86f3f60faafce7065553ff2363a04c6d614a27ea","observation_id":"42ae427a-7feb-4e1e-bb3b-37633b241f87","resolution":{"observed_at":"2026-05-27T12:24:03.987051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04169","last_updated":"2025-01-07T22:33:47Z","snapshot_observed_at":"2026-07-06T20:17:57.863157Z","submitted_at":"2025-01-07T22:33:47Z","title":"Learning to Transfer Human Hand Skills for Robot Manipulations","version":1},"cited_work":{"arxiv_id":"2501.04169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04169","snapshot_observed_at":"2026-07-03T01:47:31.103780Z","title":"Learning to transfer human hand skills for robot manipulations.arXiv preprint arXiv:2501.04169","venue":null,"work_id":"9d5215cf-a3bf-466d-a677-1bff685ec4e2","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2501.04169","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:56b55702b4779da471e984683bfe491453785cef196c8d0c975d85535558e1be","observation_id":"736088d1-9945-47de-bda1-9ec40d26d688","resolution":{"observed_at":"2026-05-12T11:01:31.492828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamgen: Unlocking generalization in robot learning through neural trajectories.arXiv e-prints, pp","venue":null,"work_id":"f34e701a-d8ed-4ec4-bb37-57551a5114a0","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:69d9cd254950acd347bcf3ffe5ffd287937525fdbf4ab0ed533c4648caabd3d8","observation_id":"c6a306ff-7d2c-4ca1-8b3d-88957381655b","resolution":{"observed_at":"2026-05-27T12:24:03.989579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.13441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.558223Z","title":"Yoon, Ryan Hoque, Lars Paulsen, Ge Yang, Jian Zhang, Sha Yi, Guanya Shi, and Xiaolong Wang","venue":null,"work_id":"5105d696-60c7-4b64-97d8-a65aa9cebde8","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:c17f815ca1f8360640fe2cef443aa351a325f743e138444b697937bab20af07e","observation_id":"dbb3ee31-5762-4b22-bfd2-af6614e1c1e6","resolution":{"observed_at":"2026-05-12T11:01:31.453293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:7f3afebe07e246f65768c0b98ee9f08ec125c92555bfffdc3dd51dc5d7417263","observation_id":"81bcc662-f9a8-4a3d-9aed-7edcbaf56393","resolution":{"observed_at":"2026-05-12T11:01:31.489255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":"2501.01427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","venue":null,"work_id":"e13382a8-331c-4a99-b569-1be21abcf124","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:a3437e069a018df0a7c9e729e0eab99005731c4a97bfaac62ba5c300e2047554","observation_id":"d545aff9-9179-4a9a-936d-54882d989ab8","resolution":{"observed_at":"2026-05-12T11:01:31.496416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:6351284d5bce09deea8bdf751bf9a51c5cbd5058cf58d252b1e474b6d43ac6f8","observation_id":"036f130d-abd2-4855-a9b9-b8912290057f","resolution":{"observed_at":"2026-05-12T11:01:31.508531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.08787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:49:38.585919Z","title":"J., and Lee, Y","venue":null,"work_id":"92a2a59c-da64-4564-a9b1-e2d2e4a2ca65","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e449212ae6f468b488ecbb9ef258c87bda546a407ff4c29eb264a3b778a882df","observation_id":"69589ecd-2561-4e99-ac06-124e7fbb4dc2","resolution":{"observed_at":"2026-05-12T11:01:31.441833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-02T12:46:59.929406Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":"2302.12422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-07-09T22:16:36.400090Z","title":"Mim- icplay: Long-horizon imitation learning by watching hu- man play","venue":"cs.RO","work_id":"f1c0e860-19bf-4217-afb5-13797ab23385","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:790741cfafaa5b334f1297276cfcfc656758326ea711946522e92b8e001570f7","observation_id":"21202640-44db-4b99-aee8-10a6bf19853b","resolution":{"observed_at":"2026-05-12T11:01:31.577514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.11289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:46:19.839655Z","title":"Unianimate-dit: Human image animation with large-scale video diffusion transformer","venue":null,"work_id":"622b88b3-aed7-4801-8b17-18aabd0ae466","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:10e48af44cff4343acd3cc89fd05ee8e88eade179e348080dbe3c3574482347a","observation_id":"3fca940b-5fe7-474f-87b6-03e3dd9a9085","resolution":{"observed_at":"2026-05-12T11:01:31.511904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09976","last_updated":"2025-08-13T17:43:34Z","snapshot_observed_at":"2026-07-06T22:12:31.023627Z","submitted_at":"2025-08-13T17:43:34Z","title":"Masquerade: Learning from In-the-wild Human Videos using Data-Editing","version":1},"cited_work":{"arxiv_id":"2508.09976","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09976","snapshot_observed_at":"2026-07-11T00:07:42.541771Z","title":"Masquerade: Learning from in-the-wild human videos using data-editing","venue":"cs.RO","work_id":"2e8fbb08-d6b8-40c4-891b-1483ca4c471d","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"cited_paper":"/paper/2508.09976","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:1dc07cbb557c0050f69840ff8039ba9a4f643a66e3ae8b94ff54110e55e39c1a","observation_id":"8cad6fa4-5c1d-4154-807e-78a46ee80e90","resolution":{"observed_at":"2026-05-29T02:04:55.330788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01702","last_updated":"2025-03-14T07:49:02Z","snapshot_observed_at":"2026-07-06T19:26:12.102947Z","submitted_at":"2024-10-02T16:12:18Z","title":"$\\mathcal{D(R,O)}$ Grasp: A Unified Representation of Robot and Object Interaction for Cross-Embodiment Dexterous Grasping","version":4},"cited_work":{"arxiv_id":"2410.01702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01702","snapshot_observed_at":"2026-07-04T11:19:50.769620Z","title":"D (r, o) grasp: A unified representation of robot and object interaction for cross-embodiment dexterous grasping","venue":null,"work_id":"74b7f198-e963-44ce-9538-4a2dac88a9c1","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2410.01702","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:441e878724156e01e9dd0517ee4ff7620eacbab328f7c1818d83600768e6ada3","observation_id":"d9e6393c-8aad-44a7-8673-c1e43c96417b","resolution":{"observed_at":"2026-05-12T11:01:31.479570Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-11T00:07:42.221444Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:5c5297d92ef6f4ec13915f023fcd55b0a3d2e9693f0778348ffcfcd448676b53","observation_id":"3da35b47-e06f-4896-b2a5-015047bfdfda","resolution":{"observed_at":"2026-05-12T11:01:31.482358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00779","last_updated":"2026-05-28T01:50:51Z","snapshot_observed_at":"2026-07-06T20:45:08.434808Z","submitted_at":"2025-03-02T08:06:55Z","title":"Phantom: Training Robots Without Robots Using Only Human Videos","version":2},"cited_work":{"arxiv_id":"2503.00779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00779","snapshot_observed_at":"2026-07-04T17:09:58.480967Z","title":"Phantom: Training robots without robots using only human videos","venue":"cs.RO","work_id":"4937256c-cfc6-49a8-b9e5-17e11befe0e3","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"cited_paper":"/paper/2503.00779","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:6dd323c69cb63f5a0824ad0aec1affd9884a2e72d6b2f502a02f04dbca8e671e","observation_id":"7850f2e8-e6fa-44b3-9e2d-9bda9a76888c","resolution":{"observed_at":"2026-05-29T02:04:52.652914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11920","doi":"10.48550/arxiv.2505.11920","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.659611Z","title":"H2r: A human-to-robot data augmentation for robot pre- training from videos","venue":null,"work_id":"762e40ad-e06b-414a-8451-01b0079c0dd2","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:a837851571d186c35c0d834491cfcf3f8c9e5601cf20880b9e564354db64411f","observation_id":"1e55a747-8acf-4d87-8b01-d7bd2a6e5e57","resolution":{"observed_at":"2026-05-12T11:01:31.457390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:9d3e0a79b49ddfa4e8d0acc5c40326854fa09b28cf4c73e2cc2416c976f36ae8","observation_id":"29029250-12f1-40d2-9148-8a76c2a07711","resolution":{"observed_at":"2026-05-12T11:01:31.472008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":"2503.00200","doi":"10.48550/arxiv.2503.00200","metadata_source":"pith","pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-07-10T18:47:31.706606Z","title":"Unified Video Action Model","venue":"cs.RO","work_id":"fb4cc512-d1d9-40f4-8854-d35950ad20b3","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:516a14b846093a668bce4f1734c7feb93f79d0944d3942da79efdbefb45d5a27","observation_id":"b40b883f-1a5c-4c35-b122-38c03108dc4c","resolution":{"observed_at":"2026-05-13T17:50:29.857677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:6c4c0324548eaf3f18a0c364f20354a9f45e565bf8e4090b5d44d4005957bf3d","observation_id":"fc4ada06-80e7-4344-95ab-7ce18c2cf58b","resolution":{"observed_at":"2026-05-12T11:01:31.461201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09886","last_updated":"2025-02-14T03:22:03Z","snapshot_observed_at":"2026-07-06T20:36:26.822412Z","submitted_at":"2025-02-14T03:22:03Z","title":"Video2Policy: Scaling up Manipulation Tasks in Simulation through Internet Videos","version":1},"cited_work":{"arxiv_id":"2502.09886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09886","snapshot_observed_at":"2026-07-03T12:38:07.194414Z","title":"Video2policy: Scaling up manipulation tasks in simulation through internet videos","venue":null,"work_id":"6c3b8846-5335-467a-b91b-8f1bac154847","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2502.09886","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:4e8aa8518a2735caecc533c00a117b095fd4bb9ae36750ca7f8b1c0961d48dde","observation_id":"314c1b96-1330-46a8-9ef4-a9993e959e87","resolution":{"observed_at":"2026-05-12T11:01:31.468932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-07-10T19:47:32.618055Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:1012ec80bfe6501d977309000c4702978abc4a43c35e638e858cb9d2ecc45dcf","observation_id":"964f7a6c-8252-4f81-98cd-6ce121d33c6f","resolution":{"observed_at":"2026-05-12T11:01:31.554848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-10T17:37:26.212817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:f91985e39936a1af785d48f4b8d12c63fbc64cc63d8c7d2fedf3344c7ef3d1ea","observation_id":"4d166979-b203-430d-acb4-3871f233bc3f","resolution":{"observed_at":"2026-05-12T11:01:31.551664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":"2308.08089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-07-04T20:10:08.842410Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","venue":"cs.CV","work_id":"eb6df0b7-199d-4cc7-8711-9cd5a6e25349","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:aa14589a5458deb4ca384e04bee06bbb86c551426a373e60cfdf19686b4d4420","observation_id":"cb32dd4d-7976-460d-813c-e831a0b4e9fe","resolution":{"observed_at":"2026-05-20T13:03:58.521687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13178","last_updated":"2024-06-05T01:11:10Z","snapshot_observed_at":"2026-07-06T18:17:38.280988Z","submitted_at":"2024-05-21T20:01:03Z","title":"One-Shot Imitation Learning with Invariance Matching for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2405.13178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13178","snapshot_observed_at":"2026-07-02T18:57:17.183556Z","title":"One-shot imita- tion learning with invariance matching for robotic ma- nipulation","venue":null,"work_id":"340503b1-7afd-4187-a576-1d357db1467d","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2405.13178","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e96771552e287779ed26412ef46aa408c63ddec35ea0cccba40123a9b931229e","observation_id":"e61044ea-c82c-4080-8904-4a688f594a79","resolution":{"observed_at":"2026-05-12T11:01:31.485970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":"b4febabf-63a1-4774-901f-a09222968cdb","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:773c4428c5207b41c44bd08ca2f769f5451193eff9d88b9ecc8a838831cbd972","observation_id":"a68571d5-8c32-4e15-aa19-b2cc69440840","resolution":{"observed_at":"2026-05-27T12:24:03.935200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-01T18:53:07.545958Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":"2406.19680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-07-04T00:19:13.277063Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":"67f368cb-b1a1-4b0a-a894-e6e2d116eba0","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e147cda6f93b769260072b9fc094072d133e05a0825c1672dcc14e91049b5da0","observation_id":"d0045015-5519-4f35-a577-c466e0bbcfce","resolution":{"observed_at":"2026-05-12T11:01:31.500911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G., and Li, Z","venue":null,"work_id":"47c4735e-8c7c-4ccf-b425-e1c2884eb4d3","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:cf2d0c216a748a131d6457b816bd3faa70e52a49e7aed4c8cec5cd5170eea42b","observation_id":"6b89b11e-1263-486e-bc8b-4969fac48dad","resolution":{"observed_at":"2026-05-27T12:24:03.937784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Z., Zhang, D","venue":null,"work_id":"4e344571-1ad1-4a11-b94e-5340ace732e7","year":2026},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:30fc2c12285d27a0fe7db40a77acb7e7bc74a820b2683f428b31d1b1fd6541a8","observation_id":"d4245804-3427-4f29-8c1c-0f0d35f82237","resolution":{"observed_at":"2026-05-27T02:58:44.678388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-07-10T19:47:32.593829Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e3e5169c5fa7fe2365878e68b120f8eb4bb89d6f220be1755432d157798e44c6","observation_id":"9f33d108-dee8-4b43-b290-7d9ab262ed30","resolution":{"observed_at":"2026-05-12T11:01:31.525402Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20321","last_updated":"2025-09-04T08:23:37Z","snapshot_observed_at":"2026-07-06T18:22:53.072592Z","submitted_at":"2024-05-30T17:56:54Z","title":"Vision-based Manipulation from Single Human Video with Open-World Object Graphs","version":2},"cited_work":{"arxiv_id":"2405.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20321","snapshot_observed_at":"2026-07-03T05:27:40.028035Z","title":"Vision-based manipulation from single human video with open-world object graphs","venue":null,"work_id":"28583eab-a971-48e9-a002-fe943945df6b","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2405.20321","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:94d23650d7142fb46633f8282fd1e0b61e1211c23ea311dff69439b5111100a2","observation_id":"5c904740-9e62-4a7e-a43b-15029303366b","resolution":{"observed_at":"2026-05-12T11:01:31.464839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collab- oration 0","venue":null,"work_id":"4ac22409-c510-480a-b515-24b2b7a182b7","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:926f839250c90312eb5681ab5f9d14ddb1fe7910e5bb42a1e7efc66ca289374b","observation_id":"76706d66-0676-402e-919a-f7092e49246e","resolution":{"observed_at":"2026-05-27T12:24:03.940302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3d0b49f5-273c-402c-9b8a-b7ea94428ae2","year":2026},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:e1b7cf87d556d56d53b25740867fc3325ba88defd419bf42ca71be9d97d44021","observation_id":"7a039b3e-5c35-49c5-b407-100df565ae67","resolution":{"observed_at":"2026-05-27T02:58:44.675151Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"0f53365b-b8e5-4f47-bb62-d810b3a38e77","year":2021},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:d81375e1f5e48130de54924aa45d9e366a5a8087b6a325e5f12f642b042754ec","observation_id":"8b645966-d423-4007-966d-86f995824606","resolution":{"observed_at":"2026-05-27T12:24:03.956907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"080c04c9-dedc-422f-8087-78edd9cb8c29","year":2020},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:4bc2d43558d774e209489ef4d31d3336e61943dc4bf4bf0ff0f877dc506820ba","observation_id":"9654e2cd-4e7f-4b7c-b623-4ca09b21d72f","resolution":{"observed_at":"2026-05-27T12:24:03.980101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., Myers, V ., Kim, M","venue":null,"work_id":"1112d43f-051f-4d14-9738-768ab7afa5de","year":2023},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:89a67d052dc111a24d47c16aa812086c34569a9c08320c6a0cf5a135060fcf35","observation_id":"4d9d527e-8879-4105-924b-e74dd4919dda","resolution":{"observed_at":"2026-05-27T12:24:03.982573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C., Sheikh, H","venue":null,"work_id":"1dfbba89-4e32-4c1c-9319-dc325693bdde","year":2004},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:7a932e681850d528d5ea446657b926d339f8edd5a7320820f4f158f17e808761","observation_id":"c65e1b88-d8f4-4c6f-b98a-7eea2f1ec8f4","resolution":{"observed_at":"2026-05-27T12:24:03.984754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidman: Exploiting implicit dynamics from video diffusion model for effective robot manipulation","venue":null,"work_id":"c05a4162-9d19-41f3-80e6-1d766a02aadf","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:2b4bbc48e63b164661cf8aaab6117c50c028a11869bd292815339544d4347f06","observation_id":"0dfd7665-5bbb-47df-afff-8ceeed8d4c18","resolution":{"observed_at":"2026-05-27T12:24:03.954062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J., Shou, M","venue":null,"work_id":"3e1fdeec-74d1-489b-abe6-aa9cac893ef6","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:05aa9383eda3a59310428ab27f2a5968258982721bf70bd7934d3eafda8a7882","observation_id":"9e74d60c-f91e-4f57-9884-1d921ace1e41","resolution":{"observed_at":"2026-05-27T12:24:03.951345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A., Shechtman, E., and Wang, O","venue":null,"work_id":"e5ce71df-2776-4de3-9a80-2293e6099779","year":2018},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:7583ce84aef0f19be963c7bfafd727aebbc9071475ff7e60a1086f1967f44d1c","observation_id":"ecf6162b-5a82-4843-9a4f-9b7d718cdcea","resolution":{"observed_at":"2026-05-27T12:24:03.948766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motionpro: A precise motion controller for image-to-video generation","venue":null,"work_id":"62740d99-c1e2-4ee4-be53-5b2eff2e9a2d","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:16fc646001a3b14b9ec6f85063f6f8d153f3fd318803c23705e314602ffa26a3","observation_id":"1d34e2b8-7fa6-459b-bd82-de384ba70d00","resolution":{"observed_at":"2026-05-27T12:24:03.945780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Z., Zhang, D","venue":null,"work_id":"b80c0cc0-2cee-4afe-b1c8-2ea4b1972d9f","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T00:50:06.906904Z"},"links":{"citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:bede46530918042e42f50663ce9d1b56b3445f667a931c418a9346e335e6fab4","observation_id":"e4785666-54a4-48c6-ad65-576622b35d19","resolution":{"observed_at":"2026-05-27T12:24:03.943044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":1,"verified_exact":31,"verified_fuzzy":22},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 2 inbound Pith citation observations for arXiv:2605.03637."}