{"as_of":"2026-08-17T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ae2e7e221948682235e31f3507245c6f2ba30a5248387d4a09470296a06e2b4","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:19:50.880926Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:44:39.322417Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:21:25.450763Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2505.10105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10105","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedmae: A unified 3d multi-modal representation for robot manipulation","venue":null,"work_id":"9f94f005-fb65-471a-bbe6-46cb70f4629b","year":2025},"citing_paper":{"arxiv_id":"2604.10573","last_updated":"2026-04-12T10:36:18Z","snapshot_observed_at":"2026-08-12T13:37:26.535554Z","submitted_at":"2026-04-12T10:36:18Z","title":"Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:39.322417Z"},"links":{"cited_paper":"/paper/2505.10105","citing_paper":"/paper/2604.10573"},"observation_digest":"sha256:3f21844a50ac8070e40d8079bd397c6557cb32fce082c928bc990b0c975355da","observation_id":"3547738d-5d86-41df-a708-4632676f9416","resolution":{"observed_at":"2026-05-11T09:56:03.491695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2505.10105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10105","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedmae: A unified 3d multi-modal representation for robot manipulation","venue":null,"work_id":"9f94f005-fb65-471a-bbe6-46cb70f4629b","year":2025},"citing_paper":{"arxiv_id":"2604.26848","last_updated":"2026-05-01T12:48:56Z","snapshot_observed_at":"2026-08-16T03:31:13.561327Z","submitted_at":"2026-04-29T16:13:39Z","title":"STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T11:26:53.331753Z"},"links":{"cited_paper":"/paper/2505.10105","citing_paper":"/paper/2604.26848"},"observation_digest":"sha256:8a5ae876630de3e2a65ece2e59706650eb801d56424dc0b6da994af4b34d217b","observation_id":"471cf710-e970-4c45-9092-2bc0ff23515a","resolution":{"observed_at":"2026-05-12T09:21:25.453192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10105/citation-record","integrity":"/paper/2505.10105/integrity","json":"/paper/2505.10105/citation-record.json","paper":"/paper/2505.10105"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.431197Z","title":"MultiMAE: Multi-modal multi-task masked autoencoders","venue":null,"work_id":"55067e44-d96d-4a1c-a883-af2bd316dbf4","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.708785Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:5801751bab394dac3c758ba16a95c73f3aaeb694331b52a9205da1078cccdde0","observation_id":"57b5e0e2-1027-4191-adfa-00eff836bd15","resolution":{"observed_at":"2026-08-15T21:19:51.434500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.420695Z","title":"Masked autoencoders enable efficient knowledge distillers","venue":null,"work_id":"78f2870a-1286-43e4-a3a0-1f8b64b33b45","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.712835Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:d66f24edcbaa256e1d1326614f283b1bb785067ce9f7ccad87cb62aa0d804dc2","observation_id":"ece4fe15-9e85-4e1d-9833-e52f89d25242","resolution":{"observed_at":"2026-08-15T21:19:51.424665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T21:19:50.715970Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.715970Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:8b8af5a4654605c0c5645182925bc479fb510447984579e4d18cb05147e04938","observation_id":"e016c546-9b4c-47c8-8370-2516f9b26d97","resolution":{"observed_at":"2026-08-15T21:19:50.715970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-15T21:19:50.720623Z","title":"Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.720623Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:0be621170075fca504f241a7a6484e663e9a1a622d33dd8385b5347cc9a4532d","observation_id":"498deb50-496c-4526-a4d7-c07d9fc99fe8","resolution":{"observed_at":"2026-08-15T21:19:50.720623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.725034Z","title":"Lerobot: State-of-the-art machine learning for real-world robotics in pytorch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.725034Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:2cec9660fd46812762d89f21f0a5edba3750bedf1193f7fb55fb5bae81557ab1","observation_id":"6319172f-4ba7-4fad-a6b2-112cc70454da","resolution":{"observed_at":"2026-08-15T21:19:50.725034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.405034Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"7c98fca6-e9b3-4544-ab5b-5e2a11b13fd6","year":2021},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.728435Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:87c8ea42b6fe113b1a31c243899c994d9279151594c80176eafa8b0272e2ddac","observation_id":"25a01810-a5d5-4ccd-91eb-aca2ba372522","resolution":{"observed_at":"2026-08-15T21:19:51.409558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-15T21:19:50.732017Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.732017Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:df48758d6387d0b15b1edfe5e4aa4df486d1d06e2046158cb8447efbdca2609d","observation_id":"268688a2-981d-4806-a70d-286785696a85","resolution":{"observed_at":"2026-08-15T21:19:50.732017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02057","last_updated":"2021-08-16T17:40:21Z","snapshot_observed_at":"2026-08-16T18:33:46.863133Z","submitted_at":"2021-04-05T17:59:40Z","title":"An Empirical Study of Training Self-Supervised Vision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02057","snapshot_observed_at":"2026-08-15T21:19:50.735924Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.735924Z"},"links":{"cited_paper":"/paper/2104.02057","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:23bc328668ab9967ede060bf2405f2c6f2913dc886acaf18a7f7027ffa70f270","observation_id":"de8ff5c4-666a-4085-89ce-a94c9eca8312","resolution":{"observed_at":"2026-08-15T21:19:50.735924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.739304Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.739304Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:ab1b0bee8f998e21bf4685b8b99f23bed72f6e35b5ae84106c2867575a7be262","observation_id":"07532837-838a-4119-8316-6571befb2725","resolution":{"observed_at":"2026-08-15T21:19:50.739304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.390787Z","title":"Cleandiffuser: An easy-to-use modularized library for diffusion models in decision making","venue":null,"work_id":"b85bf81f-0541-403d-8df2-329be684ecaa","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.742645Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:bd4f1ceb7040da5b5ab09b12354e31cd36f05e98f8164fc6c63a028c83b7a6d0","observation_id":"86486ae6-d7f6-4ad9-8c0a-09f4c6b7b29c","resolution":{"observed_at":"2026-08-15T21:19:51.393950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.380968Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"d07d0d2c-e57d-476c-9fa1-f05de6cfe726","year":2021},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.745986Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:baea240c7b5a08cc2b2b9bbcca5fa1250800ab279e1f2082aed44f43d2df1d93","observation_id":"a3001712-f0cc-41c3-a1da-c362115fd0a6","resolution":{"observed_at":"2026-08-15T21:19:51.384260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.369384Z","title":"Rh20t: A robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":"ea0f4dc4-b1cb-43f4-9e65-5fec99bd7205","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.749364Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:b63c6a15629554cc65c16577e2eb4c237d78c03d60e39ccf5093d8e173317932","observation_id":"9c056c97-4264-4fd1-a041-0fe1963541cb","resolution":{"observed_at":"2026-08-15T21:19:51.373376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.358756Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"c7593ff8-ff4b-40e8-8b17-aa685664e901","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.753204Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:b5157ff2ea2476ea10a81d6f308bc20f34e02cc517bf5d6921643bc2f4ccc926","observation_id":"dddb9c34-8eaa-4509-a55a-8ad5679b8170","resolution":{"observed_at":"2026-08-15T21:19:51.363119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-15T21:19:50.757581Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.757581Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:77194438981a1d1ceb4e46d8f5ffa795115ca90cf3c60de88227e01a100f3bdb","observation_id":"3354df95-b62c-4fab-9a66-b7766e8e590a","resolution":{"observed_at":"2026-08-15T21:19:50.757581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.348789Z","title":"Girshick","venue":null,"work_id":"aacc50a4-3e39-4cda-9732-221f9e10935d","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.761089Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:f43f72965fee61f1df653a7e16a0a8eafe447d4233d6ff692f9d8774e22301d7","observation_id":"9501eef1-cf9f-421a-930b-89b57dc0eb6a","resolution":{"observed_at":"2026-08-15T21:19:51.352235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.337710Z","title":"Ponder: Point cloud pre-training via neural rendering","venue":null,"work_id":"f49c374b-c2ad-4329-851b-2e5f12b0956b","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.764217Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:ec7cf6be83a27ce7bafc42abb49aa0100e57ae1815a7c6184849c657c11aab2b","observation_id":"b683ed56-6684-4aa5-98d0-02ce9945c509","resolution":{"observed_at":"2026-08-15T21:19:51.341625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.327408Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":"96d660fe-5a17-4849-b582-5d3604f1d963","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.767529Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:e184aeb393e8cfbac0fcdc34b3106b9b20b7338e3ca3a79f1c6158c2b1b2a842","observation_id":"660114b0-4013-491a-a17a-eee8d448fcb9","resolution":{"observed_at":"2026-08-15T21:19:51.331124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.316644Z","title":null,"venue":null,"work_id":"5e996908-007e-4088-bc8e-b9c61a4eb5c7","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.770679Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:796909a3a04eba181f831d61b1fc2c166dda369d225c0a7118dc50ac8ecc8d10","observation_id":"2d1d65e2-bbe0-42af-92c6-9e6b74d2e768","resolution":{"observed_at":"2026-08-15T21:19:51.320153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.774115Z","title":"Open- VLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.774115Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:070cc07faacc2c540a7e7fec9307fe472e29a11d81781b9e5a44ec3323d8b2b0","observation_id":"ae154270-be45-4d42-96ef-745ea932c6e0","resolution":{"observed_at":"2026-08-15T21:19:50.774115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-15T21:19:50.777731Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.777731Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:f19dd5a93b62683e9876faa2ed6bb8a8fe81a5d8c2ba1c12f5a0949de55980de","observation_id":"5d67d355-a2f0-4bbe-97be-6c75e9a16c15","resolution":{"observed_at":"2026-08-15T21:19:50.777731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-17T09:51:16.654214Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-15T21:19:50.782316Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.782316Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:397739e1146b9a14b558b4c0999400d7954ae7710a9f4cedf01f455c5a5e1b9f","observation_id":"58c52df4-6bba-49cc-bd39-6548393d23fe","resolution":{"observed_at":"2026-08-15T21:19:50.782316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.786523Z","title":"Generative models in decision making: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.786523Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:379afc6ed8538613e433e0781ce2297ee67373cb7aea4013dc60d2dc17f3b79f","observation_id":"d59498a5-1193-4543-b8fa-bcae5fdf9dc2","resolution":{"observed_at":"2026-08-15T21:19:50.786523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.789781Z","title":"LIBERO: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.789781Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:fd4151cc4dff32da69b05649c27348291c1ebc0281813035dbb16ea5f237ae3e","observation_id":"a0dc70a9-6b70-4367-b89b-eb4e38cc685f","resolution":{"observed_at":"2026-08-15T21:19:50.789781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.792854Z","title":"RDT-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.792854Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:ce718cf484eee32542d26f2884d9bf6e748ffda49bd7cbaf12d425627177487d","observation_id":"bd1adf7a-e1a3-402c-8d3c-5d6361f9b229","resolution":{"observed_at":"2026-08-15T21:19:50.792854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.289023Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence? In Thirty-seventh Conference on Neural Information Processing Systems, NIPS, 2023","venue":null,"work_id":"6c3a3ba1-3180-4dc5-accc-945dc69373a7","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.796718Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:b1b7a46d1721c4ad4bc6596dc7bcf19e9c64916c097a78c702a311d81428823a","observation_id":"0f0b4415-5a07-4d1b-b334-ded8fe97dc39","resolution":{"observed_at":"2026-08-15T21:19:51.293018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.277772Z","title":"R3m: A universal visual representation for robot manipulation","venue":null,"work_id":"4003ecc1-fc21-4e14-a2b5-68aca2ca75cf","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.799819Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:44c6fe18bd1c68fa306d94efb9a59670451c59799404ca12bf98f28eec1d80be","observation_id":"be8590e8-45ff-4976-b936-3905bb3da8fc","resolution":{"observed_at":"2026-08-15T21:19:51.281335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.802727Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.802727Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:87fe9bce9430c261a3f76ac7cda8aae39cde96ff8975d9b084b582fffb0d349a","observation_id":"375ec7e7-5383-4e99-98b3-77090d225bfb","resolution":{"observed_at":"2026-08-15T21:19:50.802727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.806109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.806109Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:1cc38c39df590c0c80ccf1cecdc435ae64d044b8fa5afead108eb9b2e2ebc83e","observation_id":"83e1f69a-7a4c-4b9e-a157-2b1852c63231","resolution":{"observed_at":"2026-08-15T21:19:50.806109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.256339Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"84f7c0cb-6fcf-4aea-9c1b-bdf1202f9af3","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.808932Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:4eec73af403149fdbac096394ec6cd54f4edb2c410036d9d6febe96b1fbf346a","observation_id":"fd80b5b9-6425-4e08-bd78-521503b346c1","resolution":{"observed_at":"2026-08-15T21:19:51.259733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-15T21:19:50.812313Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.812313Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:fbfefa76ec1a35ac5649ee9e6bcda7ededc07dcbd507cc8c63693fa87aa3529b","observation_id":"2c8d2d92-be91-4959-82d1-c4a73c2c200f","resolution":{"observed_at":"2026-08-15T21:19:50.812313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.244872Z","title":"Pointnext: Revisiting pointnet++ with improved training and scaling strategies","venue":null,"work_id":"f023fc2e-6aa2-4ea2-b3f6-1032bbb0c65f","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.815734Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:ec5544ba12c3ca50af8245467a68908c411675ac54ade168d94bf3c9132e7189","observation_id":"143439fd-7eca-42e6-9415-db5e0072b4d5","resolution":{"observed_at":"2026-08-15T21:19:51.249206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-16T09:32:38.319890Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T21:19:50.818835Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.818835Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:5b9d216f9c7713f69564eff2672252bfa4fc990f142558b81612861d25450be1","observation_id":"08dc8288-85d7-42a1-8935-18843d3d1e83","resolution":{"observed_at":"2026-08-15T21:19:50.818835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T21:19:50.822145Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.822145Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:c9a24a29c0fb941438653288a471a62a1d96e428f049391a8ec6d25708f1c0dd","observation_id":"e080f40b-f515-491c-ae4f-0a9f5d1d5d6b","resolution":{"observed_at":"2026-08-15T21:19:50.822145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.233639Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"20715d16-8fc0-49e2-ac7a-7132dd88ebfb","year":2022},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.825600Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:2b2c7eae7956b7a1ba0152cabb71b8112c77ba2ee2a6351b652bf975958c34d3","observation_id":"38350926-7c6c-4bfe-9c5d-cf96dc319e44","resolution":{"observed_at":"2026-08-15T21:19:51.237420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.223603Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"ef3b8533-68d0-45b3-913e-c291eb1cb5c6","year":2021},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.828578Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:eb0e2bff34a593958efc2aca764b12415c5a1771ef65ed3950be7bb22f564324","observation_id":"fae65f8f-caf9-4942-9721-cceff07a2907","resolution":{"observed_at":"2026-08-15T21:19:51.227157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.212152Z","title":"Zhao, Ken Goldberg, Ryan Hoque, Lawrence Yunliang Chen, Simeon Adebola, Gaurav S","venue":null,"work_id":"d660d404-3814-410b-899b-418ea5aa8a3a","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.832074Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:32a11cead84f9207841f80053652fad440b112ad168384021a38b4f53c04c026","observation_id":"9fa8a917-7c56-4750-ba55-bbe10182b566","resolution":{"observed_at":"2026-08-15T21:19:51.216627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.201388Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"000e5954-d4ac-40e6-a8e9-cc9cb230c592","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.835511Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:defb72da905b647f0a550b22f83180ea0b6414c133ffc8c1941a9573539c6e38","observation_id":"afd04968-e46f-4933-9f5b-32cdabe80d1d","resolution":{"observed_at":"2026-08-15T21:19:51.205072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.190465Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"04776f29-63e5-4701-b1eb-f33d3f00d6e7","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.838646Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:1d6b34151f64387ef63c08f88ff4dbf08c71181ce58a158a3e1333c4241216c0","observation_id":"ecc42fc2-b8f6-4461-beb9-ad580a6eee69","resolution":{"observed_at":"2026-08-15T21:19:51.194048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.178659Z","title":"Croco v2: Improved cross-view completion pre-training for stereo matching and optical flow","venue":null,"work_id":"478c5a16-47cf-4f66-a0fe-a7287ace8819","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.841830Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:506543dc2cfc41e74864ab313aa02334f1db3136b4f430ea646f743d5a07eb3d","observation_id":"a9768d38-f625-4d11-affe-8b11a2e56b8e","resolution":{"observed_at":"2026-08-15T21:19:51.182883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.168104Z","title":null,"venue":null,"work_id":"32c7468f-32e6-45ba-8b23-ec0002ecb7fd","year":2020},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.845679Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:98c9bd1f638ff40aa7ae6f5a5085f3ad7b35a7cd6f2d947f86c4fee84c45d389","observation_id":"96e0dd93-8314-4b72-8923-68d6c5891859","resolution":{"observed_at":"2026-08-15T21:19:51.171603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.157733Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"a36764d8-b4eb-4b8a-bfac-fb5216cac635","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.849234Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:b5d251713afbea4946b7c23955fb5f7c6b8840e5dc470baa680a462a6bc9c780","observation_id":"4f320ca9-36da-429a-af6c-1b54ca539e08","resolution":{"observed_at":"2026-08-15T21:19:51.161216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-15T21:19:50.852543Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.852543Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:2e48ece43e5f591a72affda0c37f5493dcb8ff9edb50a369d30412514178ea43","observation_id":"13211660-7f98-442c-83ff-82e35a8f25bf","resolution":{"observed_at":"2026-08-15T21:19:50.852543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.144100Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"b8dd5e43-1968-4ea6-a2e5-968baf68d047","year":2019},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.856204Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:0fd0a91a2ee8e45bbe5f00ce8ce02cedb656d681a0526eed04a90d1a54b9d614","observation_id":"196b199d-7cb6-4631-9c88-298a747c27c4","resolution":{"observed_at":"2026-08-15T21:19:51.149945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:50.859468Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.859468Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:19f2ed70a9e829bed03b1658d83e59709fb298b4a416599b3c0f6ed4318fe9e0","observation_id":"272e37c4-4fb7-4e07-96d9-6d9bc9706969","resolution":{"observed_at":"2026-08-15T21:19:50.859468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.125959Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3ea12788-44d6-465a-aadc-7c201e90db20","year":2023},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.863313Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:2a2724b93c9fd49621deefb1c7b3109f2c3744939539de5ecea509d96b7b40ee","observation_id":"56c1656b-ef10-4ec8-a767-e3d4775ca4f4","resolution":{"observed_at":"2026-08-15T21:19:51.130053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.114541Z","title":"3d-VLA: A 3d vision-language-action generative world model","venue":null,"work_id":"c9be1b85-89a7-4202-847e-2a00a18d80ba","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.866531Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:58e58da032444865c8ec0ed54f5e990ceb4ee795e035b65abdc0baf0ef904ce2","observation_id":"b6f81b37-908c-4a2b-96df-44a8091e8f72","resolution":{"observed_at":"2026-08-15T21:19:51.118203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08586","last_updated":"2025-04-15T03:03:46Z","snapshot_observed_at":"2026-08-16T14:52:34.850748Z","submitted_at":"2023-10-12T17:59:57Z","title":"PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08586","snapshot_observed_at":"2026-08-15T21:19:50.869787Z","title":"Ponderv2: Pave the way for 3d foundation model with a universal pre-training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.869787Z"},"links":{"cited_paper":"/paper/2310.08586","citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:bbb4a5c37ff7859b6f12efc0e3a4d3bda30cb228fa5bcfa23ef61bdf8ee2bff1","observation_id":"14bb0d37-9ed5-486d-bf0a-dc99246d4476","resolution":{"observed_at":"2026-08-15T21:19:50.869787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.102653Z","title":"Point cloud matters: Rethinking the impact of different observation spaces on robot learning","venue":null,"work_id":"4a4ff4af-7f68-4db4-b205-4b8e56748f1c","year":2024},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.873425Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:22c830ac8d1f598505ffe3544735f1d825420e804c07721c0d5f555c126df723","observation_id":"edcd3297-b5cc-4bb9-84ed-d4e0534d5acb","resolution":{"observed_at":"2026-08-15T21:19:51.107391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.092229Z","title":"screwdriver","venue":null,"work_id":"12986a5e-df0a-4126-8485-e8f993d81309","year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.876610Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:db6dd05306903e725d84832a1677bcd5fca71314c83fc8e6a21655aaa4c96ef4","observation_id":"3e64e5f7-6038-4b89-bbf9-b27dbdfd476c","resolution":{"observed_at":"2026-08-15T21:19:51.095692Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:19:51.078771Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"c3e52079-50c5-4e18-8c0e-c259af6202b0","year":2025},"citing_paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:50.880926Z"},"links":{"citing_paper":"/paper/2505.10105"},"observation_digest":"sha256:d9348e0e54a238f4c063e5eb97e723088074de4a826894e83d4298e1b398243f","observation_id":"24c5840d-feee-424a-891a-b7c675010abf","resolution":{"observed_at":"2026-08-15T21:19:51.084967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10105","last_updated":"2025-05-15T09:12:17Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T21:14:06.956287Z","submitted_at":"2025-05-15T09:12:17Z","title":"EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2505.10105."}