{"as_of":"2026-08-23T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24cbb169c1a6d14998e1f06f12aab1f34b3694f17d91fef4045b1bb2161a3921","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:03:46.175388Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.07626/citation-record","integrity":"/paper/2508.07626/integrity","json":"/paper/2508.07626/citation-record.json","paper":"/paper/2508.07626"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T22:03:43.667661Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:43.667661Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:d3522de0c396874749fc51cbab3435767377241e9334e947b8fcf9cbbdb96545","observation_id":"c8deaee2-e282-4744-ac09-d11a2b5820e7","resolution":{"observed_at":"2026-08-05T22:03:43.667661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T22:03:43.740529Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:43.740529Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:52fea1f16a47a241ccff64234e8b7188e77e56d4d566af6fffc4a924ffefb544","observation_id":"4acf80bc-cd92-4c10-9879-5b682f8925fd","resolution":{"observed_at":"2026-08-05T22:03:43.740529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.449088Z","title":"A comprehensive study of 3-d vision-based robot manipulation","venue":null,"work_id":"27cc0a30-5f9d-4900-a91a-87c0661a0138","year":2021},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:43.783543Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:77b4e6fe274dd0f4e51e674be72dfa8463b1f924d26a904402db5450d05e3098","observation_id":"e1bcb157-8001-4a85-bfb3-ea8877f487b9","resolution":{"observed_at":"2026-08-05T22:03:46.451685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.441733Z","title":"Video prediction models as rewards for reinforcement learning","venue":null,"work_id":"47fec667-b51b-4606-b7b0-dcf035596fb1","year":2024},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:43.878413Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:acc747495872f6a4e8474cfed4c33de191d4f4bbc54a1c7d7abd01b871c4f7b6","observation_id":"6666fa04-17cd-41d1-a873-ea78ba67d9ef","resolution":{"observed_at":"2026-08-05T22:03:46.444271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.434752Z","title":"Survey of imitation learning for robotic manipulation","venue":null,"work_id":"e8be9ec5-0c7d-4f37-844e-1a7a61575687","year":2019},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.001663Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:4cb792de09e02b15f957dee0989f30b08b91d3ccd43a12b2a89d3ea012e37ba8","observation_id":"27728d22-3122-40e4-9751-b75f068e9802","resolution":{"observed_at":"2026-08-05T22:03:46.437112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.427575Z","title":"Physi- cally grounded vision-language models for robotic manipu- lation","venue":null,"work_id":"30b4dab6-fd32-42f1-9f22-5a8a5d3240e0","year":2024},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.057794Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:c0fb810245f5730bb001c9fc35836493f3be4ade4f30c2f75a0d7bfba17d9f28","observation_id":"4e098847-a0ca-4288-8c6c-89f96392f221","resolution":{"observed_at":"2026-08-05T22:03:46.430054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.420479Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"b2e927ab-4464-4a52-b6e4-80adb3d8a7d1","year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.137096Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:f77dc9f58ea5266e61e619eeabb3cdce73f71f260b0a14a5d07c6880639a0287","observation_id":"9b443dbb-e52d-43bc-90a3-2a574f5826a6","resolution":{"observed_at":"2026-08-05T22:03:46.422917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.413094Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"4ebc8e54-7793-4b94-b813-7d5a22a8c96a","year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.229203Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:00abffd72be0e1c1ae4c2ea850623088d7d978326f84691832306e3008a20559","observation_id":"14ce4cee-aa7a-4e76-ab76-8038dbaea0fc","resolution":{"observed_at":"2026-08-05T22:03:46.415873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.405932Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"8d4fe80f-d3be-4c1b-b6ae-03411ab41dd6","year":2021},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.272665Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:2798b7d215caf13ea576ae1a0eeb4e09164409092d14b1e9d81e4b2481233d64","observation_id":"b3a72149-7342-421d-8165-9a43b626eebe","resolution":{"observed_at":"2026-08-05T22:03:46.408600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.398877Z","title":"Exploring visual pre-training for robot manipulation: Datasets, models and methods","venue":null,"work_id":"05213c64-c7bd-44fe-b4cc-ceeab2330033","year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.391392Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:e3ff590b590b24918b5ece67382175c31e727f02e1a50d94d8bd3b0a1705ad62","observation_id":"69a1e538-1ac4-40dd-b1b8-afdbf5e72a8f","resolution":{"observed_at":"2026-08-05T22:03:46.401427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.391619Z","title":"A review of robot learning for manipulation: Challenges, rep- resentations, and algorithms","venue":null,"work_id":"8c9dbfb2-219e-4261-85cb-06cdaa58c30a","year":2021},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.539913Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:326c7042f5de87d17ca9bc8b7c0d94f9f199f72a5be7c88237c9e9454156e965","observation_id":"5e9f6f06-e0ae-4ca8-ac07-7f4e996c645a","resolution":{"observed_at":"2026-08-05T22:03:46.394286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.384016Z","title":"Exploring the potential of large foundation models for open-vocabulary hoi detection","venue":null,"work_id":"17a1da36-f1a5-4039-81d6-f7ba8a8b7d4f","year":null},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.635770Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:f8c2e14824a823095ddaaaf9de5d29e4869a54d99ce4301a8ee92b1a9f4b8a5c","observation_id":"61ca7617-548a-4e66-8d9b-f3eaf593f221","resolution":{"observed_at":"2026-08-05T22:03:46.386649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.376988Z","title":"Exploring conditional multi-modal prompts for zero-shot hoi detection","venue":null,"work_id":"fc7e7760-bda3-4b21-ae42-54b20c077e1e","year":2024},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.713633Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:7f1e2047e9a8726e87e75525059a7b6cff055a6cb7e5bcac2076af6fa20fb20b","observation_id":"b9e19ca3-5f98-4d4e-9d3c-f6c61dde6e4f","resolution":{"observed_at":"2026-08-05T22:03:46.379365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.369677Z","title":"Core4d: A 4d human-object-human interaction dataset for collaborative object rearrangement","venue":null,"work_id":"fcf651e2-bbd7-40ef-874f-47129f026432","year":2025},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.827001Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:61f3816c9310b53f3b7fe9157dcfb4ceef614b946fa84a4ee8669a3cb646e580","observation_id":"ee39e325-6a89-4534-983f-9f4292287df9","resolution":{"observed_at":"2026-08-05T22:03:46.372269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.362376Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":"07e4782d-31f7-441b-aaef-90a2c6169822","year":2021},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:44.967903Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:4b37d53aa86022064508642be123e4d7373d72df9a2da6425d70fe2d066fc498","observation_id":"ce7e2ae2-bb81-454c-8041-fff49329bf7c","resolution":{"observed_at":"2026-08-05T22:03:46.364941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.355401Z","title":"What mat- ters in language conditioned robotic imitation learning over unstructured data","venue":null,"work_id":"c748c137-c93b-4fbf-a0bc-401a92ac1065","year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.076450Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:d67b08e1abad5c72c2f03811cfd6dc4112ccc0a721fe82d9fdadd6cb75275c62","observation_id":"24553468-0b8d-44bb-b044-1b95302110b0","resolution":{"observed_at":"2026-08-05T22:03:46.357866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.348026Z","title":"Calvin: A benchmark for language-conditioned pol- icy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"b12e5ccd-4d03-4940-8f80-bd6a2b7e7f68","year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.231044Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:ae9e71637f60dcc751928ec5faaff9983565f9e4f63a476d334613d8ba40fe7d","observation_id":"dbda7615-6e22-43ca-afe1-a82cabe67a3b","resolution":{"observed_at":"2026-08-05T22:03:46.350587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.340885Z","title":"Bridging the gap between 2d and 3d visual question answering: A fusion approach for 3d vqa","venue":null,"work_id":"9c2d0528-eaa0-4a57-882b-91dee763067d","year":2024},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.307646Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:ed1243d400dcaa893f2060ecb7201de6e68685bcb831ddecf7554fb0c2374fc0","observation_id":"b4646e70-d065-4ac6-8d92-5c37b94c0bfa","resolution":{"observed_at":"2026-08-05T22:03:46.343392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.333621Z","title":"Interhand2","venue":null,"work_id":"62f553e3-37d7-4e4b-81dd-54f649cdbc50","year":2020},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.387901Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:d22e6353f2f17b2e5e1293a4b3601d8d7ea45a5764775d096a61cbb8d8499e3a","observation_id":"d80edf2e-3271-4ccb-979c-8a09cda4eb0a","resolution":{"observed_at":"2026-08-05T22:03:46.336298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T22:03:45.393805Z","title":"R3m: A universal visual representation for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.393805Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:8d2677313ffec56d185ef91aebdf3c5a30107e11c66368954f539d3d437d63d8","observation_id":"1fe5fb33-26f6-44a9-bec0-643cc523c031","resolution":{"observed_at":"2026-08-05T22:03:45.393805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.326396Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"bc4c7f1e-383d-40c3-b570-796c51695917","year":2019},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.520501Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:02f9618893d7d35350f8c756e4aada166cdbfe909767c7ed1fa170af757e12b5","observation_id":"ba528932-18c2-4614-9cc2-55002b84e317","resolution":{"observed_at":"2026-08-05T22:03:46.328936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.319245Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"94917279-1233-41be-bf8b-b8cc5bc253b2","year":2021},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.626998Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:14119808db49cec6cd8493825ca5f8c7f93744794290c69e475f392279daa765","observation_id":"e7e88089-3211-471e-98f3-b6c88c6aee74","resolution":{"observed_at":"2026-08-05T22:03:46.321703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.311780Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"b8328835-cfd6-4f03-b0e0-92d21adf58ff","year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.789006Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:4f7a5e7ed7f1a1c7aeaaecfc9166b0590bf71ba0545c4ae255bcfcc6d416b0c6","observation_id":"a5ec4993-4076-4ef7-b6c3-5fce8f249335","resolution":{"observed_at":"2026-08-05T22:03:46.314657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.303952Z","title":"Multi-view masked world models for visual robotic manipulation","venue":null,"work_id":"1277044a-f352-45c1-a315-36c1d92e8633","year":null},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:45.955325Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:d143836bd9fc35c3071363fb97af730cbed13b75c5f699fe53f03b4ddff1aac6","observation_id":"0d18ba7a-aa7d-4a5b-bf08-bbbb70b9d896","resolution":{"observed_at":"2026-08-05T22:03:46.306615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.296776Z","title":"On the utility of 3d hand poses for action recognition","venue":null,"work_id":"051ba9c3-b2c9-4c38-8458-01ad5c068f47","year":2025},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.123708Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:ee590c10a7fcb55b7345ae5161acf53b32b753559c9f4ab4b633b40bba19d911","observation_id":"1e476522-2851-4bbe-ba6b-5bb75ed7768e","resolution":{"observed_at":"2026-08-05T22:03:46.299217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.289276Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"ca372b0b-3dcd-4ec7-8eaf-1ca8c86b5256","year":2022},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.151440Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:a819fd26159fb90e6d58af3442f6fe44b0fac2f828adf2500319a0a93b5cf175","observation_id":"25bd1260-3a92-4dea-b8a1-bbacadedce9c","resolution":{"observed_at":"2026-08-05T22:03:46.291866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.281319Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"94d51b97-2764-4f29-b86d-08cca7ab418e","year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.153923Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:5861ef0f2c46fc757d22fabcf498cb631d886d9d61960266596657260e768369","observation_id":"94573e19-67f2-4d3f-8a9f-ad9311554760","resolution":{"observed_at":"2026-08-05T22:03:46.284384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.273566Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":"bf0fba72-769a-47fe-8e08-65bd38832717","year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.156881Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:34190a174ef75a8bf08aa3dabf20f0b324665e3f698f8be747e1474c8d65d2f4","observation_id":"93a2a339-4d0a-445b-9c02-0ed3635678f0","resolution":{"observed_at":"2026-08-05T22:03:46.276116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.265533Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":"167ef160-32a7-4692-a77d-202fd8bd1388","year":2025},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.159783Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:350df6e6e8899e9527b91e5cbef85a80d92c6f5ae666fff68f61bd6717146c91","observation_id":"28c627fa-1ad8-4a64-96f0-1bda74f4e39e","resolution":{"observed_at":"2026-08-05T22:03:46.268209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-05T22:03:46.162021Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.162021Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:28ffc8b4a8efc82e383f2bc5f8641a36da0e643820d1be4182b0ce927171926a","observation_id":"113b14ef-b2b6-4934-a582-66a82e2a421f","resolution":{"observed_at":"2026-08-05T22:03:46.162021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-05T22:03:46.164835Z","title":"Unleashing large-scale video generative pre- training for visual robot manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.164835Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:bec3258751712e3824194a160459746759593d5f77953bccefbf87eed374ff62","observation_id":"a9fe2c85-38ea-43c6-9327-d79e0ab062f5","resolution":{"observed_at":"2026-08-05T22:03:46.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.257238Z","title":"Semantic-aware human object interaction image generation","venue":null,"work_id":"d4b7203e-466c-4c93-881c-d1f60a97c0e1","year":null},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.167507Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:31f197ef349cbb452009853612094c02ae5283ba8c1b888b8a1518942a0f9be0","observation_id":"61351040-5340-40e9-9f79-bfc0100cd1cb","resolution":{"observed_at":"2026-08-05T22:03:46.260264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.249299Z","title":"3d vision and language pretraining with large-scale synthetic data","venue":null,"work_id":"c148ab81-851d-4859-b5d1-d229d412c0f5","year":2024},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.170774Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:153e2a96bee6a9b53649fb6779d50b4c685ed4e2af058a60432e24a62b6d30e1","observation_id":"1eb46850-1977-43a5-973b-0d9d9adb9570","resolution":{"observed_at":"2026-08-05T22:03:46.252109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.241115Z","title":"Planllm: Video procedure planning with refinable large language models","venue":null,"work_id":"ca2924ad-1895-4a50-8b6e-5dcc0d75c212","year":2025},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.173095Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:c0348e0a72a0835f4638bf5ced711a07cd6da8238ebd8396cdb9411747edffe3","observation_id":"112f0c0d-bc16-4055-b47e-457ba4a3f354","resolution":{"observed_at":"2026-08-05T22:03:46.243780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:46.231330Z","title":"Phrase-level temporal relationship mining for temporal sentence localization","venue":null,"work_id":"285bb1ed-0651-4aff-b4e1-3fc80e15a508","year":2023},"citing_paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:03:46.175388Z"},"links":{"citing_paper":"/paper/2508.07626"},"observation_digest":"sha256:2a4e6b3e2d1116fb4acdba306bffc6380365fa7affc0128d996c9db49d7d31cd","observation_id":"70f43c72-53d8-4280-aa9e-a9443fe31b69","resolution":{"observed_at":"2026-08-05T22:03:46.235503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07626","last_updated":"2025-08-11T05:09:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:43:29.662783Z","submitted_at":"2025-08-11T05:09:58Z","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.07626."}