{"as_of":"2026-08-04T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13117ad65c2e4854733c8b5eab073dbd6a4a68cddf8945c4b6ac91d699087fd9","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T21:16:51.909363Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:31:03.548002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T22:57:26.662723Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"cited_work":{"arxiv_id":"2511.17001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.17001","snapshot_observed_at":"2026-07-02T22:57:26.662723Z","title":"Unify Robot Actions in Camera Frame","venue":"cs.RO","work_id":"08a7d279-75b9-439e-a90d-6d452c42a323","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2511.17001","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:012bdd85b8087f29ff331fe153bdbcc778dbedf6b3de25c230accdbaacc71fe7","observation_id":"9d7360df-869f-4e25-88a0-e7c80dd2894c","resolution":{"observed_at":"2026-07-02T22:57:26.663913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.17001/citation-record","integrity":"/paper/2511.17001/integrity","json":"/paper/2511.17001/citation-record.json","paper":"/paper/2511.17001"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:91c4a444cbacf879b2a3b03fda17459bcd0b4477f2c2fc9f9a3e0ebc7c9b7c47","observation_id":"f81cab21-7dac-4095-a40d-f2f7f79f23f3","resolution":{"observed_at":"2026-05-17T21:20:17.151567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Easyhec: Accurate and automatic hand-eye calibration via differentiable rendering and space exploration.RA-L","venue":null,"work_id":"09a2f5af-2778-4f58-bed6-9a76ef36541d","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:6039cc142255c3faea53e83720bc64fdde6d11bb272b6079421b1a35a48b804a","observation_id":"38ef90de-ef96-441f-a665-65d3fe7dd03f","resolution":{"observed_at":"2026-05-17T21:20:18.208930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion.IJRR","venue":null,"work_id":"6c3de86a-4146-45e7-b8ff-cd197299e530","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:17c1959028ee332d91dc44f2f2ad58374ed4b1810a1ebd932e315dbfc0f957f2","observation_id":"780e7b2f-fc98-4ce2-b994-419c07228316","resolution":{"observed_at":"2026-05-17T21:20:18.127132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hand-eye calibration using dual quaternions.IJRR","venue":null,"work_id":"8f3a129b-e307-4b85-bd8d-4a536be13922","year":1999},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:b1933ecb4727d7bc9fd56e8d503b58ab63b1bb31f433fe8843edc04e282845a2","observation_id":"88619db3-1388-43cc-ab3f-ec35c8d52919","resolution":{"observed_at":"2026-05-17T21:20:18.211698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:dcc2d3f508f53ed435ebd96c8ee3a80a0c658f5ff8bf4d19ac0154fa7c50b08d","observation_id":"8720b644-0c86-4d29-821c-3682f636cf8d","resolution":{"observed_at":"2026-05-17T21:20:17.123725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03081","last_updated":"2025-08-25T06:01:46Z","snapshot_observed_at":"2026-07-06T20:46:55.190035Z","submitted_at":"2025-03-05T00:44:12Z","title":"AirExo-2: Scaling up Generalizable Robotic Imitation Learning with Low-Cost Exoskeletons","version":3},"cited_work":{"arxiv_id":"2503.03081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03081","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Airexo-2: Scaling up generalizable robotic imitation learning with low-cost exoskeletons","venue":null,"work_id":"04b1978e-d4cf-4fc2-b725-3cae4d4d6821","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2503.03081","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:9502164071c4f41ddf2a76c79c2ea240a5d1f56d9c7a9ba266965263e3de6ab6","observation_id":"6b282e29-46cd-4f02-b159-3e2005516051","resolution":{"observed_at":"2026-05-17T21:20:17.146749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":"2401.02117","doi":"10.48550/arxiv.2401.02117","metadata_source":"pith","pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","venue":"cs.RO","work_id":"5f6ff8ef-ed80-4c00-92c2-361c80bf8448","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:82bc332400244a9f9a16e9f76fea48c947af527c5114ba3f8190b6366b7fe719","observation_id":"d7b43fd3-fb90-4764-b56a-4be4f8848d0a","resolution":{"observed_at":"2026-05-17T21:20:17.129381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Easy- hec++: Fully automatic hand-eye calibration with pretrained image models","venue":null,"work_id":"42d7a85a-b6f8-4e66-9f7c-54d18935f41e","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:79f03ad1b2571959f1aed2bd5b5aee0e345295344005728118c7f16605866cca","observation_id":"7647d8b8-a983-48de-939a-5cd6d28bc174","resolution":{"observed_at":"2026-05-17T21:20:18.185674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust robot-camera calibra- tion","venue":null,"work_id":"bc31d155-93b1-49e2-9fe8-ce261f12cdbc","year":2011},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:30873c207925d482568bbf95190c33ef2672a589f4b3df06c267cb6f34fa9efc","observation_id":"ef677e73-2099-4909-a657-2a023b16610c","resolution":{"observed_at":"2026-05-17T21:20:18.136996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:61a0d23eb6634bdff8d9ebc1c0c615d622571b064590461551a01fedfdbdf474","observation_id":"b1fd7e4e-a5f9-4452-8d6e-e485c52fed88","resolution":{"observed_at":"2026-05-17T21:20:17.191917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlbench: The robot learning benchmark & learning environment.RA-L","venue":null,"work_id":"aaaa59da-345e-4f03-b0b9-dd3a19431dc3","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:cb93305916bb6cf373ad51f8579aad7d67e10909e8566a7639003f10af30aa00","observation_id":"31c82a33-22a7-4095-86f9-3d7fd1823a77","resolution":{"observed_at":"2026-05-17T21:20:18.178754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.441210Z","title":"Do you know where your camera is? view-invariant pol- icy learning with camera conditioning","venue":null,"work_id":"a8c6651a-16f2-44c1-a818-f0ab78fcb3c4","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:973440c1393e82bafa3b19cc9b186e9dcb572ce13f8fda31a60d4d2460f0df79","observation_id":"909777c9-1159-426c-8a6b-6158a56d539c","resolution":{"observed_at":"2026-05-17T21:20:17.224020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":"0a40555e-f130-4ded-a001-6eb6e71dbc60","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:09b3dc81165e2db4201849240570130f632b8cd3eb88f433753e8d08c04b5abe","observation_id":"89153cf0-89d3-4c83-a7c1-03f8dd87abaf","resolution":{"observed_at":"2026-05-17T21:20:18.175591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co- tracker3: Simpler and better point tracking by pseudo- labelling real videos","venue":null,"work_id":"676f25f1-9bf0-4b90-9be0-e048c961662e","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:5078ec3533ddf2435463a7dfdb83787f6623b824f9a85c58d6eedd351acc3f13","observation_id":"85290c57-0c12-464d-b487-6b0d0b534827","resolution":{"observed_at":"2026-05-17T21:20:18.169060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-07-10T23:17:45.234457Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:49a1a86f91b76d2ea37794929273499480c34b8e9b232f08db2240ff2d872a9c","observation_id":"1a0d4e30-6cb4-4b1c-91dc-8e0b214fa3c4","resolution":{"observed_at":"2026-05-17T21:20:17.171732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:f45b0343acfa5d3fc71827fe4ba198936aa25ebf231074973750b6b9b05ee7e5","observation_id":"fd491480-8f23-492c-96b4-866fd7c5e58f","resolution":{"observed_at":"2026-05-17T21:20:17.197592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Single-view robot pose and joint angle estimation via render & compare","venue":null,"work_id":"01e09140-9523-48bf-9775-e6ede4f55330","year":2021},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:50544b774cec60c0c1c6d864ce86c192d06f083a4479dd28340aef51d2ea8ce6","observation_id":"00484e7f-0c49-4a7f-9d22-147e7e5aa4a0","resolution":{"observed_at":"2026-05-17T21:20:18.165401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modular primitives for high-performance differentiable rendering.ToG","venue":null,"work_id":"89ebb34a-c60e-444d-b0de-74e778b9d81e","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:c0bf052b6dad5aa313ce63ccfd781159edaa5746eca9014f7a1441d95e21f715","observation_id":"d3ae63f6-68cd-46dd-aa60-cfefc9f6ee9e","resolution":{"observed_at":"2026-05-17T21:20:18.188981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Camera-to-robot pose estimation from a single image","venue":null,"work_id":"6f888c28-7ce1-410b-92cb-3a8ad4f9fd5a","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:8077cabe145f9bd070116263a70e651b1207543ebd6d692fa71e49b0f5503efa","observation_id":"1ed9ed54-ab30-4dbb-a016-7b723836a8e1","resolution":{"observed_at":"2026-05-17T21:20:18.161508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00779","last_updated":"2026-05-28T01:50:51Z","snapshot_observed_at":"2026-07-06T20:45:08.434808Z","submitted_at":"2025-03-02T08:06:55Z","title":"Phantom: Training Robots Without Robots Using Only Human Videos","version":2},"cited_work":{"arxiv_id":"2503.00779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00779","snapshot_observed_at":"2026-07-04T17:09:58.480967Z","title":"Phantom: Training robots without robots using only human videos","venue":"cs.RO","work_id":"4937256c-cfc6-49a8-b9e5-17e11befe0e3","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2503.00779","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:07baf08ad931245fec7220e9c4aa8c61ecdd56fdf073a469d633af6418afa388","observation_id":"839e34d6-b2e6-4f67-80d8-6e6eab7e1d64","resolution":{"observed_at":"2026-05-29T02:04:52.652914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ep n p: An accurate o (n) solution to the p n p problem.IJCV","venue":null,"work_id":"212c3a02-cfd0-4112-ad77-52559228d720","year":null},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:12d147785cf07e9de80e94223aeb2d5ff91b1877c9cd3d49f7ff95181c36dda6","observation_id":"016ceb0a-e572-421a-a3aa-79ccee7d8e79","resolution":{"observed_at":"2026-05-17T21:20:18.182376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompting depth anything for 4k resolution accurate metric depth estimation","venue":null,"work_id":"d1535b93-3c73-43d6-85eb-e93278f8be9c","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:6cb0504e1cf0dac804ed63ef62feb1749515ca499f6cf8a79666fa1daaecfe0b","observation_id":"f8d4e1b1-2085-4573-9f20-5119585b0bf9","resolution":{"observed_at":"2026-05-17T21:20:18.201871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning.NeurIPS","venue":null,"work_id":"1d075b0c-d09a-4f4d-a156-3a9c2c44e970","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:d289f22e6674e67dfaa68a2d0f94314f2db243845bc62779f970218cc6337272","observation_id":"e14ff6a7-a002-4121-8172-cff574436896","resolution":{"observed_at":"2026-05-17T21:20:18.198892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"5ab65d1b-2c9c-4e57-a4e4-6c6a449a6349","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:17965cb9aa5dfd9da132cc8c7b14ca421b84c9377557546409b582caf2d0bc2c","observation_id":"37007c2a-30a1-4e07-97bb-7902ab881c7a","resolution":{"observed_at":"2026-05-17T21:20:18.205553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Markerless camera-to-robot pose estimation via self-supervised sim-to- real transfer","venue":null,"work_id":"2ba1b9d3-0d5a-4c88-9fd1-6daebbd6f003","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:22c19b5c48a50ace2f92281c1ec9870905995d4c4a2e1a7cdebe7a2ec911a3f1","observation_id":"a8716ab8-2613-4ae6-854e-de9ede3a3d7d","resolution":{"observed_at":"2026-05-17T21:20:18.195706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ctrnet-x: Camera-to- robot pose estimation in real-world conditions using a single camera","venue":null,"work_id":"d84f8304-851d-4d76-bb50-0dd68864124f","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:2744c3d2bb0d5cb82e006871de11c0dd5a863d22fcd7fb4af8cce62bd3f6317c","observation_id":"ae5df544-dd5f-40f2-9117-76b753a3c153","resolution":{"observed_at":"2026-05-17T21:20:18.154481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":"2108.10470","doi":"10.48550/arxiv.2108.10470","metadata_source":"pith","pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","venue":"cs.RO","work_id":"a21210c8-5b8f-429a-accc-fb4ca1efd19d","year":2021},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:2f5fbcb11a4d630c25f8b83ef696ee302c91b73142c232cd5c2a9bfe37615393","observation_id":"34f6a455-e7b5-4b54-bb26-253997eb95a6","resolution":{"observed_at":"2026-05-17T21:20:17.161329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segic: Unleashing the emergent correspondence for in-context segmentation","venue":null,"work_id":"f0114cd7-8d65-40d2-b98e-24c85bd1de26","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:ebf97c446277bf15a5d4854264ee1a0f17396710a7139434ec45b8529078a00b","observation_id":"ccab7834-03c7-40eb-8797-d220e13d6fa5","resolution":{"observed_at":"2026-05-17T21:20:18.172371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:36f3daf0f81d902890a24c113e6d0c3a10785f29f9886f5c266776cbee77ebd3","observation_id":"e11f9d58-8445-4869-a31f-17b4dd4dc9e9","resolution":{"observed_at":"2026-05-17T21:20:17.185441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"b0144cec-981d-418c-9bf5-47f5c62089da","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:aa068514cde9e680eca07455e4de4a7f5c3ddb4cf2a373b42e0193cf8c38f75f","observation_id":"058f4355-3ed5-4a0e-acb3-c45fefb00675","resolution":{"observed_at":"2026-05-17T21:20:18.144371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot sensor calibration: solving ax= xb on the euclidean group.T-RO","venue":null,"work_id":"06294e8c-1432-40eb-97db-4f90ebbc284e","year":1994},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:ea66efb72e0e7f0217901cbf83ead1ae08b01ea253934f712f7c4689852048e6","observation_id":"5a1b8cef-fa45-4139-b815-1d86e0f54c18","resolution":{"observed_at":"2026-05-17T21:20:18.157984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"ce7ec745-cf4e-40e7-b6db-02261becbd51","year":2021},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:0dc23c6f67c6f38c4da31fba45d3e67af24d5c9a951615aa06d23ba390b8e0b9","observation_id":"881dde1f-d917-4901-83f7-da6e5209dc4f","resolution":{"observed_at":"2026-05-17T21:20:18.192438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:7bc6e6828b8df0224326833f5cb590a669ee39a6fbf882ce0d38a07efbc3d76b","observation_id":"95741c77-8fa2-4f39-ab28-ff3158b1269d","resolution":{"observed_at":"2026-05-17T21:20:17.209821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":"2405.10300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-07-04T13:29:51.401689Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":"6a6347d8-e869-489f-9e0e-19ffb2023438","year":2024},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:49a9f8094bacd20123ebe3b744e5e9529cc991bfb15c880d1ab1253db14ccab8","observation_id":"1c5b9076-7145-495c-a71b-30b77f83cc11","resolution":{"observed_at":"2026-05-17T21:20:17.141250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent correspondence from image diffusion.NeurIPS","venue":null,"work_id":"f033f928-4c0a-41b2-a699-656ffe1108e6","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:38ddb104e367059d81139ac7058d3965e15d6fa25eec5dfaa0d2028fd0829150","observation_id":"e5080c59-02ac-42f9-be76-c9243527bf6b","resolution":{"observed_at":"2026-05-17T21:20:18.130455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A new technique for fully autonomous and efficient 3 d robotics hand/eye calibra- tion.T-RO","venue":null,"work_id":"6e78147a-b1f2-4152-98b2-3b8768fb5bae","year":1989},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:d110aa2f9375ff71e41ac5196556a0831314b40c07368e0cd0bfe28bec4f7bd1","observation_id":"fca4bb70-35cc-4783-a231-de22c7753f3e","resolution":{"observed_at":"2026-05-17T21:20:18.133627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-04T00:30:25.045042Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":"2302.12422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-07-09T22:16:36.400090Z","title":"Mim- icplay: Long-horizon imitation learning by watching hu- man play","venue":"cs.RO","work_id":"f1c0e860-19bf-4217-afb5-13797ab23385","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:a723821e3da18bf93842578b0d5128e5c2b69563cb2912b891dfa6ada102269d","observation_id":"dc195d3c-e434-4879-ba25-b139876d5c2c","resolution":{"observed_at":"2026-05-17T21:20:17.176691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"fe080e28-39c1-4c45-9407-d5559e40159f","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:886acb6a8958595582d108ae105607ca9a4a610ea108f7a5f09eede6f6e72441","observation_id":"7c5c7f4a-d5f5-4190-a1c3-fd3505ed2c76","resolution":{"observed_at":"2026-05-17T21:20:18.140875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-03T01:52:36.481243Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":"2203.03605","doi":"10.48550/arxiv.2203.03605","metadata_source":"pith","pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-07-10T13:57:06.952129Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","venue":"cs.CV","work_id":"4e842f69-fa99-4dde-b8a7-b5a558d4c80b","year":2022},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:d8af70015a06ccb72696494ffbb9876476793995c97201b887169112557dbe52","observation_id":"61b2f714-d90f-426f-88b0-858e4e4c65a7","resolution":{"observed_at":"2026-05-17T21:20:17.135058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long- horizon reasoning tasks","venue":null,"work_id":"54b6a444-d98c-4edc-95be-a46d5984d22d","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:8d7578e0633302b73fc5be92c43349c62bfa3ce34fed961c584c2b482bdff2b2","observation_id":"89b7172b-7578-4d7b-8eab-2af44d50c043","resolution":{"observed_at":"2026-05-17T21:20:18.147803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-07-06T22:14:35.142771Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"cited_work":{"arxiv_id":"2508.13103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding actions in camera space: Observation-centric vision-language-action policy","venue":null,"work_id":"799a65a0-2738-4979-910f-2cc9c6af150e","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2508.13103","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:c2e3690db4de874d508d3ac0f16ff2be8fb596b5150c8da4bb75c8647b51d2ea","observation_id":"cb4fe4bc-0492-4874-81b6-d0d012b26025","resolution":{"observed_at":"2026-05-17T21:20:17.204124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-07-10T19:47:32.593829Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:898bc57eec2bbe0c09e6acb4c0e0fa073e2a9718fed651f14212e1e76ed3a0fc","observation_id":"91a16a7c-8394-4e46-bd3a-1e3a07129cff","resolution":{"observed_at":"2026-05-17T21:20:17.156363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":"2009.12293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-07-10T23:07:48.196994Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","venue":"cs.RO","work_id":"d616d4ba-7713-4e3e-8c9e-dfebbb8f1abf","year":2020},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:076a0df648e3d87b973d167592dadc4ac873fe74989e1b9d9d4758a686b734a7","observation_id":"0ffd5098-eef0-4947-8c97-86959e49bf50","resolution":{"observed_at":"2026-05-17T21:20:17.214948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"01967ee4-a3e9-4218-ad1b-597ee3ca2de1","year":2023},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:5e53f0458b162084dee9ef564dcb9c78e6abd3a18faf7e4256c16303c68bfacb","observation_id":"937a12df-0b77-448c-95bb-2f756752c669","resolution":{"observed_at":"2026-05-17T21:20:18.151326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":26},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2511.17001."}