{"as_of":"2026-08-09T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55db6e7a958f49405861400b0263fd5e4e105f447de1e18b42b7bfc38033a3f3","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:03:01.873084Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:08:03.385771Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"cited_work":{"arxiv_id":"2506.03605","doi":"10.48550/arxiv.2506.03605","metadata_source":"pith","pith_arxiv_id":"2506.03605","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","venue":"cs.CV","work_id":"e97989cf-b4de-49f9-842c-6dda264f5663","year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.385771Z"},"links":{"cited_paper":"/paper/2506.03605","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4a3540e1a97470169a1ff89ed61d34e9a7771effa64e5e5dd5b453df31b242b8","observation_id":"8bda7ddf-e769-428a-b03a-0e6824903cce","resolution":{"observed_at":"2026-08-01T21:08:34.652209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03605/citation-record","integrity":"/paper/2506.03605/integrity","json":"/paper/2506.03605/citation-record.json","paper":"/paper/2506.03605"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:03:01.639168Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.639168Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:a2810921509722f553179ba9dd648b2e1d20f362ffcc5e358a78629b5e688c87","observation_id":"47410969-3493-4621-8539-833a4921c801","resolution":{"observed_at":"2026-08-07T11:03:01.639168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.643039Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.643039Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:6a365351af5fe5801a50647230a8972179cc140335dadead8729ff06ad69e48b","observation_id":"0e0448d2-0fd0-46e8-b11f-0be3ee0c163c","resolution":{"observed_at":"2026-08-07T11:03:01.643039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09598","last_updated":"2024-06-13T21:38:17Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T21:38:17Z","title":"Introducing HOT3D: An Egocentric Dataset for 3D Hand and Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09598","snapshot_observed_at":"2026-08-07T11:03:01.645783Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.645783Z"},"links":{"cited_paper":"/paper/2406.09598","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:f731de41e58c33e9f5d96315bbfc635f175778e4d657ecbd7b220af136a2a7d7","observation_id":"eacf354e-7547-4189-8c4f-a1aaa84966a9","resolution":{"observed_at":"2026-08-07T11:03:01.645783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.648655Z","title":"METEOR: An auto- matic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.648655Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d4624a94077c637a65e452353e9457f4be5887e52beb7956575bb1321c680327","observation_id":"c5de6b31-54c3-43ed-8559-99d5c96e98dc","resolution":{"observed_at":"2026-08-07T11:03:01.648655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.651358Z","title":"Uncertainty-aware state space transformer for egocentric 3d hand trajectory forecasting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.651358Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:77b119559ffd9e6272bedb5537670a4775d9a375825005da9b2f7013db3b8624","observation_id":"11cb9d9e-ebb4-4334-ba79-b778064223d4","resolution":{"observed_at":"2026-08-07T11:03:01.651358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.653992Z","title":"ARKitscenes - a diverse real-world dataset for 3d indoor scene understanding using mobile RGB-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.653992Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:f0cff1506ca7bb8469ee1cd3f68a2836337fa726b1916a0f3837fc34c6dc6802","observation_id":"de485560-fb69-47ec-9292-dd7e502dd5d2","resolution":{"observed_at":"2026-08-07T11:03:01.653992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.656749Z","title":"Yu, and Jianbo Shi","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.656749Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:08fa4ed0edae9fc939b2ec5fdec2b489663fd2c5d8782d4328aa26d16938bf72","observation_id":"b1cea614-4c66-407d-9791-5c25fa705b26","resolution":{"observed_at":"2026-08-07T11:03:01.656749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.659454Z","title":"Kemp, and James Hays","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.659454Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:822b868f9a0805782f985c7ac9e2e838685efe7e25e31ca04b7dea3499f18657","observation_id":"92a0aeb6-a92e-4280-802d-537d3320f81e","resolution":{"observed_at":"2026-08-07T11:03:01.659454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.662279Z","title":"RT-1: Robotics Transformer for Real- World Control at Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.662279Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:a2c993c105a64c483f3d7ceb6d2b1f4cd6df3a8f0c4e8f35ad09e9d6c66b6276","observation_id":"b2979133-5d9f-4006-9856-5fe7c1fc25cc","resolution":{"observed_at":"2026-08-07T11:03:01.662279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.665148Z","title":"Deep regression on manifolds: A 3d ro- tation case study","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.665148Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9ac259b8276f9b82f2dba976903cb1191986f0bcc74ae959b9666120e524078b","observation_id":"4c9c4bda-f8b5-4526-af9a-3b52d7b56fb1","resolution":{"observed_at":"2026-08-07T11:03:01.665148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.667377Z","title":"Text2hoi: Text-guided 3d motion generation for hand-object interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.667377Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c9cbcb568206c43ae1644463309ce7dded33d84c79f3a6be44a72e7796b665de","observation_id":"557b2e18-0eaf-43e4-ba88-bce57396ee90","resolution":{"observed_at":"2026-08-07T11:03:01.667377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.669846Z","title":"Fleet, and Geoffrey Hinton","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.669846Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:afa4d4b73f98b2b69c6f39deb1e2cdb8acd74f571c300213752d5ed30da54b6b","observation_id":"561ecdfc-d092-4cf9-9d8b-f12debce7731","resolution":{"observed_at":"2026-08-07T11:03:01.669846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.672243Z","title":"Looking to relations for future trajectory forecast","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.672243Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:eb4261ff56743f110e925fa2b57711a158e51e955d9f8584456a7cdbe3959b59","observation_id":"ea0f3456-6039-4168-b018-0686df5c26ad","resolution":{"observed_at":"2026-08-07T11:03:01.672243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.674396Z","title":"Learning to act properly: Predicting and explain- ing affordances from images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.674396Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:1c84fdabd68013d07d40f39d22f5b2f375210df47579cc01cd19935ca11fc556","observation_id":"7e55b631-8c15-421e-bff0-bcadd4487b6d","resolution":{"observed_at":"2026-08-07T11:03:01.674396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.676590Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.676590Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d4562ecbcf5d92bec50e4228c412d66e8c1a78bc166b504ad68bfbaadea64f94","observation_id":"a68d4040-8d7d-4549-97c3-31865a1c710a","resolution":{"observed_at":"2026-08-07T11:03:01.676590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.678794Z","title":"Ganhand: Predicting human grasp affordances in multi-object scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.678794Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:b7c842873bff713b458812c9df73aec9f818bd211b4d20481426cee1bddc2825","observation_id":"27c3dced-da60-421b-bc08-b56860c1b583","resolution":{"observed_at":"2026-08-07T11:03:01.678794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.681123Z","title":"Scaling egocentric vision: The epic- kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.681123Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:3bfb0f10db14bbe0ffec2f88c614dd8994c65ae2f8925203608f6422aa74bd94","observation_id":"1fb4cb0e-aa1b-4380-a678-8667f639a872","resolution":{"observed_at":"2026-08-07T11:03:01.681123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.683615Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100.Interna- tional Journal of Computer Vision, 130(1):33–55, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.683615Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:34dc689d757af78736baf5e00010bfc0d3dbaff1d6a6ba7eeca837ae2c1d802c","observation_id":"5b0e67e0-837d-4c2a-8850-75b5b89d204e","resolution":{"observed_at":"2026-08-07T11:03:01.683615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.685866Z","title":"Affor- dancenet: An end-to-end deep learning approach for object affordance detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.685866Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:0c89503cf0dc1c70375b5eb34058c3b7e412dd4defc08bb943b90c30bf05aac5","observation_id":"de27e247-7e19-4ed7-b155-7edbf824ff29","resolution":{"observed_at":"2026-08-07T11:03:01.685866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.688348Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.688348Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c0dbe2e849c948bf47f89c153973b897d2ff81ddb13c9161f0fdb8295f0b9b86","observation_id":"cb20bff5-da7a-44e5-bcec-6300eccf0542","resolution":{"observed_at":"2026-08-07T11:03:01.688348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-07T11:03:01.690863Z","title":"Project aria: A new tool for egocentric multi-modal ai research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.690863Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:7b52f98db1527511a99bb9913904a1de51a8f61c0b0e8bcd0b063c932e4586b7","observation_id":"f70df54e-48eb-4c63-b46c-d28fefc7c550","resolution":{"observed_at":"2026-08-07T11:03:01.690863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.693195Z","title":"Egopat3dv2: Predicting 3d action target from 2d egocentric vision for human-robot interac- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.693195Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:bff04d7eb82064d1ec5fc2996eea16bf3274250f547b9cd32228f69c964939a4","observation_id":"4cafee9a-65f6-46df-be94-96f49ae2bf13","resolution":{"observed_at":"2026-08-07T11:03:01.693195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.695507Z","title":"Fischler and Robert C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.695507Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:a6b42f1322859a17589b838ae12ef38d76b2b7384ee945d982477e516e857905","observation_id":"4f40752f-fb0c-4820-8e37-cacb93de807b","resolution":{"observed_at":"2026-08-07T11:03:01.695507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.697706Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.697706Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c9955862db3401874173a0fc832da482c4b0c48ef048b9ab2c4ac79e40a13c09","observation_id":"822acb03-881c-4f2b-9c00-033718bdcf53","resolution":{"observed_at":"2026-08-07T11:03:01.697706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.699904Z","title":"What would you expect? anticipating egocentric actions with rolling-unrolling lstms and modality attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.699904Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:6646381b722ec00403441c809d1f550a16e53dbd145699d02b141b03684124e3","observation_id":"bf437845-6a3b-4c46-846b-5ddb1e278a48","resolution":{"observed_at":"2026-08-07T11:03:01.699904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.702296Z","title":"Next-active-object predic- tion from egocentric videos.Journal of Visual Communi- cation and Image Representation, 49:401–411, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.702296Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:fa7a2fbd40b0b329ebe5196a67c1d0962b01a79022dc9a0ecd8fa9a3fe395545","observation_id":"b43f8726-c20e-4eb5-b077-dd31dad3d841","resolution":{"observed_at":"2026-08-07T11:03:01.702296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.705143Z","title":"So predictable! continuous 3d hand trajectory prediction in virtual reality","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.705143Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:64088adf119c390fe474986492db96aeef24bed547aa05dd41d2e3e0c1ff69ec","observation_id":"c23d645a-23b6-4211-ae47-869660f44c20","resolution":{"observed_at":"2026-08-07T11:03:01.705143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.707448Z","title":"Transformer networks for trajectory forecasting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.707448Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:6c500522f2e2335685dceb8a49189895b39cbff3c2eac4ea57a1290fe25f3bc8","observation_id":"df8fd2ba-d4cd-4342-a041-96d9b3477dc5","resolution":{"observed_at":"2026-08-07T11:03:01.707448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.709696Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.709696Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:27797e68ec651a319ffd63e943e868663a74786f43d8c19f1c5222ba20fb65db","observation_id":"38f75670-71f1-4db6-bf5a-88f0d6751f35","resolution":{"observed_at":"2026-08-07T11:03:01.709696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18259","last_updated":"2024-09-25T21:55:38Z","snapshot_observed_at":"2026-08-08T17:40:49.067743Z","submitted_at":"2023-11-30T05:21:07Z","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18259","snapshot_observed_at":"2026-08-07T11:03:01.711729Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives.arXiv preprint arXiv:2311.18259, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.711729Z"},"links":{"cited_paper":"/paper/2311.18259","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d151c77e1ba62f8939db13dc0677e8104ea69f077d88dc8edcf66a0a3de234ae","observation_id":"8af6e787-429b-47bc-981c-a3128c1425d3","resolution":{"observed_at":"2026-08-07T11:03:01.711729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.714360Z","title":"Handal: A dataset of real-world manipulable object cate- gories with pose annotations, affordances, and reconstruc- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.714360Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:85c3fd480671692cac5a700aee572b0bc0297ac46e7edc3165485da7fec26d86","observation_id":"21d1c34b-ed98-4cfd-8483-993549dd4e4a","resolution":{"observed_at":"2026-08-07T11:03:01.714360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.716689Z","title":"Honnotate: A method for 3d annotation of hand and object poses","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.716689Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:1478e07ebd9307af2d0a42cfb6f72a39e12a0bf3dfeeeae87c29d713977f4b88","observation_id":"931b5475-e2fb-436a-a2d1-d96678ec075c","resolution":{"observed_at":"2026-08-07T11:03:01.716689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.718900Z","title":"Ego3dt: Tracking every 3d object in ego-centric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.718900Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5c886c3b135624f0ff8b6a708575dfaa5ba30786b46a1984cb0d0fbeab2c7360","observation_id":"cb6f7cc7-ddf8-4477-837d-b16ebfd6c1fe","resolution":{"observed_at":"2026-08-07T11:03:01.718900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.721146Z","title":"Onepose++: Keypoint-free one- shot object pose estimation without cad models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.721146Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9a526d18bd719bba1d627c50a58de3229d240c65d17572004773d93abc194f08","observation_id":"adc330e8-6101-4ca2-9e30-b0f7e09ed2a3","resolution":{"observed_at":"2026-08-07T11:03:01.721146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.723553Z","title":"Pvn3d: A deep point-wise 3d keypoints voting network for 6dof pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.723553Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:7bb2aea4da01963982fba628e807468676de09fffba655561c794dd2c9253095","observation_id":"b4bc772e-e112-43ec-8d45-b39e3fa6dde2","resolution":{"observed_at":"2026-08-07T11:03:01.723553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.831636Z","title":"Fs6d: Few-shot 6d pose estimation of novel objects","venue":null,"work_id":"05988ed1-e71f-452e-8ad3-9b118927fb13","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.725649Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9da89db84ce8b9aae6c4932b2b9c64857a98f2ad0d0b800a5ab4569d46f7a421","observation_id":"d14f3dfe-27d0-4714-aa2c-d098d497726d","resolution":{"observed_at":"2026-08-07T11:03:02.834333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.824848Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"d525a6cb-3c2c-449d-95cc-351ea2621fe6","year":2020},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.727761Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5bbf22adffe1de62e5eba331535dfc4985e22a4886b52c999f720aea5df4eb92","observation_id":"fe9080e1-5070-4185-856b-56a5358a222d","resolution":{"observed_at":"2026-08-07T11:03:02.827197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.818053Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":"dc84425d-9e92-4694-b35f-2ebecb5f2c4c","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.729959Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:bba4bb7af45d3f252c0672fafabfc9e01c4de5c2af9c0b21230cf6c75b7c3ead","observation_id":"17033dfd-1bed-4186-9d77-dc94c135f42a","resolution":{"observed_at":"2026-08-07T11:03:02.820454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-07-06T17:52:18.041492Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-07T11:03:01.732235Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.732235Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:33af200937679d907c549a22d0179424e5e7c3055e8b4a11594afba42ad17c41","observation_id":"04037fe9-cbc4-4c92-917d-e2c1e3160f1b","resolution":{"observed_at":"2026-08-07T11:03:01.732235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.811171Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":"190d7a55-2fc9-420f-899d-443c7b9a5e0f","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.734633Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:1715ff82c5d4dc63112b76ec1e241600fc265a7f085a64387d749aa1e9821552","observation_id":"764af670-8aab-4d8c-bf47-021987343d08","resolution":{"observed_at":"2026-08-07T11:03:02.813619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01467","last_updated":"2023-07-04T04:12:49Z","snapshot_observed_at":"2026-07-06T15:49:58.951341Z","submitted_at":"2023-07-04T04:12:49Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01467","snapshot_observed_at":"2026-08-07T11:03:01.737020Z","title":"Technical report for ego4d long term action antici- pation challenge 2023.arXiv preprint arXiv:2307.01467,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.737020Z"},"links":{"cited_paper":"/paper/2307.01467","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:68726749f420c3c306b06936c9cc90ba2090b0fc619551df2300554410c7c416","observation_id":"2ef80ba7-fecf-4573-96ec-35d4f8b57f4e","resolution":{"observed_at":"2026-08-07T11:03:01.737020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.804547Z","title":"Jacobs, Michael I","venue":null,"work_id":"815e2948-f027-4c9d-b11a-85241e9c52ec","year":1991},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.739593Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:fbc5ef7b57545ae25d62cbe179aaabb89f4a7c4b54a78f88317ff0bd113f21e7","observation_id":"f30ae56d-c238-4ccf-bb09-e808ef756a06","resolution":{"observed_at":"2026-08-07T11:03:02.806848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.797539Z","title":"Jordan and R.A","venue":null,"work_id":"c95eacef-8ac4-4140-a401-3c7411c03a81","year":1993},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.741741Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:fa29b9b1db14140780996b12b9e9e01328048d108050ed7110ab9af9725b428d","observation_id":"edbbc3bc-09a9-45cd-8a51-796d0fa0dfab","resolution":{"observed_at":"2026-08-07T11:03:02.800121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T11:03:01.743937Z","title":"Open- vla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.743937Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c2b359d04e76d076118fb21996d70b3903742d41009c694f873c0189118af676","observation_id":"6771cede-c617-48fe-9099-84ac18712688","resolution":{"observed_at":"2026-08-07T11:03:01.743937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.790208Z","title":"Koppula and Ashutosh Saxena","venue":null,"work_id":"6f020dd5-b0d8-4da7-b2d8-bbfd2753aff0","year":2016},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.746343Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:fe312fedf91c0ccc60058c1b6affd8b75089bababb135667b03add21e3b042ee","observation_id":"c03a6023-fbd9-4c1a-b77a-4f4f58c3a29a","resolution":{"observed_at":"2026-08-07T11:03:02.792891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.782746Z","title":"H2o: Two hands manipulating objects for first person interaction recognition","venue":null,"work_id":"54a9eb1c-2d22-4ae2-9c5a-f5e1705e77d4","year":2021},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.748950Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:e66c51fc51f9b18b08acbdd8b5eabebcab18597703f1d0996a6c1207054c58bb","observation_id":"7746be9a-727f-4292-9c42-34e4e355dd73","resolution":{"observed_at":"2026-08-07T11:03:02.785551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.775856Z","title":"Choy, Philip H","venue":null,"work_id":"be7d939e-530e-4f49-a898-48557cb705a5","year":2017},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.751582Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d39aab1de45b2db17354814312e7614ba8761ff9e5502486cb9c2f55c0d5df12","observation_id":"fd9ce56b-5902-45a9-9686-86d7318c9ae2","resolution":{"observed_at":"2026-08-07T11:03:02.778345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.768732Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding","venue":null,"work_id":"344fff46-c3ff-40fb-afb5-8f2e6065bd7c","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.753872Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:dd6eaaddbfd316506ad5aa73ceb0bad8c4d774931af3f31a5cb84f0cd57ed50e","observation_id":"5d5f9080-3912-49cf-9ac3-2e07b2aebf5d","resolution":{"observed_at":"2026-08-07T11:03:02.771210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.755952Z","title":"Learning precise affordances from ego- centric videos for robotic manipulation.arxiv preprint arXiv:2408.10123, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.755952Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:424db7578986845d334164362e0787f882f4e751511347cf46722ad3bb4bedb4","observation_id":"6891d889-8271-47ca-9ab6-a7ea2e73b333","resolution":{"observed_at":"2026-08-07T11:03:01.755952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.761467Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"37d6d6b7-291c-4470-bc84-934b13718b68","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.758183Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5a869ae29bf6e02045ea88d1ac85c84a25ffc912e864991dd2cc24e230053875","observation_id":"2a635c79-6523-4826-af66-c6660f6a560c","resolution":{"observed_at":"2026-08-07T11:03:02.763851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.753820Z","title":null,"venue":null,"work_id":"36409404-318a-457b-88d9-cfc8b7cf9ce6","year":2018},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.760603Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:3907753e89d4ffd28ea26c5c46e4607d2c66dda1c58a640ee9475567f6740dd2","observation_id":"ccb09b42-4bb9-4ce6-abcb-4a4662bc6d85","resolution":{"observed_at":"2026-08-07T11:03:02.756194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.746343Z","title":"Deepim: Deep iterative matching for 6d pose estimation","venue":null,"work_id":"30c3fd08-41a1-44f5-9aed-d4d2f046af00","year":2018},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.762807Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:e588de5f6fe85e15b6903a0ebc9797c06c9fd03cd15bb11211ec9d8a0fb56374","observation_id":"3837d5c2-7a9c-4e69-941e-4ace089e592c","resolution":{"observed_at":"2026-08-07T11:03:02.749185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.738764Z","title":"Egocentric predic- tion of action target in 3d","venue":null,"work_id":"09ed3cc7-fdac-4868-9ebb-173b2298c01f","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.765023Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c55e37e9ed3e850ca3b2927573a95eedf133ad579e43108954232ee492da350e","observation_id":"e991d2d3-bc65-4b85-998d-397973cb58d8","resolution":{"observed_at":"2026-08-07T11:03:02.741266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.731019Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"f75baca6-0f40-4063-8bb6-2a325caafa4c","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.767024Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:df74a2498e636299d6c701b8218cf4269d3c39ffb13be43916119f60493c8d89","observation_id":"4b58a739-6ba0-40d7-b793-ad66de36a381","resolution":{"observed_at":"2026-08-07T11:03:02.733369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.723361Z","title":"Visual instruction tuning","venue":null,"work_id":"e7305dc0-21a8-40be-993e-4a7621f81d0d","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.769093Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5ef0bb76cad2c9e322ad253abfae51722c646473184b4caff32bafa3f4937123","observation_id":"1aaac6ff-ea91-4329-a438-0c2fedd866c8","resolution":{"observed_at":"2026-08-07T11:03:02.725673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.715905Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"bac379d9-8039-45f4-b9f3-63bd81ae4fa9","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.771408Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:14f3dbdc933cffbbb2a5c9f08c72ff83930f8959bf3cd9de46cc7069dd02ac0e","observation_id":"c9bba91b-93f4-4abe-8075-a3ad36481ef3","resolution":{"observed_at":"2026-08-07T11:03:02.718489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.708614Z","title":null,"venue":null,"work_id":"180069bb-f294-4304-aa04-4c3af84c30c4","year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.773689Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:64cb630a975e41dfcb00ef62e3a4ec8b6154b2c4f9a7c60051efaed167072164","observation_id":"95b62291-4839-402c-95b4-e81f6f958610","resolution":{"observed_at":"2026-08-07T11:03:02.711058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.701297Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"b809b1c1-00eb-4595-9845-7f6730f32202","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.776268Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:437d633eccc6f6ccf937adfe51be0bfde0e1442b0b25ffeec1a617470b513a92","observation_id":"89577c0a-d18c-4960-8da4-d952bdd5d7ef","resolution":{"observed_at":"2026-08-07T11:03:02.703822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T11:03:01.778564Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.778564Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:f62fc952d3a744420e13145f171b5703d6738fd22af052b5352673a2b25598b4","observation_id":"447f20c7-76fc-47ae-9800-9c979c79da83","resolution":{"observed_at":"2026-08-07T11:03:01.778564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.781185Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.781185Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:07ad71076febae8bac7aca43dca9d3a0225cb3e369efe28107db7e5a825c3601","observation_id":"023e3407-0794-4240-b2a2-df951c391638","resolution":{"observed_at":"2026-08-07T11:03:01.781185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.688761Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"98ae09fa-80be-4955-976a-44dcaa992857","year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.783372Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:63abb81df81dbd3ac564b25fa7002596d79da5fd4e91bc6c99e2d6e706c45800","observation_id":"e08fbb80-4ef6-4756-93f0-7476aee864c0","resolution":{"observed_at":"2026-08-07T11:03:02.691148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.681127Z","title":"Phrase-based affordance detection via cyclic bi- lateral interaction.IEEE Transactions on Artificial Intelli- gence, 4(5):1186–1198, 2023","venue":null,"work_id":"3d48b103-4e70-4f1d-9b1d-cabf70ed9d12","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.785682Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:a360dde3a63cf53e6c00b5645181288785bf880ef40afa4dd4b3cce144c91378","observation_id":"930debae-048d-41d0-a0eb-29c7346224a7","resolution":{"observed_at":"2026-08-07T11:03:02.684074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.787848Z","title":"Madiff: Motion-aware mamba diffusion models for hand trajectory prediction on egocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.787848Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:360fd253b9621af122220165ae12d6f02901ac009c68347cff46c39546380229","observation_id":"f15860b1-d882-4991-b12c-21228494844b","resolution":{"observed_at":"2026-08-07T11:03:01.787848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.789958Z","title":"Diff-ip2d: Diffusion-based hand-object interac- tion prediction on egocentric videos.arXiv preprint arXiv:2405.04370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.789958Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:01086e3f36ecfe2405157ad460c13b2034c5ef2ba1862a7b15a425c7d25fdedb","observation_id":"2026da06-56bc-47f1-846b-17d4caab190a","resolution":{"observed_at":"2026-08-07T11:03:01.789958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.673891Z","title":"Quest 3, 2023","venue":null,"work_id":"0d194d08-e399-4741-82ff-0909c07c1654","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.792768Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:0e126ad60f98cc0f482c468a2b7b711309cfee9e8c6c4b16a2c1eec5a6715bed","observation_id":"5153fdae-f7e7-4702-99b5-59a4e0fca411","resolution":{"observed_at":"2026-08-07T11:03:02.676435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.664212Z","title":"Leveraging the present to anticipate the future in videos","venue":null,"work_id":"77236394-af91-46dd-ab0e-72c87c209159","year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.795177Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:471be09e072fa66a510fc172df7de2634b05732f28e3228616c8d60baad22c35","observation_id":"819c8625-4a37-4003-b1c7-e15ea6411a84","resolution":{"observed_at":"2026-08-07T11:03:02.668973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02704","last_updated":"2024-11-05T01:02:51Z","snapshot_observed_at":"2026-07-30T17:47:10.851530Z","submitted_at":"2024-11-05T01:02:51Z","title":"RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02704","snapshot_observed_at":"2026-08-07T11:03:01.797316Z","title":"Rt-affordance: Affordances are versatile intermedi- ate representations for robot manipulation.arXiv preprint arXiv:2411.02704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.797316Z"},"links":{"cited_paper":"/paper/2411.02704","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:19796b55e646507186e2c482e071726b7e26d0b589ff289cf820f4e46a448aff","observation_id":"1102a049-928a-4b00-8f73-b05afd3ba384","resolution":{"observed_at":"2026-08-07T11:03:01.797316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.590788Z","title":"Open-vocabulary affordance detection in 3d point clouds","venue":null,"work_id":"0111121d-5626-4ba8-a9c4-c81e1fbaa713","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.799828Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:b2e7a532c7308104b245d9c25abf316bf98ba6683c8848648eb6611afdf5f7f5","observation_id":"d6df2c9a-dc7a-42bc-8c84-71a04c76e048","resolution":{"observed_at":"2026-08-07T11:03:02.593310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.583169Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2d72c3ee-25cf-447c-bff3-36c601a85a05","year":2002},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.802108Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:8d86cd1fbe137ba24d996624b173afddcb8e40fa47ac257ed7e8d0864e62b67f","observation_id":"8c71b377-7abe-4271-8ff7-7e4f1e62d16e","resolution":{"observed_at":"2026-08-07T11:03:02.585613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.575571Z","title":"Colored point cloud registration revisited","venue":null,"work_id":"1d4797aa-63fb-4154-a43c-d4533a3bbcc7","year":2017},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.804235Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:2dfc1d9dc2e6ac7a88f2f00339cb6095c698c5089a16f586de7b3c8ec20dc8a5","observation_id":"42a10d2e-0ed0-4b9e-a118-10202a618bf0","resolution":{"observed_at":"2026-08-07T11:03:02.578279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.566162Z","title":"Pix2pose: Pixel-wise coordinate regression of objects for 6d pose es- timation","venue":null,"work_id":"d1025f23-866e-4bcf-859b-1d83b89cba30","year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.806379Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:617c14f0442062a2173a29e09a94320cbdf661c2df2f8d51145a518568c62e10","observation_id":"7b1dbff0-fffd-40ef-92ba-84967b0d8a59","resolution":{"observed_at":"2026-08-07T11:03:02.570682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.558758Z","title":"GloVe: Global vectors for word representation","venue":null,"work_id":"ef9cf7b9-a5c1-4ed3-bff9-b47276cabc40","year":2014},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.808650Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:4e4f12447de162d4980819944e31cb17fa0a22f54701eac8784f6581fb50831b","observation_id":"8aab98a6-a389-4042-a712-40a55c6136f9","resolution":{"observed_at":"2026-08-07T11:03:02.561159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.551122Z","title":"Detecting activities of daily living in first-person camera views","venue":null,"work_id":"d74bbe06-a800-4100-96a4-33d54a2af2eb","year":2012},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.810884Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:63c2678e29977836d279806cb671ae33451e92471707564634628be387b70ee4","observation_id":"27344cf1-4e69-451c-be86-c28f395af6e0","resolution":{"observed_at":"2026-08-07T11:03:02.553759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05072","last_updated":"2025-01-21T21:33:06Z","snapshot_observed_at":"2026-08-01T16:20:24.128490Z","submitted_at":"2024-04-07T21:00:14Z","title":"Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05072","snapshot_observed_at":"2026-08-07T11:03:01.813217Z","title":"Spatial cognition from egocentric video: Out of sight, not out of mind.arXiv preprint arXiv:2404.05072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.813217Z"},"links":{"cited_paper":"/paper/2404.05072","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:2d3351c4520d37be253a4ffd0df50fc7a4eb36732929ae3c1bdb096cd595b555","observation_id":"5ea1d6b9-698f-42d3-8f70-1c24eae0f2bc","resolution":{"observed_at":"2026-08-07T11:03:01.813217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:01.815569Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.815569Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:8801064722e0ead42c74c88f27a9671822c873c8efc7493db4eedc42ea445a3d","observation_id":"fa4af39c-dada-4701-bfa9-78b139a080aa","resolution":{"observed_at":"2026-08-07T11:03:01.815569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T11:03:01.817785Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.817785Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:f02eefc81faab67cb2395a4174d47ac80803d0a1db5b661a730c2a147f578311","observation_id":"ed255f1f-fd84-435a-8580-9eb8727f6062","resolution":{"observed_at":"2026-08-07T11:03:01.817785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.539457Z","title":"Action scene graphs for long-form understanding of egocentric videos","venue":null,"work_id":"8eb6957f-2ed3-477a-b510-24665e2ac30c","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.820214Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:282e738e49cd225d7091f86192ffab20ff6b7ed0eb314f6888f88e1df952eb74","observation_id":"81922796-4871-435b-9a34-03e8d7c49c91","resolution":{"observed_at":"2026-08-07T11:03:02.541814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.532518Z","title":"Fast point feature histograms (fpfh) for 3d registration","venue":null,"work_id":"95b1dfc8-b476-4c2c-8859-82a63dba7495","year":2009},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.823089Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d6aa674a06fae9748c91634181e0f60c60ee5fadcac1e10b23e2132d436d2b29","observation_id":"14504436-79ae-42d3-9260-94546030c3fc","resolution":{"observed_at":"2026-08-07T11:03:02.534947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.525275Z","title":"What object should i use? - task driven object detection","venue":null,"work_id":"0b26467e-313b-4006-b9c8-a4357366e73f","year":2019},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.825425Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5c4b30286e0817d53ba442ca9243f47f8d9bfa104aa50a88a3928c235307b8d7","observation_id":"ade2407b-596b-4b88-8b2d-c95a416708f2","resolution":{"observed_at":"2026-08-07T11:03:02.527767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.518179Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"b447459b-788e-432b-8662-537f14f016d8","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.827561Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:bd11360b5ef716473a64d6617adccb623cae729176eb34fafa5f955ffbb7a3dd","observation_id":"1ea84205-78c7-42aa-a7b9-ebb01551aaca","resolution":{"observed_at":"2026-08-07T11:03:02.520789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.511365Z","title":null,"venue":null,"work_id":"ea792782-4d97-4004-9af7-669f3b1d449a","year":2020},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.829880Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:24cee0d62d7b07ec113dcb0e749dbfda4cdf594abbf3b1305f32e8f8d2d54291","observation_id":"02e18a5e-1626-432f-9be8-acb4e358afcc","resolution":{"observed_at":"2026-08-07T11:03:02.513616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.504347Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities","venue":null,"work_id":"b8cd3c9b-fd1c-4b1b-8c16-9c8af29a74ce","year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.832360Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:de4e77bebe9a5cc707878f67d724c55c89ebaec5620c1a35d567f250800cea1c","observation_id":"03be063f-c5ca-4042-9db8-e65b21cf0d39","resolution":{"observed_at":"2026-08-07T11:03:02.506891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.497583Z","title":"Onepose: One-shot object pose estimation without cad models","venue":null,"work_id":"d1464a46-bc9c-4e58-9b74-8b968d37c081","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.834662Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9f2c2a90a4458c6b1eaa914526fd2c2330c899ba8b08a2dc7176d8b51cec21f5","observation_id":"d5f21668-f04e-48dd-a9d6-ae5ca92bef9b","resolution":{"observed_at":"2026-08-07T11:03:02.499917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.490938Z","title":null,"venue":null,"work_id":"05d89b9d-000b-4222-9bec-7a337272b2ec","year":2015},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.836944Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:24d46c25adadeeb81f7d9e6209f9127c3bb416cf67c79ef911ed4456113b4300","observation_id":"fba8b8e1-790e-440e-895c-388bb1383650","resolution":{"observed_at":"2026-08-07T11:03:02.493194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01413","last_updated":"2024-05-02T16:04:30Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:04:30Z","title":"MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01413","snapshot_observed_at":"2026-08-07T11:03:01.839325Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.839325Z"},"links":{"cited_paper":"/paper/2405.01413","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9e428a6a25264d41a51ba820d848572d2a212acc40a9bebe6bbc6d296cec8bdd","observation_id":"57486b92-00fb-424a-868f-721d11782568","resolution":{"observed_at":"2026-08-07T11:03:01.839325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.484125Z","title":"Leveraging next-active ob- jects for context-aware anticipation in egocentric videos","venue":null,"work_id":"0aaf2f50-2e38-4bcf-b27e-6cce47d00a62","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.841611Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:c60af926eaa2708fcba593747eb810780f785b0703ff7f1b5f645158542b572d","observation_id":"d8c0f507-059b-4f64-a679-6558183364cf","resolution":{"observed_at":"2026-08-07T11:03:02.486631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:03:01.843780Z","title":"Llama: Open and efficient foundation language mod- els.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.843780Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:ce34e09439d6206e2cf42dcccfeac1471cd0c28ecbcafcd2ed3b5922ed4edfb1","observation_id":"ad808590-b6e7-45c3-bb81-048eb365dfbf","resolution":{"observed_at":"2026-08-07T11:03:01.843780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.477134Z","title":"Epic fields: Marrying 3d geometry and video un- derstanding","venue":null,"work_id":"55ed968f-7013-4634-879c-20ad35e2e9dc","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.845967Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:78f4780f11c1dc879d0c141acfca1eb82f0073bf24cde58b1862448d61b1c4e6","observation_id":"4e70f3ce-e83f-4137-9b97-2d60b237b59d","resolution":{"observed_at":"2026-08-07T11:03:02.479483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.469960Z","title":"Attention is all you need","venue":null,"work_id":"104d1724-8603-4756-b8cc-1b8ed88e76c5","year":2017},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.848178Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:ccd177a391005aec32c3e5e7e3c0ac5135fccfbcf4a4f79c99f7b3aa54fc9f8f","observation_id":"dfc00f89-07c2-4bea-8149-091d1f37e093","resolution":{"observed_at":"2026-08-07T11:03:02.472614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.462945Z","title":"Omnivid: A gener- ative framework for universal video understanding","venue":null,"work_id":"aaf85137-00d6-4315-bf4f-e04f13f95b74","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.850456Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:d3b95f9facda68534e9cdd8a47cd35b93f7bda9eba30e6323612b75b16a964b2","observation_id":"765a3edd-8ca3-45de-94f2-35cdd54d589b","resolution":{"observed_at":"2026-08-07T11:03:02.465495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.456021Z","title":"OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"6a8b1d7e-3e34-4b6e-9d50-7551028e1fe9","year":2022},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.852711Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:f5db7579afe95961c6851491dc6dc587f6c5c6d68089813538dec1fe15cc0ca1","observation_id":"e873cb05-ef21-4921-9033-1513b53c6e49","resolution":{"observed_at":"2026-08-07T11:03:02.458516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.449136Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"d42263ce-cdbd-492e-a977-847533285e29","year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.854962Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:be0e11a5d242940d95ef3e40a90fe3056b96e1331f3cc1c61becf416104661ca","observation_id":"ed3fb1cf-8abe-4e6b-951d-0cf6523a988b","resolution":{"observed_at":"2026-08-07T11:03:02.451591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.442237Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world","venue":null,"work_id":"721826c2-d99a-40c2-91fb-880eb50debf2","year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.857232Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9f0be2815211ff77a6b773b8106cf978c6e5943367653eec2605d3bd874abf56","observation_id":"ad6ba276-8925-4a1c-820e-bd952f9dd376","resolution":{"observed_at":"2026-08-07T11:03:02.444616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.435281Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"ae5ead3f-6dd6-4850-ba4b-ba26912b95b5","year":null},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.859550Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:ec6fe067755a12c8459c833ef7c99b85a8fcb8d6fff0043d442eb694f1e6ff6c","observation_id":"f21af856-db0f-4b4f-8b68-447966d98669","resolution":{"observed_at":"2026-08-07T11:03:02.437955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.428265Z","title":"Learning descriptors for object recognition and 3d pose estimation","venue":null,"work_id":"9c4ecb4a-716f-4daf-ac0d-e3c261c2b3cd","year":2015},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.861969Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:9522020216a4aa2223e76db6b389bff6101a15aa564c6c50a5f81563484753ce","observation_id":"d361858b-5ecf-4bad-b00d-82f773432897","resolution":{"observed_at":"2026-08-07T11:03:02.430859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.421540Z","title":"Spatialtracker: Tracking any 2d pixels in 3d space","venue":null,"work_id":"fbe98834-67bc-4492-9c94-7d5ad44162f1","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.864022Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:2d0cfccd43212265deafbc1d2e57bdbe26b99d6752e2b72aaed0749b7e032c58","observation_id":"9ec32dc1-f846-42df-8dda-4e1cd383b105","resolution":{"observed_at":"2026-08-07T11:03:02.423930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-07T11:03:01.866129Z","title":"Pointllm: Empowering large language models to understand point clouds.arXiv preprint arXiv:2308.16911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.866129Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:503eee424c58b819717a6a1bf5cd4bbcb0f6b9d53f16e6d134d511706b6590a9","observation_id":"31f97f64-9b56-4d71-aa35-d99cc0f5a528","resolution":{"observed_at":"2026-08-07T11:03:01.866129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.414580Z","title":"Ulip- 2: Towards scalable multimodal pre-training for 3d under- standing","venue":null,"work_id":"e995247d-3ab2-4bec-a9a4-befd58b4e0ea","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.868766Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:e35901a15e8a8c3b49ce36b3d6fbb094a2eb6d1ba2583e7b874e82dfab32b6c3","observation_id":"00399a2c-a072-43b7-a435-f32a7499ca06","resolution":{"observed_at":"2026-08-07T11:03:02.417177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:02.407233Z","title":"Active object detection with knowledge aggregation and distillation from large models","venue":null,"work_id":"72e0a01e-1906-459d-b83c-830539f722a5","year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.871012Z"},"links":{"citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:5a0be23909616d657e48170d08c40afeeb11f0fd307c952ae2da7014c8aeb6c6","observation_id":"d6fc5a06-7719-4580-ab73-e4b6970ab3ac","resolution":{"observed_at":"2026-08-07T11:03:02.410018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10891","last_updated":"2024-04-07T06:52:21Z","snapshot_observed_at":"2026-08-01T22:50:12.319180Z","submitted_at":"2024-01-19T18:59:52Z","title":"Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10891","snapshot_observed_at":"2026-08-07T11:03:01.873084Z","title":"Depth anything: Un- leashing the power of large-scale unlabeled data.arXiv preprint arXiv:2401.10891, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:01.873084Z"},"links":{"cited_paper":"/paper/2401.10891","citing_paper":"/paper/2506.03605"},"observation_digest":"sha256:3249e60ba291614adb8fbe0e8c0d89f56f450979a43bfc7d4195d38ee992d2ee","observation_id":"6732de36-5603-4a24-8591-10bd181f752a","resolution":{"observed_at":"2026-08-07T11:03:01.873084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 1 inbound Pith citation observation for arXiv:2506.03605."}