{"as_of":"2026-08-06T20:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:248c1d714f88322a7e061c5115bdd2f45837994cc44db6419068045ef81ea4e3","coverage":[{"denominator":292,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:23:00.584697Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28394/citation-record","integrity":"/paper/2607.28394/integrity","json":"/paper/2607.28394/citation-record.json","paper":"/paper/2607.28394"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.259716Z","title":"H+O: unified egocentric recognition of 3D hand- object poses and interactions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.259716Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:ddc83c6839177fbda004e45b75a0b4769228234bd5bd08b225c495ecf3008d83","observation_id":"f7cea9cb-6441-470d-8356-7e935847abf1","resolution":{"observed_at":"2026-08-04T01:22:50.259716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.331314Z","title":"Learning joint reconstruction of hands and manipulated objects","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.331314Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:29b1da7fffc7614ac0d40150a9366e065723a1ef48cf7c550a02f78aae6649d0","observation_id":"1656f976-f0c4-418b-af6a-4f852044a54e","resolution":{"observed_at":"2026-08-04T01:22:50.331314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.481685Z","title":"CPF: Learning a contact potential field to model the hand-object interaction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.481685Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:6d1ffe024e116a7d51715c1a01180dd0b2199e3e2db66be1051af42d1b036dd4","observation_id":"15a136d9-29f3-4149-bbbb-9e631fa82993","resolution":{"observed_at":"2026-08-04T01:22:50.481685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.643954Z","title":"HOLD: Category-agnostic 3D re- construction of interacting hands and objects from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.643954Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:1f96a0e751bd17a76371ef1386c3df8460e5689b466eb949c8a225b8bdcde072","observation_id":"10336c0f-894e-4a82-8d38-9278e69614dc","resolution":{"observed_at":"2026-08-04T01:22:50.643954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.760793Z","title":"What’s in your hands? 3D reconstruction of generic objects in hands","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.760793Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:30fe9c9e545cb7b751ff7f8ccbc736546c46ae30b242ad3824a7d1b1f2cf1948","observation_id":"68ab55e6-ef54-4d34-b222-2f894cec3eee","resolution":{"observed_at":"2026-08-04T01:22:50.760793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.866783Z","title":"Grasping field: Learning implicit representations for human grasps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.866783Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:ac6a1fdcda2d0aec4f3210a6ff0bd1332ec0e89f0ef7159884b10d84788d5b53","observation_id":"baefb069-a7dd-4945-82d9-feee9b689148","resolution":{"observed_at":"2026-08-04T01:22:50.866783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:50.973965Z","title":"DUSt3R: Geomet- ric 3D vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:50.973965Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:8a71fbc624ab58798a24b6fc3d6e39834b105adc26cca7b01a70c3e1745ee4bb","observation_id":"e73c3643-a888-4041-bc18-926074e8ddc4","resolution":{"observed_at":"2026-08-04T01:22:50.973965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.111521Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.111521Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:f42a08bed2f8f45900d780438c986512562bdd6febd2353e051b19fe5891e630","observation_id":"ceedb3f9-e95b-49da-9509-ce84664565b1","resolution":{"observed_at":"2026-08-04T01:22:51.111521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.250781Z","title":"S2contact: Graph-based network for 3D hand-object contact estimation with semi-supervised learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.250781Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:3f013da2d09d38de2ca291e813686c6f7b1547222ba6ff43363276fdd47dcd56","observation_id":"669b0289-8c6d-4dcb-b19a-4dfbc97452bf","resolution":{"observed_at":"2026-08-04T01:22:51.250781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.366692Z","title":"Contactopt: Optimizing contact to improve grasps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.366692Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:e19fb96f29a2eef325ca4e6b78f36e7da875d6e0243dfc102cd403e20cd25d40","observation_id":"d359d8c2-7073-4afe-8606-62a474eb75b9","resolution":{"observed_at":"2026-08-04T01:22:51.366692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.469114Z","title":"Deep- SimHO: Stable pose estimation for hand-object in- teraction via physics simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.469114Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:f8a9a03a9628e274a37516a8eccd4b587caafcbae586b02b6a9c335ac1782fff","observation_id":"7ee4e721-75dd-490c-954a-dc78d07e48f3","resolution":{"observed_at":"2026-08-04T01:22:51.469114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.586685Z","title":"D- grasp: Physically plausible dynamic grasp synthesis for hand-object interactions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.586685Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:1a6fdf4a061632534572e3055e5edbcc4f780b0b9ab8b77051301af566560cfe","observation_id":"fd99bf28-1a3d-43ac-b792-1659f27533f6","resolution":{"observed_at":"2026-08-04T01:22:51.586685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.670545Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.670545Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a0597ab6a1d7fa4121a9cc8a349d18319f485b836cce2af9c8a898651894e7d8","observation_id":"a775507a-e363-4f31-9c32-27b7e526de80","resolution":{"observed_at":"2026-08-04T01:22:51.670545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.833259Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.833259Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:56855e557f4c9d874969b715984064a0446bc721bae66bacbe116ced4e0593b9","observation_id":"49c0ef7a-7330-401e-aea9-4fd378698d04","resolution":{"observed_at":"2026-08-04T01:22:51.833259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:51.943958Z","title":"SemGrasp: Semantic grasp generation via language aligned discretization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:51.943958Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:d3093048e8e594b8808cf802cad622a19869b0ef6be72fc675b04e3c551efc50","observation_id":"bc1d0192-f3d1-4f68-b9ad-12077fcc2b71","resolution":{"observed_at":"2026-08-04T01:22:51.943958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.054470Z","title":"Text2grasp: Synthesis of grasps by text prompts for object grasping parts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.054470Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:4fed8d6c0cdab05d5bfe0083702e82714b002d2e90152320a23f03b2a0722fd5","observation_id":"bd267cb5-c66a-4268-81f3-3063f770d418","resolution":{"observed_at":"2026-08-04T01:22:52.054470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.128899Z","title":"Towards unconstrained joint hand-object re- construction from RGB videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.128899Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:9c313aa21d541221f51e65423adc6d2b7ab0e37e3ed6b132be4eb61d0aa7e27a","observation_id":"5392c68c-f7ab-438b-91ef-50ee877fc809","resolution":{"observed_at":"2026-08-04T01:22:52.128899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12929","last_updated":"2026-04-14T16:19:12Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T16:19:12Z","title":"Grasp in Gaussians: Fast Monocular Reconstruction of Dynamic Hand-Object Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12929","snapshot_observed_at":"2026-08-04T01:22:52.168978Z","title":"Grasp in gaussians: Fast monocular recon- struction of dynamic hand-object interactions.arXiv preprint arXiv:2604.12929, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.168978Z"},"links":{"cited_paper":"/paper/2604.12929","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:883e1b34f05c8a8c3227449ea811ac3e46ad9eddf7bb0cd8403fb7ea21d76a8e","observation_id":"49a69e49-5258-43d4-977b-6efbbe707a0e","resolution":{"observed_at":"2026-08-04T01:22:52.168978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.227820Z","title":"EasyHOI: Unleashing the power of large models for reconstructing hand-object inter- actions in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.227820Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:5920c4a62d6bce83a6b82f74ef89770586d4ee25229bddbf9ff098130d3075f0","observation_id":"67662a34-b970-4af9-bf29-c572bdafffcb","resolution":{"observed_at":"2026-08-04T01:22:52.227820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.269110Z","title":"MagicHOI: Leveraging 3D priors for accurate hand-object recon- struction from short monocular video clips","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.269110Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:d99c0cf56e31dffd1d6f0637090d66c81f85c0cf91832c376718707aa36849f4","observation_id":"edc6d170-0c03-45e7-b9e9-a0e72c908e4e","resolution":{"observed_at":"2026-08-04T01:22:52.269110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.336305Z","title":"Diffusion-guided reconstruction of everyday hand-object interaction clips","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.336305Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:f9d4f9a52564caaa2ee8cdb29ec999c8c911fda080e1dc48fc3e4a64127c0d89","observation_id":"02e5420f-2df5-4e0f-9e84-c1e3c713a622","resolution":{"observed_at":"2026-08-04T01:22:52.336305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.489158Z","title":"Hand-object interaction image gen- eration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.489158Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:979ed9a6dfbbd451c3acf471e6c3ddccb162d9ee09ef3fa5931ea144a7ebf458","observation_id":"44523c5c-c390-4adf-aff2-ceab3fa72193","resolution":{"observed_at":"2026-08-04T01:22:52.489158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.593069Z","title":"HOIDiffusion: Generating realistic 3D hand-object interaction data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.593069Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:86045200eb29be9cc3fb3e0e47aef3af4f307f0babf559b36ee0eaf65ed3cdba","observation_id":"55a1344e-8fbe-47fe-9c9b-aa268564a202","resolution":{"observed_at":"2026-08-04T01:22:52.593069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.733933Z","title":"Svimo: Synchro- nized diffusion for video and motion generation in hand-object interaction scenarios","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.733933Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:bcaa56c6f6b6316768c695b3572ba37d60417ac5e613db31cbfa0b9133ec1d78","observation_id":"6547de2f-756d-41fd-b3a8-1cc63c8ba598","resolution":{"observed_at":"2026-08-04T01:22:52.733933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-04T01:22:52.858333Z","title":"Instantmesh: Efficient 3D mesh generation from a single image with sparse- view large reconstruction models.arXiv preprint arXiv:2404.07191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.858333Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a7442c544019d957ea2fcfeb79ff7abdcf5573debcd31dc004ec1996e82188ca","observation_id":"b5d510ad-6410-4c1c-bee5-000df9e1415d","resolution":{"observed_at":"2026-08-04T01:22:52.858333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:52.991212Z","title":"OpenShape: Scaling up 3D shape representation towards open-world understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:52.991212Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:7d81256d147f55ee9de806e4fd8afaf8eb50d3df16baaf17b8435b5254ff2adb","observation_id":"efe5c1bf-e573-4943-9e5d-b61652bb315f","resolution":{"observed_at":"2026-08-04T01:22:52.991212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.080773Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.080773Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:179dd920deeab4992b3a719aa32915f8e7cd8b18b34a8c2a79a00e25b3f01a53","observation_id":"de0112fe-c6cf-4423-a4d1-ea34032efe72","resolution":{"observed_at":"2026-08-04T01:22:53.080773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T01:22:53.145316Z","title":"Qwen-VL: A versatile vision-language model for understanding, localiza- tion, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.145316Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:ce0d8c6dab0e383e064934b35618997737efcd547d4abba13f02ec87f286328b","observation_id":"bf8b8f8d-04aa-4149-87d2-d49ae875f000","resolution":{"observed_at":"2026-08-04T01:22:53.145316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T01:22:53.148002Z","title":"DINOv2: Learning robust vi- sual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.148002Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:551e8605208dad8775bcf9c21d4cc7e2a4b8079083c501d030539163d4c6399e","observation_id":"72a30f91-41a6-4ec2-96b3-951ffa339e68","resolution":{"observed_at":"2026-08-04T01:22:53.148002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.153025Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.153025Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b4f175a89c2118bb5733e88a904e246a8f74a6607e95760b03bcc29adf2468c2","observation_id":"e14bf65b-79dc-4fd8-bd21-1c19f83a7679","resolution":{"observed_at":"2026-08-04T01:22:53.153025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.179643Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.179643Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:16a7dd29ac11deec1c704a42f1b8a75500f83217a724054e837ac763c01572c0","observation_id":"607bacce-d41a-4d83-8fa9-372cbf557282","resolution":{"observed_at":"2026-08-04T01:22:53.179643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.245010Z","title":"Objaverse: A universe of annotated 3D objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.245010Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:1ba365946d6c18e9cafac08018b29fc1e5b7f174f23fa9bffbc2d521146210b4","observation_id":"a3c47d1d-d103-4b8c-bea5-0c093ae152e6","resolution":{"observed_at":"2026-08-04T01:22:53.245010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.369956Z","title":"Learning trans- ferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.369956Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:3d1d3b553fa83cb4ebf25168fe98ac8760031c373dd7322bf482147d76362d69","observation_id":"d9dc253c-591e-459e-bd57-df6a87022514","resolution":{"observed_at":"2026-08-04T01:22:53.369956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.422787Z","title":"Reconstructing hand-held objects in 3D from images and videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.422787Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:84d428977b3aaad78f8259e12b79580edf0eed1f1f0815786680de5e7227e5ea","observation_id":"06e6b740-f7d8-4d0e-b262-518fbb41bbb9","resolution":{"observed_at":"2026-08-04T01:22:53.422787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.554948Z","title":"Ghost: Fast category- agnostic hand-object interaction reconstruction from RGB videos using gaussian splatting","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.554948Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:298ed5a1357b9024d141206e55e3abeaf765375aeeda25569a6ce622dc383f84","observation_id":"1144318d-f582-405f-a0cb-40a46d47c8c9","resolution":{"observed_at":"2026-08-04T01:22:53.554948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.735030Z","title":"Hand-held object reconstruction from RGB video with dynamic interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.735030Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:190a62f0a8b40df539cab4ecaa1ed9b2013ded785c7a5c50e9677487e1fbdf72","observation_id":"1f07f9fb-0352-40dc-a72e-b139676fbf78","resolution":{"observed_at":"2026-08-04T01:22:53.735030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.871135Z","title":"Reconstructing hands in 3D with transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.871135Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:43edd3778fb17d8c787da33a50fca0df7d0731e434c5a3bdbf66f22d67d3c85b","observation_id":"7a653988-abb3-4584-96ee-0fac482e7167","resolution":{"observed_at":"2026-08-04T01:22:53.871135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:53.987772Z","title":"Wilor: End- to-end 3D hand localization and reconstruction in-the- wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:53.987772Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a10cda0e11fb19f6f34352244c6df7969bc2c7dbcaac411539ea4ebb5bb325c9","observation_id":"2b6ffc2f-bd72-44f1-abed-d89a2b70431c","resolution":{"observed_at":"2026-08-04T01:22:53.987772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.110270Z","title":"ViTPose: Simple vision transformer baselines for human pose estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.110270Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b21f67c6a02040c2bd3469516fc0c617e631730198de2164d341aaf60e8e9b26","observation_id":"118a3762-d292-4c17-9932-914714049e27","resolution":{"observed_at":"2026-08-04T01:22:54.110270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.203234Z","title":"Latent action pretraining from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.203234Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:946d45078d3c514f2df3477f1e4d5796e0a51717afdf19df99664729da3d9925","observation_id":"f86aeee3-64bf-4f7c-8995-09790e729185","resolution":{"observed_at":"2026-08-04T01:22:54.203234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-04T01:22:54.356838Z","title":"Egovla: Learning vision-language-action models from egocentric hu- man videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.356838Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:0d66ea054ae7f40a5108738cb4dbce53e11d88f262afc1b63d9194d3d7cf715a","observation_id":"0726349b-97cf-43ef-854b-8890bac421c7","resolution":{"observed_at":"2026-08-04T01:22:54.356838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.482233Z","title":"Dexmv: Imitation learning for dexterous manipula- tion from human videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.482233Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:6560e84d8972d77abfdd106b2375c95d9ffbaa671c13805838f2d5b21fe85db4","observation_id":"6cc8f5d6-0944-4c31-b7b0-283b7df0c085","resolution":{"observed_at":"2026-08-04T01:22:54.482233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12604","last_updated":"2026-06-10T19:01:40Z","snapshot_observed_at":"2026-08-05T03:29:41.720044Z","submitted_at":"2026-06-10T19:01:40Z","title":"EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12604","snapshot_observed_at":"2026-08-04T01:22:54.554263Z","title":"Egoengine: From ego- centric human videos to high-fidelity dexterous robot demonstrations.arXiv preprint arXiv:2606.12604, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.554263Z"},"links":{"cited_paper":"/paper/2606.12604","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:be4beb79a0936d97f40b4c5593eb3b416542459108466b78c552952f649180ff","observation_id":"99d516c3-50f9-4900-b4cc-fa608ee1563f","resolution":{"observed_at":"2026-08-04T01:22:54.554263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.642312Z","title":"Efficient annotation and learning for 3D hand pose estimation: A survey.Int","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.642312Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:47196d4fd18f3d6cdc7b86102c7d5c74c5cb7d611e63c8093581327630e6faee","observation_id":"aa4dd80e-87eb-48fd-ac4c-519aa3aacde0","resolution":{"observed_at":"2026-08-04T01:22:54.642312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.728942Z","title":"A survey of deep learning methods and datasets for hand pose estimation from hand-object interaction images.Comput","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.728942Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:fad7bab5eb15a086ec3d20e295a73ae86ac489a695f24655f70f70e456fcf6a2","observation_id":"a8405292-e84a-47fc-9aab-728dd4c36836","resolution":{"observed_at":"2026-08-04T01:22:54.728942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.827206Z","title":"Advances in vision-based deep learning methods for interacting hands reconstruction: A survey.Comput","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.827206Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:1865190c3ce0bd4e975b38d5c2b970ef983ca1848f2f61d099cad47256317cc3","observation_id":"406d7d25-e1c6-4426-88be-f7c6d51c99cd","resolution":{"observed_at":"2026-08-04T01:22:54.827206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:54.952358Z","title":"An overview of learning-based dexterous grasping: recent advances and future directions.Artif","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.952358Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b4fd3fd6bd32be503452d76b093ab6ab9e9d2011dc548909d7af4dea93102915","observation_id":"2351fc51-c878-45bb-bc0f-b1dfa6616d18","resolution":{"observed_at":"2026-08-04T01:22:54.952358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.074039Z","title":"Arthoi: Taming foundation models for monocular 4D reconstruction of hand-articulated- object interactions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.074039Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:76239662df6aaa04e29c34d5943b2cc949999a93d25ab6d9135f28ff375dc664","observation_id":"0a22e084-5de6-4fe7-89e0-4eee0010e1b2","resolution":{"observed_at":"2026-08-04T01:22:55.074039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.146492Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.146492Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:87dcb6b2aa73711aca2ed862d7ca51f7a10586c130f481fcf6aba6994541f94e","observation_id":"9eb4f6b0-85d4-4a5e-8e4f-4ee3f0950095","resolution":{"observed_at":"2026-08-04T01:22:55.146492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.265194Z","title":"Nimble: a non-rigid hand model with bones and muscles.ACM Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.265194Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:87f59cf22f0091e9b94ac9ba4ada46d9235e6fc545fd3b3da235b31df654baa9","observation_id":"42107617-8483-4a64-9de3-8da8de6f0c4b","resolution":{"observed_at":"2026-08-04T01:22:55.265194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.425020Z","title":"HOnnotate: A method for 3D an- notation of hand and object poses","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.425020Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:4f1d5d393a24e2715d1106ef787ada619c7dc66017cb4166c9fb69b48719c5c6","observation_id":"1b1bfeb5-689c-4a47-8856-c6b3902f5d2f","resolution":{"observed_at":"2026-08-04T01:22:55.425020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.572571Z","title":"AlignSDF: Pose-aligned signed distance fields for hand-object reconstruction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.572571Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:6c0ff64cfd8422f662805a342d4170a24701b1ec2f29d6bc8377e743dbbc6136","observation_id":"f71c8eb6-3635-43e8-b4a7-fdd08247b964","resolution":{"observed_at":"2026-08-04T01:22:55.572571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.672170Z","title":"HandNeRF: Learn- ing to reconstruct hand-object interaction scene from a single RGB image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.672170Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:bfb0e5526c5dc6aea23575cad2fbf712f3c21e2262635ca14f47d9da4f575101","observation_id":"d35d45c3-63ff-4e2b-be63-0c836fdc124f","resolution":{"observed_at":"2026-08-04T01:22:55.672170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.802465Z","title":"Simultaneous localization and mapping: part i.IEEE Robot","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.802465Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:206d694e33ada0f513bae925d1e1fc29564716ff3a8ed99a5228c163249b4512","observation_id":"8db8f041-be2b-4164-90bb-d88343e18cf0","resolution":{"observed_at":"2026-08-04T01:22:55.802465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:55.913093Z","title":"Seitz, and Richard Szeliski","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:55.913093Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:557b816059a913a5ebac550de8321a920da56f657b808066656f9736f810ee9c","observation_id":"e0acbb35-f23a-44ed-9efb-9d1eb51526c9","resolution":{"observed_at":"2026-08-04T01:22:55.913093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.075182Z","title":"LatentHOI: On the generalizable hand object motion generation with latent hand diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.075182Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:ff4b8e301c4e5b856ba0ce719952fafb96ee8ad7624a4173e2bbbf00f7d16e22","observation_id":"cde77d81-015c-4ac4-9bd5-9477a66959fb","resolution":{"observed_at":"2026-08-04T01:22:56.075182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.210436Z","title":"3D hand pose estimation in everyday egocentric images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.210436Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:9624397b354c32e999f0f94580624d712426b65f97db1ad0ee915f610d95e81e","observation_id":"c1aea375-1c59-496a-9e02-81394cc36685","resolution":{"observed_at":"2026-08-04T01:22:56.210436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.297514Z","title":"DDF-HO: Hand-held object recon- struction via conditional directed distance field","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.297514Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:93eda2351f032fe682e933f7a69479e7d0c7308e43d7a775defe16c952e118c9","observation_id":"f36d2540-d027-4187-95c0-879c7b4d2a95","resolution":{"observed_at":"2026-08-04T01:22:56.297514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.432429Z","title":"Ncrf: neural contact radiance fields for free-viewpoint rendering of hand-object interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.432429Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:7a1cf5824c31f4c78e56e6d45613b26438e5f591e0f837d49c0c70de94c02d78","observation_id":"7a03ccac-87af-4a9b-9a9a-c07077f00aa3","resolution":{"observed_at":"2026-08-04T01:22:56.432429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.576564Z","title":"Gan- hand: Predicting human grasp affordances in multi- object scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.576564Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:1d97b85faa58303b526554f6915c717cda49beaca4aa268f481360a724b71e41","observation_id":"01cc4753-1265-404d-a6dd-af820c5cec09","resolution":{"observed_at":"2026-08-04T01:22:56.576564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.657061Z","title":"Artigrasp: Physically plausible synthesis of bi-manual dexterous grasping and articulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.657061Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:e36d2058e8cc6f6af97210f1e14e1451c81109b880abf5029cbe6d3b455e712e","observation_id":"b88017eb-beee-4bb4-900c-ff9c7d76c0dc","resolution":{"observed_at":"2026-08-04T01:22:56.657061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.827709Z","title":"Deepsdf: Learning continuous signed distance functions for shape representation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.827709Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:4785c5b33375b3286fa9252798fd7196b96fb0e3aab48f1fbb66d933a75e5664","observation_id":"5ef33bdf-fb0d-4841-9818-8f4433acb01f","resolution":{"observed_at":"2026-08-04T01:22:56.827709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:56.936168Z","title":"A skeleton-driven neural occupancy representation for articulated hands","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:56.936168Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:4b8df16359ab834cd7422d85b9cdc9b3a85349c87678eeb0e9eb07de300cad24","observation_id":"c01a6e45-cf3a-430c-9710-83178f194d7c","resolution":{"observed_at":"2026-08-04T01:22:56.936168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.017313Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.017313Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:16c95955f07b9c0ad30e7570d77477907918aa3bbe0fb34fac3209468bfe684f","observation_id":"dd3bd7ac-a67c-46d8-8093-25c7285d5ff3","resolution":{"observed_at":"2026-08-04T01:22:57.017313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.109026Z","title":"3D gaussian splat- ting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.109026Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a0f1201948719c965e006809c46fd372e0b176adfa642e0c5cfe704fd791ec8f","observation_id":"0075480a-3acc-4fc6-9ac5-922ca8e9e29e","resolution":{"observed_at":"2026-08-04T01:22:57.109026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.190200Z","title":"Affordpose: A large-scale dataset of hand- object interactions with affordance-driven hand pose","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.190200Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:8c2aa18abd098bed646568ca3b9779030b450c64f4d575c101b6160af135399d","observation_id":"69d00b1f-ccec-442c-b01d-c09c0764152a","resolution":{"observed_at":"2026-08-04T01:22:57.190200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.287359Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.287359Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b6d6ba3130a2471b3c75d6f41d1dd214cbbaa28baa253e0cc1562ca84b81fb0b","observation_id":"198581df-a7aa-423c-ad90-280e65f71848","resolution":{"observed_at":"2026-08-04T01:22:57.287359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.396175Z","title":"Black, and Dima Damen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.396175Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:749bd216f5432d0798ee74288664b736e10c512efe8ad6a7f47d04fd1260d391","observation_id":"b9a5ac01-2b4d-4a1a-be34-ed4b42776a58","resolution":{"observed_at":"2026-08-04T01:22:57.396175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.520287Z","title":"HOI4D: A 4D egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.520287Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:ab7ad2b8f8c388073abe0b755bb143ca214b73f674d326d43f7f0b26a8517bef","observation_id":"114776fd-6dab-4776-b2fc-5ecaf72e1e7b","resolution":{"observed_at":"2026-08-04T01:22:57.520287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.624031Z","title":"Arctic: A dataset for dexterous bimanual hand-object manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.624031Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a53a7166a08ed3dd778644aa2370e4c569f83536cef84e24f54faf841f4c182a","observation_id":"913fbdb6-db28-49fd-8652-45bbc3c265f9","resolution":{"observed_at":"2026-08-04T01:22:57.624031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.730835Z","title":"Handoccnet: Occlusion-robust 3D hand mesh estimation network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.730835Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b293ef0fd39905781e4d0b99054ea7e0be736221ef88d8b2d8e63a62fb22bb50","observation_id":"95c9706f-b27b-46f1-825e-565f5aecf388","resolution":{"observed_at":"2026-08-04T01:22:57.730835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.837367Z","title":"Mobrecon: Mobile-friendly hand mesh reconstruction from monocular image","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.837367Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:7799b4f16539bfb9139224b8370d18d5ebf3627bb9c52a6372f587458252581d","observation_id":"05a743c8-97a7-429d-90bc-03d9cfdfe025","resolution":{"observed_at":"2026-08-04T01:22:57.837367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:57.929227Z","title":"A simple baseline for ef- ficient hand mesh reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:57.929227Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:dbe3237b4ea2ae203c06c2de9e5f1684932943296b70dc26146d06c066b36037","observation_id":"06d93b26-98e1-4df1-b87c-e638c51fe649","resolution":{"observed_at":"2026-08-04T01:22:57.929227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.009125Z","title":"Model-based 3D hand reconstruction via self- supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.009125Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b283e140001192634be24cb4b961f995550a5e8b5bcd29afcd9e6145d158bc98","observation_id":"df4b27c9-ead8-4912-8e4f-dfa10e30da9c","resolution":{"observed_at":"2026-08-04T01:22:58.009125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.120732Z","title":"Keypoint fusion for RGB-D based 3D hand pose estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.120732Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:99bc963d4bc58eb3c8cabe12c787534735beec910ea384f50a9de9ccd235b53a","observation_id":"acc3005f-c938-4f5b-97b9-f712e852262c","resolution":{"observed_at":"2026-08-04T01:22:58.120732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.243383Z","title":"Hope-net: A graph-based model for hand-object pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.243383Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:85c6a42b9878e6e527a510af34fd93b91dbd759fecc48ef0e25df88bdd31642e","observation_id":"fc2e6c0c-7c98-4b87-8115-41ee7e2a7784","resolution":{"observed_at":"2026-08-04T01:22:58.243383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.302109Z","title":"Keypoint transformer: Solv- ing joint identification in challenging hands and ob- ject interactions for accurate 3D pose estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.302109Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a737145a8d8ebf13493b64d7bb1d34643041271ee4cb509ae8a5ab43a3475168","observation_id":"12227234-0bbb-4729-935c-0fe72c1fff63","resolution":{"observed_at":"2026-08-04T01:22:58.302109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.370098Z","title":"Thor-net: End-to-end graformer-based realistic two hands and object reconstruction with self-supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.370098Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:75c7eeb03f82c865178a5978c106d0dc8bdea90b15e7ee3e01b46ced567bec54","observation_id":"73325612-55ee-46d7-a039-8c031a9b2061","resolution":{"observed_at":"2026-08-04T01:22:58.370098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.456383Z","title":"HOISDF: Constraining 3D hand- object pose estimation with global signed distance fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.456383Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:602f14d6bbc64645fd85ab2933d5d56c7e137d9bea62da2b9741f4da04708a6d","observation_id":"07e9bd65-6d4f-41de-b8b1-614419f8e19f","resolution":{"observed_at":"2026-08-04T01:22:58.456383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.593019Z","title":"Contactart: Learning 3D interaction priors for category-level ar- ticulated object and hand poses estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.593019Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:c7c5f0a95655e61ab254685ef424b46b8b3550f7c168c2030b609f2a5013d44a","observation_id":"83fe54dd-178d-44df-a25f-a5725bc9ef8f","resolution":{"observed_at":"2026-08-04T01:22:58.593019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.663773Z","title":"gSDF: Geometry-driven signed dis- tance functions for 3D hand-object reconstruction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.663773Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:a4961fae76059d642fed67097089b2abea4f303d915ed4688063815ee5e20f02","observation_id":"a59716fd-69d4-48c8-b06e-69a98e4085b9","resolution":{"observed_at":"2026-08-04T01:22:58.663773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.825020Z","title":"Chord: Category-level hand-held object recon- struction via shape deformation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.825020Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:2fb581165fc3bda99a6ebd21ba51b7d88793de8e2fb0836560cb9693222b2416","observation_id":"e9d0fd2e-2eb7-47fd-a111-0b63f1eb8a8c","resolution":{"observed_at":"2026-08-04T01:22:58.825020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:58.915024Z","title":"Reconstructing hand-held objects from monoc- ular video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:58.915024Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:5a3f56f7c2a5149ae1a66abbb4dfd5fd3aed09c3df683d2993856544f15b5403","observation_id":"cc1f1df3-510d-411c-bbad-6f00e5af377d","resolution":{"observed_at":"2026-08-04T01:22:58.915024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.096950Z","title":"Moho: Learning single-view hand-held object reconstruction with multi-view occlusion-aware su- pervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.096950Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:06b4ee0536ba730c6d40e91e43d645327ab349d6587f91e338aa88d7031dd032","observation_id":"f8062cae-1a55-4fcc-8384-a57c50e3994f","resolution":{"observed_at":"2026-08-04T01:22:59.096950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.198056Z","title":"Texhoi: Reconstructing textures of 3D unknown ob- jects in monocular hand-object interaction scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.198056Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:7f04bf1a4faca78e5fe86209280351a1d79b948a90120f217f010a44708eaa9f","observation_id":"40a51ced-b621-4a4e-a969-b8801bd601ba","resolution":{"observed_at":"2026-08-04T01:22:59.198056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.263162Z","title":"SeqHAND: RGB-sequence-based 3D hand pose and shape estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.263162Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:9487dd9ec90656401703ac170eb65e66d5eb7806e2c8f75e119270de8ec6cbc0","observation_id":"1a4770e3-c88f-4eaa-9474-27f3f25803b4","resolution":{"observed_at":"2026-08-04T01:22:59.263162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.376653Z","title":"Dyn-hamr: Recovering 4D interacting hand motion from a dynamic camera","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.376653Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:164bc611801d881d07f3f711cdaeb19ebf26b4f524292a95c2a5265f8f3c8881","observation_id":"41d55699-7ca9-4229-b732-3f2f9654f79e","resolution":{"observed_at":"2026-08-04T01:22:59.376653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.525634Z","title":"Interactionfusion: real-time reconstruction of hand poses and deformable objects in hand-object interac- tions.ACM Trans","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.525634Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:36cf59a71f6b4b558375d1753882eb35e82e114e281972251962c9ec93608149","observation_id":"5e9be14e-aea6-46db-ba1e-be5736e76010","resolution":{"observed_at":"2026-08-04T01:22:59.525634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14540","last_updated":"2026-06-29T07:21:19Z","snapshot_observed_at":"2026-08-06T11:56:10.601984Z","submitted_at":"2025-11-18T14:44:04Z","title":"Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14540","snapshot_observed_at":"2026-08-04T01:22:59.626969Z","title":"Interaction-aware 4D gaussian splat- ting for dynamic hand-object interaction reconstruc- tion.arXiv preprint arXiv:2511.14540, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.626969Z"},"links":{"cited_paper":"/paper/2511.14540","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:c9c3b660140868727d372a6d131bb582c306bb101d0c7fc90bda74a5dd163634","observation_id":"f46de3a4-1499-407a-8d46-b76b7e602e5c","resolution":{"observed_at":"2026-08-04T01:22:59.626969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.756084Z","title":"Physics-aware hand-object interaction denoising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.756084Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:90ad3cda5886d883026951fa873fee775ae7259f80a52a51c0e26cb2129d36fb","observation_id":"445b0085-35ac-4bee-8d6f-d253c1468b99","resolution":{"observed_at":"2026-08-04T01:22:59.756084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.850958Z","title":"Grab: A dataset of whole-body hu- man grasping of objects","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.850958Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b9f7b6ceac3924baa28419495a7870e65c510edcf1218be05258910eff921563","observation_id":"420ebeb7-cead-4ed2-a23b-70b3b4344d8e","resolution":{"observed_at":"2026-08-04T01:22:59.850958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:22:59.982065Z","title":"Hand-object contact consistency reason- ing for human grasps generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:59.982065Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:2872dfca0f9e2b427f46364715b56aa165a9eed7cc0e64ef954148d680317d7b","observation_id":"ff625b7b-c50c-4038-a464-b59a39a064ea","resolution":{"observed_at":"2026-08-04T01:22:59.982065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.097845Z","title":"Contactgen: Generative contact modeling for grasp generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.097845Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:7a3d01bd376541d4b3dddba755161d8ca3e271813fa1b4846c9bc9b4239aef18","observation_id":"bc8b9779-32b3-4c41-a761-97cf4e6b3ab1","resolution":{"observed_at":"2026-08-04T01:23:00.097845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.217266Z","title":"Contact2grasp: 3D grasp synthesis via hand-object contact constraint","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.217266Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:4d966a46f1ba21fbca923e77650bdef5fc47a2fcd32a1cf61ad913db34bce15d","observation_id":"d8d66953-fa53-47cf-9474-e326f2e905bf","resolution":{"observed_at":"2026-08-04T01:23:00.217266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.276639Z","title":"G-hop: Generative hand-object prior for interaction reconstruction and grasp synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.276639Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:b33e42b45eb9e417a219ace4c6819acf481e1e60ff272e9f7bf40157c8e3931e","observation_id":"f08293ba-ab90-4ffe-abbd-e11a477dc7fd","resolution":{"observed_at":"2026-08-04T01:23:00.276639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.336558Z","title":"Clickdiff: click to induce semantic contact map for controllable grasp generation with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.336558Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:0b9a439a0324434d12dfeee632fb08e05433e5b21537827a9bba5fd842043481","observation_id":"69c01d6e-33ab-4b77-90d3-d26527f70546","resolution":{"observed_at":"2026-08-04T01:23:00.336558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.390765Z","title":"Fastgrasp: Efficient grasp synthesis with diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.390765Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:9f3f88fad654c92f4275110f29877879674fa61afbfa72e1aa418b083572462e","observation_id":"cdbaaaf4-cc3e-40ed-8cda-615b549703e9","resolution":{"observed_at":"2026-08-04T01:23:00.390765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.429073Z","title":"Text2HOI: Text-guided 3D motion gener- ation for hand-object interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.429073Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:c65bf5da2664b6843f2a1e64cd12977a19a0b433d3b9ed420ae64191127e6d7e","observation_id":"09941b13-6c01-4b3c-86a5-fd63442d2982","resolution":{"observed_at":"2026-08-04T01:23:00.429073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.511671Z","title":"Bimart: A unified approach for the synthesis of 3D bimanual in- teraction with articulated objects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.511671Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:37d76cf0ae5e6ef821ae6921891b754fd585eff4ed2bed5fe11c61f84ff561a8","observation_id":"68898c1c-7243-492c-ba06-9dfcea5b1430","resolution":{"observed_at":"2026-08-04T01:23:00.511671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:23:00.584697Z","title":"Manivideo: Generating hand-object ma- nipulation video with dexterous and generalizable grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:00.584697Z"},"links":{"citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:eed4bbd37094dc5d43a7fe3bd68bb781df3ad05c8055f1bb1612ea2a80da39f3","observation_id":"ba421b2d-f64f-4397-bcf5-2b9eef9635b7","resolution":{"observed_at":"2026-08-04T01:23:00.584697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:11:27.032299Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":292},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 292 outbound references and 0 inbound Pith citation observations for arXiv:2607.28394."}