{"as_of":"2026-08-20T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2cc95f0315d39b1765c9bfc420169f9c7b4348ee20e2ac01dd320c29ab18f276","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:25:27.472156Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:04:30.302310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:32:11.045924Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-08-07T15:04:30.302310Z","title":"Hand- sonvlm: Vision-language models for hand-object interaction prediction.arXiv preprint arXiv:2412.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16602","last_updated":"2025-05-22T12:37:47Z","snapshot_observed_at":"2026-08-09T23:20:33.885206Z","submitted_at":"2025-05-22T12:37:47Z","title":"MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:30.302310Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2505.16602"},"observation_digest":"sha256:06c4c6b671a6b9ac12250834876fd19e21ebd61d66d3979d47c7e8df0e6b3565","observation_id":"d3e68d82-77d7-40aa-8952-8f19c7507f26","resolution":{"observed_at":"2026-08-07T15:04:30.302310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":"2412.13187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Handsonvlm: Vision-language models for hand-object interaction prediction","venue":null,"work_id":"bbd33837-3e2d-4166-ba32-01c6815fa9a6","year":2024},"citing_paper":{"arxiv_id":"2511.12878","last_updated":"2026-05-11T01:22:42Z","snapshot_observed_at":"2026-08-10T21:40:24.450522Z","submitted_at":"2025-11-17T02:14:13Z","title":"Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T22:31:13.391859Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2511.12878"},"observation_digest":"sha256:c5f5dccac68546812dd8054b1e2cfa447759fb02dfae68a604edfd4c66492edd","observation_id":"8cea29c6-c471-4e35-83b3-4124dd3243cf","resolution":{"observed_at":"2026-05-17T22:32:11.048567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":"2412.13187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Handsonvlm: Vision-language models for hand-object interaction prediction","venue":null,"work_id":"bbd33837-3e2d-4166-ba32-01c6815fa9a6","year":2024},"citing_paper":{"arxiv_id":"2605.07642","last_updated":"2026-05-08T12:09:27Z","snapshot_observed_at":"2026-08-12T19:26:08.730613Z","submitted_at":"2026-05-08T12:09:27Z","title":"EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:17.739464Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2605.07642"},"observation_digest":"sha256:ee19e0c2b011b984755b55653bab6d00048bbad78ed25862fbd3533c5b0230c6","observation_id":"35dbf9cc-5449-4140-a493-34be081ab8b5","resolution":{"observed_at":"2026-05-11T03:50:57.582720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-08-01T21:08:06.701306Z","title":"Hand- sOnVLM: Vision-language models for hand-object interaction prediction.arXiv preprint arXiv:2412.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-13T20:06:13.102131Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.701306Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7e89c922e69f4100ad1577e7ea1291183c150265403238c191ab8dedaa48e8a9","observation_id":"89482c55-4d31-4fb9-8ee6-08a30eaafcdd","resolution":{"observed_at":"2026-08-01T21:08:06.701306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13187/citation-record","integrity":"/paper/2412.13187/integrity","json":"/paper/2412.13187/citation-record.json","paper":"/paper/2412.13187"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T13:25:27.315027Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.315027Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:ba41a05e51632e8d17cd748cac619e45d4906295ad33f3ea46cbef8e977d809a","observation_id":"0d3e6144-e524-4436-8027-aac64176c2e6","resolution":{"observed_at":"2026-08-11T13:25:27.315027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:28.195802Z","title":"Black, Danica Kragic, and Hedvig Kjellstr ¨om","venue":null,"work_id":"7cb0f7e5-91c3-4607-858a-b8d071eb1340","year":2017},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.347061Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:053a05e6d5c0346850239cf0e3368feecd5a68bd6a918033a892876d78ac4a41","observation_id":"6346ffee-166d-4ce6-ab59-9127fedfa295","resolution":{"observed_at":"2026-08-11T13:25:28.202850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:28.088081Z","title":"We also conduct an ablation study on the zero-shot chain-of-thought (Wei et al., 2022; Kojima et al.,","venue":null,"work_id":"bc3a512e-c671-4815-9628-8f615c24f0d7","year":2022},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.472156Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:d06ba53d30961094c25fe752a3f06b6679fd2fcce7475181de6cc78b89a6a7c2","observation_id":"9cce5b6c-6412-479e-9e93-5e5e52b30d7a","resolution":{"observed_at":"2026-08-11T13:25:28.096673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:28.171834Z","title":"Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Sanja Fidler, Antonino Furnari, Evangelos Kazakos, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, et al","venue":null,"work_id":"c44f464d-c720-413b-94ec-6421b800e6f8","year":2023},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.383823Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:7be944541620672c81a4efeb64858e070a895fa7905437a7c1906fee99bcc0ea","observation_id":"e7e6acfc-e4dd-421f-9f8b-6b9e7beb43ac","resolution":{"observed_at":"2026-08-11T13:25:28.180273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:28.146357Z","title":"Learning a hierarchy of discriminative space-time neigh- borhood features for human action recognition","venue":null,"work_id":"76420385-8e2e-4855-9c71-1b9981c6d279","year":2010},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.415090Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:1d0ff3f60aa3846e8568b6636fa2cc2b3d370006528f1c7e09b8d9198bfbc9e6","observation_id":"92c1b10a-8acc-4c17-9bce-f7faafe0f1b7","resolution":{"observed_at":"2026-08-11T13:25:28.154917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:28.114048Z","title":"Forecasting human-object interaction: joint prediction of motor attention and actions in first person video","venue":null,"work_id":"aee8b314-636e-42bd-a439-c32bcfc0e445","year":2020},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.425157Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:a6275267d592112939a9e9dcb6104fdcd051f708d0d28e9af7f4af9e0a19ba50","observation_id":"076257f0-de31-4348-a465-e026704f16b8","resolution":{"observed_at":"2026-08-11T13:25:28.122154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:27.431585Z","title":"Madiff: Motion-aware mamba diffusion models for hand trajectory prediction on egocentric videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.431585Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:d53dc5c3ee3b1c16f7825f4b5e55f954d4d4ad82052a8feb33e3eb7238b9b326","observation_id":"96832fac-19f8-44d5-bfb5-4f9399d95154","resolution":{"observed_at":"2026-08-11T13:25:27.431585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-11T13:25:27.438085Z","title":"R3m: A univer- sal visual representation for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.438085Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:b76e841b62bfce528ead0b394f0d42c1e80394f2ed04a32ff420f930940a4d21","observation_id":"ca1d9f18-2315-4fd7-abbe-e261016efe07","resolution":{"observed_at":"2026-08-11T13:25:27.438085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08324","last_updated":"2020-08-19T08:22:30Z","snapshot_observed_at":"2026-08-16T11:55:50.903205Z","submitted_at":"2020-08-19T08:22:30Z","title":"FrankMocap: Fast Monocular 3D Hand and Body Motion Capture by Regression and Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08324","snapshot_observed_at":"2026-08-11T13:25:27.444539Z","title":"Frankmocap: Fast monocular 3d hand and body motion capture by regression and integration","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.444539Z"},"links":{"cited_paper":"/paper/2008.08324","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:55d0fbc2bb27c10e5b7bb2b97112388e7b286bc8fdbd55acc6966a03c2c710b4","observation_id":"cfcc605b-ea90-4a26-8f5f-014e99cc8098","resolution":{"observed_at":"2026-08-11T13:25:27.444539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T13:25:27.450101Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.450101Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:2b687a60bbdb294fb68825acf6ded8ebaefa4e4edd03fbeafde365db50886beb","observation_id":"0535b06f-adc5-45a9-9480-c72ded5d9914","resolution":{"observed_at":"2026-08-11T13:25:27.450101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-16T14:31:04.236202Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-11T13:25:27.455904Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.455904Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:9ea3005df86bef0728fac6779d0c6d76631900a4914eab2cbde9584651a93000","observation_id":"1a71a723-d1f5-46f7-8e1c-f8af06a7f56f","resolution":{"observed_at":"2026-08-11T13:25:27.455904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-11T13:25:27.464809Z","title":"Navid: Video-based vlm plans the next step for vision-and- language navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.464809Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:572ddaea365dc23846d8e4fe2e8512b02749d1fb08e09b6bfed7d43451b65e74","observation_id":"f1de86b4-749c-4e62-aea8-a3a61477779d","resolution":{"observed_at":"2026-08-11T13:25:27.464809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-08-15T00:36:59.684390Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-11T13:25:27.330201Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.330201Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:a5f419bb95125ff9f72a8d0fd6d132bff5455ca84b4c6d0229d85ca1f4d5eea0","observation_id":"a89cbccd-29c9-442b-bd8e-955d67dff461","resolution":{"observed_at":"2026-08-11T13:25:27.330201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-08-16T17:54:48.921016Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-11T13:25:27.369987Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.369987Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:dc7277be32bbb5cdef733efb8f51c8cb345b2f557dfca901cc1067b3eb44fc9c","observation_id":"61021fcc-290b-4904-9116-01d79faf9edf","resolution":{"observed_at":"2026-08-11T13:25:27.369987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.173","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:27.533185Z","title":"Judith B¨utepage, Hedvig Kjellstr¨om, and Danica Kragic","venue":null,"work_id":"e959c05d-57e0-4dc0-af4c-9c4391c2e205","year":2017},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.354684Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:592435423e86bcac063eae17222f72c70e72e00bf5fd043c3aaa60055b197140","observation_id":"6a9f8887-2b0d-4364-9118-47c4967f1d40","resolution":{"observed_at":"2026-08-11T13:25:27.544923Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:25:27.361665Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.361665Z"},"links":{"citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:0da0b7c63c41beee83a40a6d0722e7834a9fbcbacfa29033ae99e3020aa17e32","observation_id":"dfde9f0b-b4d6-455d-9079-bf0a30581932","resolution":{"observed_at":"2026-08-11T13:25:27.361665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-20T04:16:24.157003Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-11T13:25:27.399478Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.399478Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:418d13e291e49207116259c5d413a6dbc16103e2802272a96f1d415dcb4d9c4d","observation_id":"60e9aecc-25c2-475e-84be-71171ad4ec03","resolution":{"observed_at":"2026-08-11T13:25:27.399478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-11T13:25:27.377004Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.377004Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:a78da3150ed662390bc15c7a8c367b530d2fb0135fd6ea5c9b626ddac28cada0","observation_id":"621224e9-6890-40f9-94c7-cf596e8ae6f8","resolution":{"observed_at":"2026-08-11T13:25:27.377004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11972","last_updated":"2024-04-04T16:41:22Z","snapshot_observed_at":"2026-08-20T08:56:42.229468Z","submitted_at":"2023-12-19T09:09:46Z","title":"Expressive Forecasting of 3D Whole-body Human Motions","version":2},"cited_work":{"arxiv_id":"2312.11972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11972","snapshot_observed_at":"2026-08-11T13:25:27.863095Z","title":"Expressive Forecasting of 3D Whole-body Human Motions","venue":"cs.CV","work_id":"a808c720-f767-4d07-a04f-46f0a5a6c6ee","year":2023},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.390474Z"},"links":{"cited_paper":"/paper/2312.11972","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:9d5393884ecc60384a31c685002f61d64ab5cb6c5cf4ed09774ab831bdabab88","observation_id":"2e7e6801-9363-4d16-9c09-aa326ae7d8b2","resolution":{"observed_at":"2026-08-11T13:25:27.875796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08243","last_updated":"2023-09-17T02:40:01Z","snapshot_observed_at":"2026-08-16T15:15:48.662265Z","submitted_at":"2023-07-17T04:55:02Z","title":"Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory Forecasting","version":2},"cited_work":{"arxiv_id":"2307.08243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.08243","snapshot_observed_at":"2026-08-11T13:25:28.033369Z","title":"Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory Forecasting","venue":"cs.CV","work_id":"1f805d0c-11c3-41ad-ace5-80b7c8f6016d","year":2023},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.322124Z"},"links":{"cited_paper":"/paper/2307.08243","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:37965c64f397a10b22ab7f9985aa27a04418aad0a2a1853e8e0241e40a2c49de","observation_id":"6413f722-0f89-42c6-98a4-9dc500c3ce26","resolution":{"observed_at":"2026-08-11T13:25:28.040507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T13:25:27.407545Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.407545Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:9d85e1afcecdabe0652c534b81de0cb2e09ea434e558f580fb67ed5d0409e0ff","observation_id":"b78afefe-1b21-4649-9f04-ad02675583b9","resolution":{"observed_at":"2026-08-11T13:25:27.407545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T13:25:27.337527Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.337527Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:1f08ccf02e40508edfb1c57d305bebb528185ee3bffc8e406dee79a4d3566068","observation_id":"635f13ad-a235-49ee-8cee-bfc845328e1a","resolution":{"observed_at":"2026-08-11T13:25:27.337527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 4 inbound Pith citation observations for arXiv:2412.13187."}