{"as_of":"2026-08-07T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc8f6778562871119de79d3b202d1a96d87904976c784d407dd5e1c76d149881","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T06:09:11.411036Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08514/citation-record","integrity":"/paper/2607.08514/integrity","json":"/paper/2607.08514/citation-record.json","paper":"/paper/2607.08514"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.198068Z","title":"In: European conference on computer vision","venue":null,"work_id":"60b889c7-02d9-463c-8ad1-4c420200bdc8","year":2020},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:f1c543c50d5a451631405d72dc5fdac002cbeb1198b3ddf950ddfcca170d0ff6","observation_id":"48d41b6f-a223-458b-92c1-89daa1273c4a","resolution":{"observed_at":"2026-07-10T06:16:52.201988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.212499Z","title":"In: ECCV","venue":null,"work_id":"6160a39b-d851-47d3-8916-ae7b197db228","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:13b27444335f112bb6356ea8ca535e52c981723a9c5b921f73c10af3fd4836d6","observation_id":"3c59707f-9f64-416d-8830-acb2746d6e7a","resolution":{"observed_at":"2026-07-10T06:16:52.214739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.205961Z","title":"International Journal of Computer Vision130(1), 33–55 (2022)","venue":null,"work_id":"ca674e41-092b-4293-810d-74b4a9b82fd3","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:f51d7c2f038dcce8d1190c6d6b600257683c6590100728117ebb8c0ad0ab8a83","observation_id":"8724cb82-cb4a-4608-884d-c81ed38e2e2d","resolution":{"observed_at":"2026-07-10T06:16:52.209988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.215968Z","title":"NeurIPS35, 13745–13758 (2022)","venue":null,"work_id":"76bac0a4-f02b-4e65-90a3-4aad9f90581d","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:d98c4a3d7a4387ad72bda1226dfb74ebfa7609fca5cb107c04d10c783427c41c","observation_id":"d1fbd3c1-52d5-4656-a12b-a69301a6cee0","resolution":{"observed_at":"2026-07-10T06:16:52.218490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.220911Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"5f5bb386-b0c8-40fd-ab99-b107bd6e77f7","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:2c4e5c65c1a1b5df672d13ff82d2bafbbb4ea378fbefff9108995200212c911e","observation_id":"da35563d-b37e-41fb-b2db-a72f3951777d","resolution":{"observed_at":"2026-07-10T06:16:52.223179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.256481Z","title":"In: ICCV","venue":null,"work_id":"114eba54-0781-4326-9b01-55219deeb9b2","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:865b1323fc5dc5920f426a02ebcc951ed0ad1ff44441abe7958f147350bae28a","observation_id":"06c290ed-7dff-48db-8570-6584708c85f3","resolution":{"observed_at":"2026-07-10T06:16:52.259553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.157203Z","title":"NeurIPS35, 35946–35958 (2022)","venue":null,"work_id":"85301ba1-edfd-4d31-a664-5e020510a3bd","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:8100adf30dfc74ed9faae5a38b9510a8c390bb1acc84fa6f4f202a6d30864a00","observation_id":"f54e2fe2-f55a-493d-8be8-cda365d5f58f","resolution":{"observed_at":"2026-07-10T06:16:52.158762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.169664Z","title":"In: WACV","venue":null,"work_id":"26a293e2-86f1-4f3b-80eb-de11007aaddf","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:caff6460b68793cf49301c3751af57e157f4fd61cdf9f0983c91056fc0b7b8c5","observation_id":"eb4c999d-983f-4d4a-8b3a-0773fcbace08","resolution":{"observed_at":"2026-07-10T06:16:52.171490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.169646Z","title":"something something","venue":null,"work_id":"00543647-6547-4c6d-9723-a921f1ad366d","year":2017},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:72798faf04c27e8d4bb40bc265fe1d3fe36f571e9c77bd986dd9e1fa8949190f","observation_id":"bffba022-d754-4979-bedc-d6dea36787c7","resolution":{"observed_at":"2026-07-10T06:16:52.171481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.172351Z","title":"In: CVPR","venue":null,"work_id":"4a6b8ca6-6a33-4e11-86d7-ce98964c5625","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:2855a82e032b9e31b51ea43d93bc28fad6b2fb098adb4a648780b04570868eb4","observation_id":"bd43a4c4-e1f5-4820-99b8-8b48eb068c74","resolution":{"observed_at":"2026-07-10T06:16:52.173896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.181761Z","title":"In: CVPR","venue":null,"work_id":"09a6bf0e-2430-409f-aed8-b773637fdea7","year":2021},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:f0e62d856dfe57ddc3a9e7f9f617289490ee3a43e17b1cbd1855fad6b96dc408","observation_id":"8fe99ac5-8ded-4ac0-a61d-98e4125c1748","resolution":{"observed_at":"2026-07-10T06:16:52.182992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.146765Z","title":"ICLR1(2), 3 (2022)","venue":null,"work_id":"f84bfeb2-645f-4da8-b913-48ba34dfdc3e","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:b193f0bd7c59cb9dfa37d1d90681b50a060b1700072df99c352506b80d22cd47","observation_id":"130b6e80-ea0d-42b2-9c27-284b2a4c345d","resolution":{"observed_at":"2026-07-10T06:16:52.148146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.149140Z","title":"In: ICCV","venue":null,"work_id":"60435ed1-81ce-4757-8501-9f3717fba495","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:651b2d52a92ebc7f3622cc3126f38101975b6e1db2846a4a008e0463bce3cd8c","observation_id":"5b097368-fe80-4d70-80a7-a03886ca1082","resolution":{"observed_at":"2026-07-10T06:16:52.151199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:78fa01fb0f6d143b265e5ca6f133c833b2963fbb543e8ddb823aa6db8828bb2e","observation_id":"357060b2-a3d5-47cf-b873-b606a46dc3ba","resolution":{"observed_at":"2026-07-10T06:16:51.322147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.131856Z","title":"In: ECCV","venue":null,"work_id":"77ad7847-298c-4948-8710-08ef85cdcc8a","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:cf84d0d4d7a88db711e0153f42398ab6e5962f30781fc9ab2d818f0102b1b023","observation_id":"595d925d-b84f-4eea-94c6-bd0b44641bfe","resolution":{"observed_at":"2026-07-10T06:16:52.134335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.135669Z","title":"NeurIPS35, 7575–7586 (2022)","venue":null,"work_id":"b3d9a8a5-3c92-4eff-a315-de6d8f87b68b","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e45148cb087d9d94ac8b2effc278fec7d7c1ed8d5ba3e2ac6470d971bbe6a5f4","observation_id":"a11493bf-c6bc-44fc-b07e-02ec4c4840d1","resolution":{"observed_at":"2026-07-10T06:16:52.137267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:95f14bab1538e070e431c8af2e00ab9bd91cb77da9a12aa7fe06a1315bff3765","observation_id":"c1300fe6-c691-4da5-a400-0207af597f70","resolution":{"observed_at":"2026-07-10T06:16:51.319183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.138300Z","title":"In: WACV","venue":null,"work_id":"e9f7f462-98f6-4695-9e5d-400b9ebbd44f","year":2026},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:3db67c6e7d27e125d4799c2f587544cf81d8f14d367523a83db621422799c7c1","observation_id":"9ab3e555-6068-4493-b596-b1d3df8aee49","resolution":{"observed_at":"2026-07-10T06:16:52.139915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.152228Z","title":"In: ECCV (2018)","venue":null,"work_id":"706e877a-6c2a-4ca7-89da-928f6fcca609","year":2018},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:d8aef2aba500b31c8e3cd2a2a9c76eda1f166f6b7af52cf4e33ce2c24af66a1d","observation_id":"a0976d70-d265-42b7-b03a-329e711b6d7b","resolution":{"observed_at":"2026-07-10T06:16:52.155419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00986","last_updated":"2025-03-02T18:49:48Z","snapshot_observed_at":"2026-08-07T17:35:32.512907Z","submitted_at":"2025-03-02T18:49:48Z","title":"Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning","version":1},"cited_work":{"arxiv_id":"2503.00986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.00986","snapshot_observed_at":"2026-07-10T06:16:51.314847Z","title":"Modeling fine-grained hand-object dynamics for egocentric video representation learning","venue":"cs.CV","work_id":"25d152fb-974a-4325-9a4d-80ec390cda0e","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2503.00986","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:8ee523ee5e5ffb432ef618f7eb3b929631ca8c270288e5d7749665170ac07ed4","observation_id":"c8cc51bf-d5df-490b-9b94-ff6fd326c2a2","resolution":{"observed_at":"2026-07-10T06:16:51.316359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.122513Z","title":"In: CVPR","venue":null,"work_id":"abd7ecc3-5ed0-4620-ab65-7a423d6c9ea7","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:6d1e426240e8ce46d7b222c0b37327d7b82f05da0506c41826e6b755d31231a3","observation_id":"979c28c5-4d42-4db6-b658-e3ac4b5f46ef","resolution":{"observed_at":"2026-07-10T06:16:52.126422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.128912Z","title":"In: ICCV","venue":null,"work_id":"2361e441-241d-4629-8627-2cecc9cab43f","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:444aba78ec6aa5e8a7e78c8b392eda0548c0b4ca9552f5a5baaa58d11ef2a7f2","observation_id":"ae71b54f-cc8f-4ed0-b085-68f8868e2fbe","resolution":{"observed_at":"2026-07-10T06:16:52.131283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:44.272383Z","title":"In: International conference on machine learning","venue":null,"work_id":"69077c18-2906-43b3-9114-9a7539e22548","year":2021},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:161fcc09f9f32e65e35ff21f60f2a814ce43c1a4c12ffc911369e6c299a41c49","observation_id":"925f0877-73f0-484f-853a-52d49cf7daf3","resolution":{"observed_at":"2026-07-10T06:16:52.144692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:1abfa92bc6aa200cc3f2bdbaa0766ae4006884bb40ba75566eedde57b1401ee9","observation_id":"c7c2f8fb-7c38-4f60-96ef-5699902e9d37","resolution":{"observed_at":"2026-07-10T06:16:51.318769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.194529Z","title":"In: CVPR","venue":null,"work_id":"b5bcb597-e857-4f95-b16e-34a5c79767fa","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:893e8b8afd53fbb568b5c78562d47ad7028d40264d20c53c0ae58419626925d9","observation_id":"ccc53b70-b33e-4685-9830-d730da9840dc","resolution":{"observed_at":"2026-07-10T06:16:52.196544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.267727Z","title":"In: CVPR","venue":null,"work_id":"5d664c48-2d13-421e-8624-8dbf0bf85667","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:1defb77359f4217a77c9417d84d09de1b635fe3e24927175d185a9408debb7d0","observation_id":"516cc6c5-f109-4342-bf29-b37136f61fdf","resolution":{"observed_at":"2026-07-10T06:16:52.274091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.248034Z","title":"In: CVPR","venue":null,"work_id":"9dd5aa78-9db3-47e5-816f-186d3414fead","year":2020},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:46d3880a0c08a8a0fb2cd3f90847cc090ba7b6af7c6abea4d77765051ae25af9","observation_id":"67f358c1-5317-4475-8adf-c4d77aa59883","resolution":{"observed_at":"2026-07-10T06:16:52.251628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.244048Z","title":"In: CVPR","venue":null,"work_id":"ea0f1b12-138c-4767-8232-095e00330c38","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:7c85e2676899ee072c1f55ba0bec894cadd5fdbe47ced5ffc9eb2fc0ab51468c","observation_id":"9c3a9beb-9f63-4d6d-8521-35f79c5ee633","resolution":{"observed_at":"2026-07-10T06:16:52.246583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.253858Z","title":"In: CVPR (2023)","venue":null,"work_id":"22f4c415-efd6-4f6b-be1c-a4e581ea2f57","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:7420140c00ff1d79e4f9caf5412b51d4ef55680d8b8eb578de7a0e3a92caabcd","observation_id":"6007da2a-808c-4df5-af2e-84635fdf74d8","resolution":{"observed_at":"2026-07-10T06:16:52.255168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.225157Z","title":"In: WACV","venue":null,"work_id":"c7b54c18-50e4-4530-b94e-1a12e9c6b26e","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:de9e1ec1ce9afdbadf9922089e2d21685a5a20bfa85e0fa64e65de4e5865fe4a","observation_id":"bb01a161-2a0c-40e5-9bcf-e5f73118120f","resolution":{"observed_at":"2026-07-10T06:16:52.226987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.228397Z","title":"NeurIPS35, 10078–10093 (2022)","venue":null,"work_id":"89466b8e-4c95-48b9-ac64-22b56ad515dc","year":2022},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:689618f9603aacbda9ebd95f6bc86e6ccdf048c63cc948b8d72726e969cb51da","observation_id":"4b3f941e-bb3f-4be3-a86f-80dc46ed66ae","resolution":{"observed_at":"2026-07-10T06:16:52.230186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.230909Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"4398323d-7908-4148-a36d-be2765a54854","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:2775aa834c42a25b4a062c4451ebb7a16d846227190600013a37849f105368e0","observation_id":"7a175fb3-91e4-4ad9-9c9b-73e16cd49de9","resolution":{"observed_at":"2026-07-10T06:16:52.239579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.240992Z","title":"In: CVPR","venue":null,"work_id":"bc0e29b7-ef9e-41a5-8751-e7c5b60fdec5","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:82fec5dfa876760cea75954d6e1ac0ebe95dab06bb5cf3dd4f70c381b10bf782","observation_id":"3df9347d-d258-4a0c-89d9-e9b9478b357c","resolution":{"observed_at":"2026-07-10T06:16:52.242776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17719","last_updated":"2025-02-20T04:28:19Z","snapshot_observed_at":"2026-08-06T17:59:06.488128Z","submitted_at":"2024-05-28T00:27:29Z","title":"Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?","version":3},"cited_work":{"arxiv_id":"2405.17719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17719","snapshot_observed_at":"2026-07-10T06:16:51.320014Z","title":"Do egocentric video-language models truly understand hand- object interactions?arXiv preprint arXiv:2405.17719","venue":"cs.CV","work_id":"e8bfd56a-b0e1-4585-b787-c5cd84ba98ac","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"cited_paper":"/paper/2405.17719","citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9840367308072de15f1d418a3b40e50b5c6bf90cad1bf46e7fa46b1f69bfd424","observation_id":"f3de8720-1ab4-461f-bd26-b328d43ff895","resolution":{"observed_at":"2026-07-10T06:16:51.321374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.261857Z","title":"In: CVPR","venue":null,"work_id":"c39a1001-0148-42fa-9858-a5cd446fde99","year":2024},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:b9448e49f93d4138f4d9046d0ffc7d00c2303143280c73e130fa6eab4fa9cdb2","observation_id":"f8f705ca-c520-479a-bca8-4ce384ed9f68","resolution":{"observed_at":"2026-07-10T06:16:52.263569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.265439Z","title":"In: ICCV","venue":null,"work_id":"691496f0-18c0-47c8-bac8-dfb6e83465a1","year":2025},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:1458445c8f444fbffbed422d6637c409d0a3d4e9fec6aef81da5716e417146fb","observation_id":"7b6bc46b-307b-450d-8a29-0a4d34adc9c1","resolution":{"observed_at":"2026-07-10T06:16:52.266755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.185369Z","title":"In: ICCV","venue":null,"work_id":"21fbe4ae-d373-4961-95a4-17ae7cafec6f","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9ab5f0569ae1cc98ca8525d0e4197d5fbebde931a179c6a50c7fd8b30c8a94af","observation_id":"e2089e88-753a-4a00-a682-2754f0963abf","resolution":{"observed_at":"2026-07-10T06:16:52.187586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.190770Z","title":"In: CVPR","venue":null,"work_id":"09d2cf0c-ee36-4154-9ced-b792fa681d3c","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:75386402897d7ebebd3fe9434064a20a75d18bbf3f1e8291d3830537b8c855cc","observation_id":"12e412c3-7679-4469-8281-86a7b283436a","resolution":{"observed_at":"2026-07-10T06:16:52.192785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.174817Z","title":"In: ICCV","venue":null,"work_id":"8be098cd-6f51-41ec-ba27-3b8555e88162","year":2023},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:e3bf6c9b3c61dc7da22c88236b3a294120a3a158a0c3778dab430550b78f8329","observation_id":"7ddce3c4-ea97-46e9-8a9a-ac2b3c4db958","resolution":{"observed_at":"2026-07-10T06:16:52.176958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:16:52.177869Z","title":"In: Proceedings of the 27th acm international conference on multimedia","venue":null,"work_id":"9433b0f3-c738-44ca-b960-a61e66fbca3d","year":2019},"citing_paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T06:09:11.411036Z"},"links":{"citing_paper":"/paper/2607.08514"},"observation_digest":"sha256:9598ae70966e8fd2c845ce704e0cde4c63e001ce59259b193cd16449dfaf67b1","observation_id":"c7980db4-5fe2-4c83-95c7-3e6705b8fdf8","resolution":{"observed_at":"2026-07-10T06:16:52.180471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08514","last_updated":"2026-07-09T14:09:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:00:41.421126Z","submitted_at":"2026-07-09T14:09:29Z","title":"Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.08514."}