{"as_of":"2026-08-07T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c396f446fd36df4da36df4f84aec5105ca27a652a447b53d475114df9c741379","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:06.328656Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00827/citation-record","integrity":"/paper/2506.00827/integrity","json":"/paper/2506.00827/citation-record.json","paper":"/paper/2506.00827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:10.081700Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking, 2024","venue":null,"work_id":"1a1ad791-30ff-494d-9fd6-afaf29ca2bbf","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.398227Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:ace26d54822a6d8a5e42cb56c573232a6ccaa83c7fe3b566705b8a6c95f36144","observation_id":"3abed9b5-24a3-452f-9d78-d2c639b88a83","resolution":{"observed_at":"2026-08-07T11:59:10.167863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.828266Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the International Conference on Machine Learning (ICML), 2021","venue":null,"work_id":"936e19d5-34e3-4d19-a7d5-55c665fe020e","year":2021},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.487431Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:9e06da3e088d46ac3fb29b60a92da6c9e5d3df0eb43818db2f9071c01141b627","observation_id":"3e4ffd7f-5cf5-4159-a741-d0c9a61e8198","resolution":{"observed_at":"2026-08-07T11:59:09.936909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.573435Z","title":"A dense-sparse complementary network for human ac- tion recognition based on rgb and skeleton modalities.Expert Systems with Applications, 244:123061, 2024","venue":null,"work_id":"e3dcc7da-97a1-46f6-aed2-22981cb5a27a","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.617735Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:3eeffa886ae343c6c0d3f3d767fcbd7b63d21610e519717398c6101012cbf320","observation_id":"cd0d9544-8ffb-4cc7-b313-fee242e9d6d8","resolution":{"observed_at":"2026-08-07T11:59:09.728003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.329849Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"14f5dba5-44f0-4148-932c-517e36d5d97c","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.727388Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:6d810334759c0594dc8f991cc717f6a7bbfb03a09602e39dfb20fcef134bdb46","observation_id":"d01aa204-5528-421e-970c-266d7a7ec5b4","resolution":{"observed_at":"2026-08-07T11:59:09.409102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:09.085555Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"6d3f7f58-b7ef-43ac-93ad-07f7780eb841","year":2015},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.863529Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:dd3d9dfb7d2ad1738e6f9732b8ecebaa9c7e551a012e152da4da0ad321478bd7","observation_id":"55c20920-77fb-49d5-9731-6115f10a76eb","resolution":{"observed_at":"2026-08-07T11:59:09.175037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:03.974014Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:03.974014Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:24a90af69b51c1e4985df943d0228fbe983766dcd2fb4cfb87057f6b4c493784","observation_id":"d53db83b-735f-422f-9d84-18dc87ed6150","resolution":{"observed_at":"2026-08-07T11:59:03.974014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.875879Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7bb38f4d-e6f2-4ffd-a23a-9932e1f1ee82","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.117291Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:015174179ccceeb590f394211c0315161e1d122108cbc595fa3689399661aa61","observation_id":"66932c3b-2b11-4283-aeec-d96c5049da21","resolution":{"observed_at":"2026-08-07T11:59:08.993075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.644402Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspectives","venue":null,"work_id":"79659e6f-d7b9-43f1-8ef0-4d71b43bf666","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.282107Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:77186e81527858d56aeb409ba180ae1161c9300cf7a79c0c36550da9abdd6d83","observation_id":"4c95153d-6583-4f16-9ede-e22832de8963","resolution":{"observed_at":"2026-08-07T11:59:08.753227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.409637Z","title":"Jiang, J","venue":null,"work_id":"d3380bcf-a24e-474a-a27b-6aff97fb244c","year":2014},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.419006Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:92ce281c51efb6ce6b888f3857795ddfed8fd2f3e6b49d087deba72debbb0998","observation_id":"1efd576f-2e94-47ee-95b1-7a71c17383e7","resolution":{"observed_at":"2026-08-07T11:59:08.535971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T11:59:04.567274Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.567274Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:bfb173bde07ddf88113fdb175f95467cb1a21c699a19a29b2ff293ebab9565fe","observation_id":"48a33909-d9a7-4168-a6ad-a43e964f66c7","resolution":{"observed_at":"2026-08-07T11:59:04.567274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:08.208062Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":"745a9a55-006e-456d-bdec-835df53f68b6","year":2019},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.723588Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:97a212b3a21683421f47c43c2415b5f2e79e95486953f3deb97425a2924eef77","observation_id":"8451dedf-ce70-46ab-a700-ecaed6225350","resolution":{"observed_at":"2026-08-07T11:59:08.297259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:04.874486Z","title":"Human action recognition and predic- tion: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.874486Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:c76228347401ca8cd6ff31a6a5c9ac0b748b3baa4ade589d6c4c53f7a9691d09","observation_id":"40a7b2ac-a119-4eff-8dc0-629831ba756b","resolution":{"observed_at":"2026-08-07T11:59:04.874486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.964430Z","title":"X-mic: Cross-modal instance conditioning for egocentric action gen- eralization","venue":null,"work_id":"67050b05-e31b-45e1-8b73-0513bdbbba00","year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:04.959598Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:5b0409fee442b1fbea320198767b1e11763d71ce3e9091aed4ca7ba5c79f0ae9","observation_id":"b0aeda98-7a95-4851-9142-0e617663e98c","resolution":{"observed_at":"2026-08-07T11:59:08.080916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.750969Z","title":"Ego-exo: Transferring visual representations from third-person to first-person videos","venue":null,"work_id":"779ec45a-97b7-40bc-88a6-d28162aff5c9","year":2021},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.102608Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:ebd1658e865ce0fb6499e5f639a2205fb91000ef648d063b026026657a9df064","observation_id":"fadc45a9-2ed8-401f-ba91-ae8cc6ed7a39","resolution":{"observed_at":"2026-08-07T11:59:07.845496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-02T02:01:02.764427Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-07T11:59:05.218954Z","title":"Egocentric video-language pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.218954Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:4a72f420ef68ea0039af0157cc98c15105312f8fcd182d4bca10435045cfd57f","observation_id":"346dd980-3330-42c3-9f7d-44302af0302c","resolution":{"observed_at":"2026-08-07T11:59:05.218954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.543864Z","title":"Where a strong backbone meets strong features – action- former for ego4d moment queries challenge","venue":null,"work_id":"f3e9ec11-1ca9-45f4-be7e-10036a25855c","year":null},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.321906Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:545d2ade27418120941c37e07a5398e24625c484590dcd4ee22aaf543d905054","observation_id":"d544b563-dcdd-462c-892d-56b189b820b2","resolution":{"observed_at":"2026-08-07T11:59:07.646633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.310914Z","title":"Egoenv: Human- centric environment representations from egocentric video","venue":null,"work_id":"ed4c759e-2c66-47a7-b3c3-4642f972e28b","year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.427141Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:665d671e54db32b7ceed6bb129a88880f81f7d3efb5f7ffe560b1d579c6d5054","observation_id":"3d699295-a9ef-48c6-a957-15ee3edeb865","resolution":{"observed_at":"2026-08-07T11:59:07.399174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:07.057757Z","title":"Project aria: A new tool for ego- centric multi-modal ai research, 2023","venue":null,"work_id":"ee701ba4-b9e0-43d7-bdda-7d1767a21fa6","year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.530517Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:f7db6dc4e821417776eb03941595f38f5d98d46bd82d652be3cef86ff15109c7","observation_id":"b028e65e-5af7-44d2-847d-cc2e36b35e00","resolution":{"observed_at":"2026-08-07T11:59:07.179449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-07T11:59:05.646267Z","title":"Egovideo: Exploring egocentric foun- dation model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.646267Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:f077d094dfec8e484360feabf2a8737ba90069a38bd5f623946fad4ae3c8b8dd","observation_id":"947f55c1-1528-4471-91e6-07c289a7e6b9","resolution":{"observed_at":"2026-08-07T11:59:05.646267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05463","last_updated":"2023-08-19T03:38:55Z","snapshot_observed_at":"2026-07-06T15:52:44.676636Z","submitted_at":"2023-07-11T17:50:15Z","title":"EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05463","snapshot_observed_at":"2026-08-07T11:59:05.781867Z","title":"Egovlpv2: Egocentric video- language pre-training with fusion in the backbone","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.781867Z"},"links":{"cited_paper":"/paper/2307.05463","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:f6069080a5decf5a102a88e4a6d4edb3c6e5fa5f9e80aadc6bf78d99cf9ecf46","observation_id":"fb824526-af44-4294-9793-660ddbe35d51","resolution":{"observed_at":"2026-08-07T11:59:05.781867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:06.766815Z","title":"Understanding human hands in contact at internet scale","venue":null,"work_id":"28da70e9-f705-4375-be9b-1e6eef66557f","year":2020},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.899839Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:29d7c006f4faa9a0a24ab5d7d4b68e1cee66a1dc645c2c66df847dc978a2162a","observation_id":"79cdaa7a-0386-48ac-9509-6de7f4c6d0d8","resolution":{"observed_at":"2026-08-07T11:59:06.899474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T11:59:06.003000Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.003000Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:0f72416ceed227150fd781a2ca746010cce6e8ba865689b3bda9f5ba00e9b616","observation_id":"e00bff9a-e979-4536-b5e7-5081ae2ed929","resolution":{"observed_at":"2026-08-07T11:59:06.003000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T11:59:06.099409Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.099409Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:a2f7d9bce957ffca8dae807a3b7a5dd58253a745aaa19dcdaf70b5f38e5e95f7","observation_id":"348e432f-cd03-416b-8af0-23bf91de4165","resolution":{"observed_at":"2026-08-07T11:59:06.099409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09852","last_updated":"2022-06-20T15:31:13Z","snapshot_observed_at":"2026-08-07T14:32:13.321147Z","submitted_at":"2022-06-20T15:31:13Z","title":"M&M Mix: A Multimodal Multiview Transformer Ensemble","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09852","snapshot_observed_at":"2026-08-07T11:59:06.205021Z","title":"M&m mix: A multimodal multiview transformer ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.205021Z"},"links":{"cited_paper":"/paper/2206.09852","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:93b8849fb3c2a809ab7b9e8e592a6204081f6c966f1b30362cafa5993e407e9c","observation_id":"adfd9535-5c8b-4070-a0fc-537de4b1c8a5","resolution":{"observed_at":"2026-08-07T11:59:06.205021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:06.573154Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":"201e57b7-0ba1-4bec-b76a-f991ab76c8d5","year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.328656Z"},"links":{"citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:935b41a145738b97546bca926ead9b8c16d6f3f2c1e60f579381444bf5e8483a","observation_id":"25ad6a03-c343-4276-a302-0a57316e7302","resolution":{"observed_at":"2026-08-07T11:59:06.664550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:54:56.796885Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.00827."}