{"as_of":"2026-08-11T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:639c2c947a0cd8393f344cb56bfc279ee2486f9a0565e5eaa4d77b1d88365473","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:57:41.808405Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08234/citation-record","integrity":"/paper/2502.08234/integrity","json":"/paper/2502.08234/citation-record.json","paper":"/paper/2502.08234"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.446588Z","title":"Ht-step: Aligning instructional articles with how-to videos.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"705385b4-2df1-41b4-824d-9f8e527562ee","year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.582945Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:15f4570662a0b71b79073e27fac235c47b46211e791b59ef3ee11fae32105ebf","observation_id":"0b15a81f-0f91-46a7-98ce-ffb83ee5f24b","resolution":{"observed_at":"2026-08-08T05:57:42.450088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.436876Z","title":"Character region awareness for text detec- tion","venue":null,"work_id":"de18cc1c-b097-47f0-a482-80ffe15d297e","year":2019},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.587959Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:74f34d01dfe2d54eb7485d73f01c06a1923d523c6d9d49778360bd0bc3222355","observation_id":"b28e4f32-db7d-4f7a-b3a9-d2eb4aef30d7","resolution":{"observed_at":"2026-08-08T05:57:42.440236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-08T05:57:41.592358Z","title":"Gen2act: Hu- man video generation in novel scenarios enables generaliz- able robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.592358Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:2045bdbab47ac6bf35cd22cf12ca8df7cf7068d0f1aa9377d1782ce58cc33ae5","observation_id":"aeac7dab-3087-4cf5-b4b9-10ad7510f05a","resolution":{"observed_at":"2026-08-08T05:57:41.592358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T05:57:41.596848Z","title":"Stable video diffusion: Scal- ing latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.596848Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:3fabb0a6f17f1475a2ba2bef3185e20824af91ad4767d2c192fbeed79a541b0d","observation_id":"4d18419e-e528-4449-a31e-e3c679f8c782","resolution":{"observed_at":"2026-08-08T05:57:41.596848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.601151Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.601151Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:d931b9beed5a1bf98b21aed7dcea0d5de5c2b327e02ef6f28d0d536959af38e5","observation_id":"8142fb59-4c3a-426d-af2b-84b93943b4e2","resolution":{"observed_at":"2026-08-08T05:57:41.601151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.421320Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"47092274-5b8c-4e50-8711-3ca734bbd6fe","year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.605099Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:78a9c35e89c5201d716a24556d126ef37c5c77b3afd8266839bb48f5387bbed3","observation_id":"a031fa14-c750-4464-889c-4aa6b4090bfb","resolution":{"observed_at":"2026-08-08T05:57:42.424727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.411418Z","title":"Procedure planning in in- 12 structional videos","venue":null,"work_id":"314daae0-632d-4e78-bf7d-62c6fb3a2cf1","year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.609286Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:b52394e7a84a83bd02d1fd64b57f891e78924b3c9f99ae6aa73861e8335dd658","observation_id":"f9238a44-384b-42bb-bdda-b63a9b332c3a","resolution":{"observed_at":"2026-08-08T05:57:42.414968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.400757Z","title":"V AST: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"60e2affd-8ca9-4f8f-9c15-244e49c6b583","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.613181Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7e7ec81f1ed95684da5f79696e075101b8109f24faf0acae913cb1ae443db09f","observation_id":"862b9e94-22ad-4014-ac79-6a043492211d","resolution":{"observed_at":"2026-08-08T05:57:42.404619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.390534Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"48297fe5-f735-4315-9bb3-7ed2071264a5","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.616878Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:6f453777cd13e77b1b3dbc0cbca0a8486c526790ddd93f1a440e3af6ea963159","observation_id":"6ccd12c6-14e7-48fb-b16c-615589d8bb65","resolution":{"observed_at":"2026-08-08T05:57:42.394083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.380680Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"035c1a32-ab38-4f65-991b-f29ce37dd407","year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.620810Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:675776dab2c109b2cdad329c05b6fe8f6a4f40c169d62b6154b8f8bc13e1f671","observation_id":"0bcdc815-534b-429d-956a-eb1bff33fad6","resolution":{"observed_at":"2026-08-08T05:57:42.384134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.370078Z","title":"Animateanything: Fine- grained open domain image animation with motion guid- ance","venue":null,"work_id":"6b35ba25-2ff8-45a3-b667-e5f98f11b7e4","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.624605Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:cf063b77c835f279a46fca0d1f8984d727a3153024bc17cbb8f7af48762448ac","observation_id":"cf4c67af-e8a1-4625-84e8-6b747e2bef53","resolution":{"observed_at":"2026-08-08T05:57:42.373948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.359383Z","title":"The EPIC-KITCHENS dataset: Collection, challenges and baselines","venue":null,"work_id":"345c3922-3fe5-4312-af9d-316c0d743aec","year":2021},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.628361Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:e18083c43b50de136e8e8a89691f2caf80be19de5cf6e2050ee98425b0d2570d","observation_id":"c3f30dec-35df-4485-90e2-84578e514b3b","resolution":{"observed_at":"2026-08-08T05:57:42.362984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.349631Z","title":"Doell, and Jason J","venue":null,"work_id":"c52f28f7-062a-4b07-9f96-9f45bff81242","year":2013},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.632029Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7cffa60c46c7ebe66d81ca4a4ebe8092226101a15b9d59f1193fbb524478ed0f","observation_id":"b14b932e-06f4-42b7-8332-5745980dbeae","resolution":{"observed_at":"2026-08-08T05:57:42.352953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-09T12:57:58.196865Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-08-08T05:57:41.635876Z","title":"Tenenbaum, Leslie Pack Kaelbling, Andy Zeng, and Jonathan Tompson","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.635876Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:b2af36167a0eab254c5128348a37bc741b68ac372ed7203a13383ca80e9daad9","observation_id":"0b8563f8-1c56-43d5-bb27-2e7741c19b0a","resolution":{"observed_at":"2026-08-08T05:57:41.635876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.339403Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"a92a51b9-6988-4348-8f92-30f00aaff059","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.639969Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:db03c99b5d0c068c91c837bd3f39b1abf54641c01f6665e92fb6a9b58fc7f19f","observation_id":"a6160406-5171-4117-ac40-9ff0e852b1f5","resolution":{"observed_at":"2026-08-08T05:57:42.343045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:57:41.643663Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.643663Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:5b91be3e1b278e89fcf6f263afc96f11a556450ae9a2fee099acf0692b7d5d2d","observation_id":"2d3d93ea-c6aa-46e8-9439-4ca85b970f95","resolution":{"observed_at":"2026-08-08T05:57:41.643663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.328658Z","title":"The ”something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"a4e00c6f-abc4-473b-bdfe-e6b72d7b0ef0","year":2017},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.647707Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:f3961e566ab9c203ddf8e782f0be318ac1a106b64fba9cf10b29751b06bddb2e","observation_id":"4be22ee2-836a-4ea0-94fd-fcf691ac8854","resolution":{"observed_at":"2026-08-08T05:57:42.332513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-08T05:57:41.651277Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.651277Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:ad9c34035f2a50d27f492433670455cf2a070aa9ad17745fda7ad69a9c3983d0","observation_id":"fa9757cf-f239-4d0f-91a3-31f77e69b607","resolution":{"observed_at":"2026-08-08T05:57:41.651277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.317199Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"6298d1c2-5718-47a0-8072-08ea335f0e9f","year":2017},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.655476Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:745181b9a645a9097acdbb937bccdc3450e912af7609e51ae69290a287b894e3","observation_id":"8249a066-287e-4a1d-b67c-0565564cdcb0","resolution":{"observed_at":"2026-08-08T05:57:42.321383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.659027Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.659027Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7e255955dc39c60f6b54de1cf143ca5ff2ddab2f88dfe5e81f6f706521372a67","observation_id":"7072952b-5400-490e-8403-9efcd254d6be","resolution":{"observed_at":"2026-08-08T05:57:41.659027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.300080Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"a00b50d5-c7a8-4da0-ac77-8ae9de8cf67e","year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.662629Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:8c00fa3b2dff616c547d78415ac52899a17896f2cece858cb62d384ebe2f746b","observation_id":"7cd2a483-4297-40d8-bdfd-453ee4a091bb","resolution":{"observed_at":"2026-08-08T05:57:42.303866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-08T05:57:41.666094Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.666094Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:0a81faf183330be405f2872a465347d527bd892fb510d702329218fb41309022","observation_id":"8c33e2b3-915b-4fde-bc74-803c9be71552","resolution":{"observed_at":"2026-08-08T05:57:41.666094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.288271Z","title":"The language of actions: Recovering the syntax and semantics of goal-directed human activities","venue":null,"work_id":"a8efc2c1-3c73-48b3-8619-0a5dc48829de","year":2014},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.670181Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:489ba944f796b4c465509093e9ffc009550b0bae553502045a59b04ee7b7587d","observation_id":"cb93cf69-3c11-430b-a6e1-70b817733680","resolution":{"observed_at":"2026-08-08T05:57:42.292234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.277940Z","title":null,"venue":null,"work_id":"02d6f9c7-7d71-4559-aa85-250491fc083c","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.674076Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:03ded65bb30ebf25ba47d082601e3211732869a18bd407e6c3e3cd28268162e5","observation_id":"e376017a-7f18-470f-a3ca-878bde00487b","resolution":{"observed_at":"2026-08-08T05:57:42.281239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-08T05:57:41.677889Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.677889Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:d23a305f7fd6407a97a7fa37cf72301a56a02b624d0cef5cb6ab9412f1464137","observation_id":"c3193487-7874-4e52-905b-2b352f1e574b","resolution":{"observed_at":"2026-08-08T05:57:41.677889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.267589Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"b757447b-8d39-4779-ae42-0ca5b168371b","year":2019},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.681886Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7c727979896b9e3efcd61da7a05f17cec1e4e1a15ea02f3f42f8daa91deab0b5","observation_id":"b2521d54-76d4-40e6-8d87-4a66524998e9","resolution":{"observed_at":"2026-08-08T05:57:42.271516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.257605Z","title":"Gpt-4o release","venue":null,"work_id":"74c7c4e9-a857-43c7-9d94-a9f9991bddfb","year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.685785Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:11fcde3480411d4b41ff226e197fa450dd0a62f26abedf676fa052acb08c3232","observation_id":"fd6799bf-3171-4a07-9213-93720205aa0e","resolution":{"observed_at":"2026-08-08T05:57:42.261132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.245872Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"2a7a79f7-8370-4026-b314-7b633b238751","year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.689473Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:c28c4e309241de74c2e544b586b64fd62fbf1f9cc745220b1440f5b25c78f52d","observation_id":"c7c78915-af01-431a-909e-74beb5cab700","resolution":{"observed_at":"2026-08-08T05:57:42.250388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T05:57:41.693527Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.693527Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:e0e84ffeae1a09dccdef83e614e60e79c43aa8e508bd8a1851e2be51825cdcc0","observation_id":"9cf035b1-497b-4340-8e04-a50ab56bad56","resolution":{"observed_at":"2026-08-08T05:57:41.693527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.697503Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.697503Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:77f9ea2eb16ce4f083402a1300dd282c728360ec6d1dd34e8928c81eccde95c9","observation_id":"fc634a86-c32d-4597-bf55-c2c41e6e6cbd","resolution":{"observed_at":"2026-08-08T05:57:41.697503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T05:57:41.701183Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.701183Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:d1293fd27fe8c87b7c0b99c2d356e5eb20eb981665e098e057ac6a1d0a856bec","observation_id":"5a0ac98a-0486-42db-af27-bfafb4e6f147","resolution":{"observed_at":"2026-08-08T05:57:41.701183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.705234Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.705234Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:dcf741fa22ebe7d801239dd2eaac20d0f499aeabca616f711a656e5c7d503538","observation_id":"78bc2d0a-a0ab-4266-8b2b-0bd9b7cbf693","resolution":{"observed_at":"2026-08-08T05:57:41.705234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-08T05:57:41.708915Z","title":"Hierarchical text-conditional image gener- 13 ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.708915Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:033862e1963eca0eec59a765df33f57e212cfb8326c37a61c9ca6d7f083230ae","observation_id":"93597df1-d0db-4a22-8bd1-e615fd138797","resolution":{"observed_at":"2026-08-08T05:57:41.708915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.221998Z","title":"Skills, rules, and knowledge; signals, signs, and symbols, and other distinctions in human performance models","venue":null,"work_id":"dbe26edc-395c-472d-b6df-79e77f2e7345","year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.712854Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:13b0f7b15f9940d9b5d6d03721dde4385a605f4cae893fb5f0c83e5f5d5909ed","observation_id":"9893da96-cba5-4395-8184-a28e4f6384e3","resolution":{"observed_at":"2026-08-08T05:57:42.226149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.210069Z","title":"A database for fine grained activity detec- tion of cooking activities","venue":null,"work_id":"32fac0dd-9fa8-407e-8677-fe48b3795303","year":2012},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.716913Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:455cdc47d52aa0ba25d3557890d6c6676f1b960be5c2bbb29130ec8dfd98a673","observation_id":"a59097f5-d700-4d84-80af-f497a6c64f2f","resolution":{"observed_at":"2026-08-08T05:57:42.214252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.720611Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.720611Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:419ae2cb2f3733759c4f713a37f6b51f0e97448aea82d0e6439ff473fb04d08a","observation_id":"608336e7-a93f-4c8b-bc62-692ec82d47c6","resolution":{"observed_at":"2026-08-08T05:57:41.720611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.724335Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.724335Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:d7741ec679a4ef178a1dc7ab0546ff38f8ec10d0e3c679909d4303528c867216","observation_id":"5f035334-60cc-4b52-8741-0381fff9c689","resolution":{"observed_at":"2026-08-08T05:57:41.724335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.182428Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"a5a88d07-8262-4d00-a0d2-aa862e2479c8","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.728176Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:a73a6cb05835ac52bbb56b7fcfcbd11a3de4c9eedfd765bfbaf4f56eb100f281","observation_id":"d675b854-7876-4acc-a12a-a65c2c856792","resolution":{"observed_at":"2026-08-08T05:57:42.186665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.169929Z","title":"Tulyakov, and Mohamed Elhoseiny","venue":null,"work_id":"e8fa63a2-78a5-4e83-afdd-8d3778a7d4b8","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.731981Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:0b6648b2c6efc562b6793d1247b15d7c9c4610cde250e73f661f3b1465ec9a6b","observation_id":"c66fd543-5930-475c-826d-a41ab152b3f8","resolution":{"observed_at":"2026-08-08T05:57:42.174198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.156951Z","title":"Look for the change: Learning object states and state-modifying actions from untrimmed web videos","venue":null,"work_id":"affb50aa-e302-4dba-b95d-da01d17ec6c2","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.735568Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:02ddc62fc053190333b0d07a23d6ce65f767a247a1f0ab1656cf76a83d9aa349","observation_id":"54abcc50-6b32-4a62-a212-86e1de9dfeff","resolution":{"observed_at":"2026-08-08T05:57:42.161314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07322","last_updated":"2024-04-02T10:35:32Z","snapshot_observed_at":"2026-08-11T11:48:53.183669Z","submitted_at":"2023-12-12T14:37:36Z","title":"GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos","version":2},"cited_work":{"arxiv_id":"2312.07322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07322","snapshot_observed_at":"2026-08-08T05:57:41.888595Z","title":"GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos","venue":"cs.CV","work_id":"a2e6607c-68b0-46df-804f-c4c42e35ade7","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.739141Z"},"links":{"cited_paper":"/paper/2312.07322","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:3e74be7f7eba61b6e82c7fc5211d9f3a362e5b20396370f14bed34e255b74d87","observation_id":"c1cbc740-8d1f-4de4-ad37-4a08d806a359","resolution":{"observed_at":"2026-08-08T05:57:41.894755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.146058Z","title":null,"venue":null,"work_id":"0e2941b4-a287-47ab-9144-7d69ddf50337","year":2013},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.742915Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:9d084028f68f4bb6bec8afb7c56db7bfbb5dd0882e4ddfcd9a9c83a3fe557757","observation_id":"72bd222b-d278-46d2-b63a-19fc12bb0af9","resolution":{"observed_at":"2026-08-08T05:57:42.149776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.135325Z","title":"Plate: Visually-grounded plan- ning with transformers in procedural tasks","venue":null,"work_id":"59848f66-9912-4ba6-bd00-7675f5ff23c4","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.746536Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:d5c452f7ea028f6cb42e3566f2308a3f9621f0392dc86a3807a65d0c72347a61","observation_id":"25f80926-b6c1-4afc-94c0-77eadcb5d26f","resolution":{"observed_at":"2026-08-08T05:57:42.139262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-08T05:57:41.749692Z","title":"EV A-CLIP: improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.749692Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:8ff1a622185879115da27e87a84728a0b15061ace33413baf29049cd3eade3ca","observation_id":"4360b4cb-7909-4f79-b17a-d29e15164814","resolution":{"observed_at":"2026-08-08T05:57:41.749692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.123964Z","title":"A comprehensive survey of procedural video datasets","venue":null,"work_id":"b49c5018-3c13-4856-9f06-6fc88a79cb45","year":2021},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.753580Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7dbfa85d247616c4a054aacf1fbffe44b97e71213b07ffc48dbd44c06181f364","observation_id":"ac8de97c-418b-430b-b092-0926d9099a4d","resolution":{"observed_at":"2026-08-08T05:57:42.127835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.112951Z","title":"COIN: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"4ef46ea1-1ed1-4426-b931-76891e9d8a85","year":2019},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.756920Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:e9cdf0c861c2072f3c9c3e725713ec1e02988a2e5eeb50b1e8230bcabdc8edec","observation_id":"ff684aa7-86e8-4264-893d-24f821bd067b","resolution":{"observed_at":"2026-08-08T05:57:42.117106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.760392Z","title":"Kolors: Effective training of diffusion model for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.760392Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:ad9591f1ff6cc678a805c1eaa6f36311767e6101a4fb234ee69a6efb5441b8be","observation_id":"a756a502-1e39-4bb7-9d06-b7c3d29fb6fb","resolution":{"observed_at":"2026-08-08T05:57:41.760392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:41.763710Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.763710Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:7b3fa5ecfd4ba73d1caffc0b0b1e590be26d42e5a33672fab1a5201fff9b96f6","observation_id":"cc08896b-20f1-41f3-ab43-2aae1aba9e4b","resolution":{"observed_at":"2026-08-08T05:57:41.763710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.085027Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"01c4a320-0c28-4980-8784-a64dc9dea844","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.767223Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:e519bd7b68f6791e822f67d760bf51a024e74d71ca122ed143a7f6830e79ab06","observation_id":"183fe31c-5cbb-41fe-9458-c97d75655936","resolution":{"observed_at":"2026-08-08T05:57:42.089029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.072664Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"424b0880-3bf8-4b84-b61e-e409578b2d0c","year":2019},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.770757Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:752fd18ac0df6d3c32fde0c39b9f0990001ddb64c676ed205d44120e6e8ef19f","observation_id":"dccf7034-e184-4de5-9156-2f4c2c9647d5","resolution":{"observed_at":"2026-08-08T05:57:42.076814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.059723Z","title":"Event-guided procedure planning from in- structional videos with text supervision","venue":null,"work_id":"95e9dbcc-af7d-4ec2-ab85-fa6a7f48e5fe","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.774451Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:6d234ccac6cbc987df07f6d1c45c74c0f7fda1169bb7d06f62b8b04c41015272","observation_id":"05673831-b1ff-4c37-bb59-0f5778a4b0b2","resolution":{"observed_at":"2026-08-08T05:57:42.064809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.048204Z","title":"PDPP: projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"f8a111cb-be61-4431-a87a-f1095ec086ad","year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.777811Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:1b836fa070f75bb7243070fe7074e14db5d260b012de139b7c097a23070d4977","observation_id":"38c10197-f20b-4356-933c-132a379a5dd5","resolution":{"observed_at":"2026-08-08T05:57:42.052088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-08T08:58:45.984697Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T05:57:41.781154Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.781154Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:e99865cc5a0fe19e788bcf1f23ea163f5d90c14c6cbaac4cc70062b00af3df0f","observation_id":"88bb9576-8025-4cc8-8808-b03d213121ff","resolution":{"observed_at":"2026-08-08T05:57:41.781154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.037599Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"c104cdbd-1f10-4967-a777-eeaae3e600d5","year":2025},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.784886Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:cddd9c3fad9cf77c360fb54ab038e98aa49c37ef2970de22c332303dc9516a99","observation_id":"5f3a08e6-a538-4f44-9983-8f1710ca49e9","resolution":{"observed_at":"2026-08-08T05:57:42.041272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-08T05:57:41.788494Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.788494Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:dbb3afba588bce56389fb896247b430a41e7961db53d0cf7bd651c6b2e7f2142","observation_id":"2d8b7ea6-9b50-416e-a032-a55cceb2672f","resolution":{"observed_at":"2026-08-08T05:57:41.788494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T05:57:41.792380Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.792380Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:b335c544871bd1d4676ba537550621f6f3ccfc4819449f46410a0c959a9f0e1f","observation_id":"0c749702-373f-475b-aef7-0596903adbdc","resolution":{"observed_at":"2026-08-08T05:57:41.792380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-08T05:57:41.796675Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.796675Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:da280cfe161a25113f347f790eff50bff6453abd61c9e539734aa4009da5efa4","observation_id":"c36ef58e-a876-4025-ad90-5cb9765f8d34","resolution":{"observed_at":"2026-08-08T05:57:41.796675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.026350Z","title":"Der- panis, Richard P","venue":null,"work_id":"45843927-28ac-4b00-98f3-4905eaf9edc9","year":2022},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.800838Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:852486b7ff18132e8435ef820b339e33b8e1950609366f4457317f831ea543c1","observation_id":"2dd1794c-ee9e-4dad-943d-9887aa7b1de3","resolution":{"observed_at":"2026-08-08T05:57:42.030861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.013338Z","title":null,"venue":null,"work_id":"219d3704-840f-4847-8cb7-07430c30ebea","year":2018},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.804814Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:f8e63947f0319a1807558037779f1cfeae22dbafa3f3fc0a746f50340c55b109","observation_id":"d4a441bc-6f7f-4f98-9e02-644a6ec06356","resolution":{"observed_at":"2026-08-08T05:57:42.017712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:57:42.000673Z","title":"Fouhey, Ivan Laptev, and Josef Sivic","venue":null,"work_id":"9e8eb9ae-5fd5-4716-a52b-ff117808ae3f","year":2019},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.808405Z"},"links":{"citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:6bf2862daafe11329900e253a74b0a13825fa98da813e413dac214db0275c808","observation_id":"a15cf893-8100-4a22-913f-e85defcf0df0","resolution":{"observed_at":"2026-08-08T05:57:42.004808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2502.08234."}