{"as_of":"2026-08-10T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2924584beab0f864b5ac7e97d24cf14a56791d2b0d4ca66950dbb42baf210779","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:44:58.910397Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03459/citation-record","integrity":"/paper/2502.03459/integrity","json":"/paper/2502.03459/citation-record.json","paper":"/paper/2502.03459"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.739680Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.739680Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3b36e83355550a8222513a5b23ec825b89f67db07f56756633efbc2acc89fbf6","observation_id":"a09c5ffe-d7c5-4a20-a2c9-ce6ba00e2cae","resolution":{"observed_at":"2026-08-09T04:44:58.739680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.743392Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.743392Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:cff006216683d4136d07e4711b51ca2cdb89e3ac3b2529b0a9a35e1ba815c542","observation_id":"4f6807ed-6db9-4ec3-98c4-febcecead612","resolution":{"observed_at":"2026-08-09T04:44:58.743392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:44:58.747112Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.747112Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b47b468761a0b287ab79cfdcad347bf2abe3306f132be43b60c203f1e5fbf23b","observation_id":"cc067b34-46b2-4595-bee6-e9419a29f7f9","resolution":{"observed_at":"2026-08-09T04:44:58.747112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.381059Z","title":null,"venue":null,"work_id":"a7b7b6c8-eb1f-402e-afd6-2d218bff1255","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.750548Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:95576bf4962f32df105f883621034d42cdefd878d6055675c3ef164eecd292cc","observation_id":"f80afc5e-07e6-468e-982f-0eec120e20ca","resolution":{"observed_at":"2026-08-09T04:44:59.384190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.372674Z","title":null,"venue":null,"work_id":"1ac45998-cdfc-4307-8820-9fba1e277eb6","year":2015},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.753636Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:ba481eeb16ca995606e199b71d1a3d0db4023d8c3c0665a405737a4eb36b7daa","observation_id":"45365206-6f49-4d6a-b69d-8c516c560bfb","resolution":{"observed_at":"2026-08-09T04:44:59.375481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.364287Z","title":null,"venue":null,"work_id":"214169e0-b8d9-4420-877c-603702505fe3","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.757401Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:c9b19c8d6553b98821e1a2ee5de1411e2b84b6eb3caa4f317eaa8d7c4bff579c","observation_id":"f7a4e3ea-b264-435d-b50f-aba1b6f51a87","resolution":{"observed_at":"2026-08-09T04:44:59.367040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.355369Z","title":null,"venue":null,"work_id":"041ce2d4-4147-47fa-9ccf-ce2c5e359896","year":2020},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.760473Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:bf38cd14ec0ce4cce70d0d5921a7ca6cc0896e7bb2850b89dd59ec2448fc9abc","observation_id":"b1657822-4607-476a-9942-8927d45b8dff","resolution":{"observed_at":"2026-08-09T04:44:59.358290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.763620Z","title":"E.; Stoica, I.; and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.763620Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3a01f9fd6829cc3028a9cb7b2a0e1edfd19941a14b9e10bedbf69d460f2a153b","observation_id":"74124eed-04fb-4b42-aace-8b2990a08336","resolution":{"observed_at":"2026-08-09T04:44:58.763620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.341733Z","title":null,"venue":null,"work_id":"41059b01-d545-4913-b0bf-0933dc450b2b","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.766847Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:20b0f402a245751c2e5ae00f61ed2b00c95f7eeff0da6fa2c8dc1036972def24","observation_id":"a46e8080-61a8-43a2-a237-a1b6a75d6267","resolution":{"observed_at":"2026-08-09T04:44:59.344668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-09T04:44:58.770111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.770111Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:90f58a755dfa1b99bc95a9ec1ab6abafaedde999ee7ea724b042df24cfafd066","observation_id":"84ed8ecd-1680-455f-8062-2924e9e12524","resolution":{"observed_at":"2026-08-09T04:44:58.770111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.332990Z","title":null,"venue":null,"work_id":"90c05cbf-e850-4864-ad3a-16db9016c4ed","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.774535Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b5483aef73217141afb5362f3325cf8d4b274b4e8d80c088d16e686b0bf1f8d2","observation_id":"9768034e-e4d3-4f33-86a9-e67abcf99ef3","resolution":{"observed_at":"2026-08-09T04:44:59.335786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.324660Z","title":null,"venue":null,"work_id":"1c799f9f-82cf-4f28-874a-4d9625d29b3e","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.777364Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:cc09f43abb19a0ad6c3ab7f901cc74086f9fa74a9c9aa8ed5c694afe31ba127e","observation_id":"6c824462-e257-48e1-9d20-41056c32535c","resolution":{"observed_at":"2026-08-09T04:44:59.327639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.315950Z","title":null,"venue":null,"work_id":"412601b1-354d-47d8-b559-385227b89a2c","year":2020},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.780311Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:bea16f0af28808da49453d3b3425cbf462e5a2dc02573fca241fc211b050669b","observation_id":"4862d20d-3eb7-45d6-a138-0dc844aa3e0f","resolution":{"observed_at":"2026-08-09T04:44:59.319320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.307603Z","title":null,"venue":null,"work_id":"f20ace06-d82e-48a2-9091-dd135b2aa7c7","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.783021Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b843a8d9d72b84015475656fbf78fc7a9be06b93bbecdfc89fa945686ca61b7f","observation_id":"bc61fd4b-297a-4c8a-b3d0-f1e4cc34aef3","resolution":{"observed_at":"2026-08-09T04:44:59.310476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.298346Z","title":"K.; Sun, Y.; Patel, P.; and Black, M","venue":null,"work_id":"8cc327fc-ec12-4140-a6e7-e879afd4d4a8","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.785815Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e9d4801cae07fc971d6e255d89e1a54cb0ef498248a790a4e3b5ff0ff9b4bc1d","observation_id":"1b8533ee-f3aa-4fc6-a219-9df01b1f972b","resolution":{"observed_at":"2026-08-09T04:44:59.301511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.788512Z","title":"V.; Joulin, A.; and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.788512Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:0e26f932d826b14a664fcec493ea74cfb0bbe5fd7839a3cf8aaeb5f79c428df6","observation_id":"4801c7b1-12b4-448e-a577-15719e8fa9f9","resolution":{"observed_at":"2026-08-09T04:44:58.788512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.284260Z","title":null,"venue":null,"work_id":"ce63c842-dcdd-423f-b24b-37a9e2d95a69","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.791341Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:af3d395bca76fb3f9ba2b44d5a8287b9bdb4d02d50b83eab2c3832073c03c1fc","observation_id":"25f595f6-74c1-43a4-b478-16ed7a7bf540","resolution":{"observed_at":"2026-08-09T04:44:59.287126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.275775Z","title":null,"venue":null,"work_id":"eaddf6cd-8bf0-414c-b360-14629274aff1","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.794349Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:30f24b2a1376d448ab9e764018741a83e401ff580211feba2e5317d467d4125e","observation_id":"8fcb828b-0ccd-480b-b82b-3bbfb925e32e","resolution":{"observed_at":"2026-08-09T04:44:59.278740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.267630Z","title":null,"venue":null,"work_id":"f0646447-f777-40b4-9d3a-210cf2f79056","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.797434Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e4426691378f8d77419dff4d4b90ac877a182bf79e31b3f594b1f4a0dce5631f","observation_id":"04f3e484-de05-46b8-91b7-3b8f7a01426c","resolution":{"observed_at":"2026-08-09T04:44:59.270413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-09T04:44:58.800197Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.800197Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:958c32df3677977d132352e5142d4b7da953d62822cd7a080d85319d04551e3b","observation_id":"2fb2dafd-00bc-47e2-977d-ad1b43a34929","resolution":{"observed_at":"2026-08-09T04:44:58.800197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.258564Z","title":null,"venue":null,"work_id":"76abf7dc-ca3d-45e6-925b-d5b4123279c2","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.803531Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8799fbff11a854ba5d6e3e28bc6dd8a103eaed08d509a170938d84dcd73354ca","observation_id":"15bbbb5d-93ec-47fb-964e-e2320581e371","resolution":{"observed_at":"2026-08-09T04:44:59.261860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-09T04:44:58.806472Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.806472Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7a049e243752030bdf83f08c1a20b4203bc236dfafd56d5be2d6b67c555eb33a","observation_id":"c58284bd-b098-4379-af3f-343171e0e46b","resolution":{"observed_at":"2026-08-09T04:44:58.806472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.249684Z","title":null,"venue":null,"work_id":"7f36f0a8-9b71-4ff9-a842-000e054e5875","year":2011},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.809749Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:75afb3e007fe3073e02623d328beae423420ac73c265f967d9c2c74b47a59169","observation_id":"5f68b827-35f3-43fd-920a-3bd5c78e0da8","resolution":{"observed_at":"2026-08-09T04:44:59.252627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-09T04:44:58.812526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.812526Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3110f428d1bca72e1a7b19aa733e20959e28ed7c0dd219bbe233d30576108526","observation_id":"f0185f63-076d-4d4e-bb3c-4941aa59afee","resolution":{"observed_at":"2026-08-09T04:44:58.812526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.240211Z","title":null,"venue":null,"work_id":"5e380f19-e3be-4a6a-91a7-3cf3f6764545","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.816041Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:60719d78d5c8816908260d304826ef7d5de39223e3e176aa3e0b71c604d5d969","observation_id":"03564d78-d7cf-46c8-9c14-5f20059224c2","resolution":{"observed_at":"2026-08-09T04:44:59.243761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-09T04:44:58.818749Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.818749Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e0a0f4471e5c99d61d9047cda64bdfb1f7d206dd7e2ef935c74db9b810264748","observation_id":"18821cef-6e58-4eb4-af69-e4f3a8c919e3","resolution":{"observed_at":"2026-08-09T04:44:58.818749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.231602Z","title":null,"venue":null,"work_id":"cf063df4-a581-4804-b810-3701972c1021","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.821991Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:7e49504605c796e28f8a5f799c1ca2071519990d518fa64aa68cc29b4a5897ab","observation_id":"67c4e852-cfd2-4f61-99a9-f7bc149e8cb3","resolution":{"observed_at":"2026-08-09T04:44:59.234701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:44:58.824885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.824885Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8e4d9206d46d3c30f038e7ce4754f3f8a11d6514bc91a3d0c18b779a36cc9bc9","observation_id":"7c18f423-58a6-4cc6-bb56-b31f4dae4b8e","resolution":{"observed_at":"2026-08-09T04:44:58.824885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.222822Z","title":null,"venue":null,"work_id":"6950745a-6bdd-42bd-a680-bcd2d8828c69","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.827928Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:2560868e81dc7f1eb7f4c1ec744d7a48be70514c31f9a3d333c8a4d96cb56048","observation_id":"ff28a171-010d-40ad-8c36-95aef13f6509","resolution":{"observed_at":"2026-08-09T04:44:59.225734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.214372Z","title":null,"venue":null,"work_id":"ad56b342-c425-40c9-b883-4e01ee9becf9","year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.830716Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:21f08456fd55d0db9f0f3d437d6334d026742cc92b6e6bdbe4a1e7b48e543b6c","observation_id":"749eccfb-893d-40db-ab5d-dcbd09789a76","resolution":{"observed_at":"2026-08-09T04:44:59.217434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07646","last_updated":"2022-07-15T17:59:11Z","snapshot_observed_at":"2026-08-06T19:04:25.950223Z","submitted_at":"2022-07-15T17:59:11Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07646","snapshot_observed_at":"2026-08-09T04:44:58.833389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.833389Z"},"links":{"cited_paper":"/paper/2207.07646","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:a6ca046743bd6b469c65b6faffe843f78882f7b345c58aa558a4ce17c296986f","observation_id":"b78052dd-89a8-4c07-bc01-c7ccf6886ff5","resolution":{"observed_at":"2026-08-09T04:44:58.833389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:58.836457Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.836457Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3c8866d6d4af2728b042827966333ec7e8061e312fab28828a745dc5df98fa93","observation_id":"49db148f-90d3-4744-b915-d2662f195c39","resolution":{"observed_at":"2026-08-09T04:44:58.836457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.200394Z","title":"U.; Maaz, M.; Khan, S.; and Khan, F","venue":null,"work_id":"6495a891-d5d7-4241-b4bd-8d60a2a31491","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.839261Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:13ab517d5ae7af4eaa70820e8754db866852323dc28c9fd1d3c1513232a85b06","observation_id":"0525f685-af0a-46c7-b05d-aeb541a94456","resolution":{"observed_at":"2026-08-09T04:44:59.203460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09390","last_updated":"2025-03-25T18:54:55Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:05Z","title":"LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living","version":3},"cited_work":{"arxiv_id":"2406.09390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09390","snapshot_observed_at":"2026-08-09T04:44:59.020845Z","title":"LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living","venue":"cs.CV","work_id":"0b61fed4-4520-476b-860a-990e61c76bff","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.841940Z"},"links":{"cited_paper":"/paper/2406.09390","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:cc6c00430981c9e25d305ec107cb25acb900fd248f239d8dc3572e51cf0f3568","observation_id":"a3eec8cb-faec-43b6-bc86-fae6cf883a5c","resolution":{"observed_at":"2026-08-09T04:44:59.026175Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.192487Z","title":null,"venue":null,"work_id":"0bb4c6bb-b731-43d5-87c7-f01c0080863b","year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.845095Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:945164510bbc6cdce6e770b4e3765dcaac17a5741d9df124650ebffd9985357d","observation_id":"55c85646-dcd8-473f-b317-6461ed194c75","resolution":{"observed_at":"2026-08-09T04:44:59.195267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.184211Z","title":null,"venue":null,"work_id":"93ebeb49-97b2-44a3-8e24-0e44c8d8d3f0","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.847930Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:95f014a03e1db8e53402e7d5404b1eb5ee09f43affb4c13fd828535a9b2bc621","observation_id":"dd19305e-74af-4d64-8c16-5ffdbf45c023","resolution":{"observed_at":"2026-08-09T04:44:59.187474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.176193Z","title":null,"venue":null,"work_id":"1619292b-f07d-49cc-b01f-bae87ec4e3ad","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.850749Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:bbaed09f0c3179ab7efdae3ea1ef1c33da32640b0ecc8b1ebf32710ebd00229c","observation_id":"7d778381-38af-498e-91b2-57f95639bc67","resolution":{"observed_at":"2026-08-09T04:44:59.178768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.167977Z","title":null,"venue":null,"work_id":"ec2dfe63-e06a-4f2e-8dba-4a5bf705a0e9","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.853607Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:731e12283a6ac29051bc1e5d46a685e17cd76b1253fb783b746ee87f708d144a","observation_id":"f28fa74d-1357-4fd5-ba01-e31703e02d8b","resolution":{"observed_at":"2026-08-09T04:44:59.170988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.159808Z","title":null,"venue":null,"work_id":"e0af27dc-19e1-4781-83d4-394cc3c0c948","year":2019},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.856293Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:29d9d24437f4b2995195ca71258fd33744dd6cf8dce9a6607464f719b3d2899a","observation_id":"c94a6557-7f97-4894-9c2a-ed49b206b94a","resolution":{"observed_at":"2026-08-09T04:44:59.162729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.151188Z","title":"A.; Varol, G.; Wang, X.; Farhadi, A.; Laptev, I.; and Gupta, A","venue":null,"work_id":"1adc52ef-bf99-4560-9f56-5adcccadb62d","year":2016},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.858982Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3d9fde654f295f7c800616fdc332a38774bb9f6d098b0926356aa250b65c918b","observation_id":"d428651c-b0cb-4bde-8702-dc59826bd4d6","resolution":{"observed_at":"2026-08-09T04:44:59.154375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.142356Z","title":null,"venue":null,"work_id":"a0edfffb-32b6-48c1-b2e6-76a0d0587ad0","year":2014},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.861661Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:b682ecb6cbd3c7077f1a5d25bf6feb7ad67d9fb738630e7b08ba04112b52164c","observation_id":"3c6ceb8f-dc0a-4012-bc1f-c1ed69ce8b63","resolution":{"observed_at":"2026-08-09T04:44:59.145730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-09T04:44:58.864413Z","title":"R.; and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.864413Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:402c0243a2e7142d94e57b138c20e356815e7c69761ac57e453faca588afd293","observation_id":"809ffe0b-5ff6-47f5-86df-a1297608fc55","resolution":{"observed_at":"2026-08-09T04:44:58.864413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-09T04:44:58.867443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.867443Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6798189649e4579ff954ae53b51e12d1769173608bb574b95299f0b3113f8163","observation_id":"9b476259-d7b6-4e9e-afec-275cefff6106","resolution":{"observed_at":"2026-08-09T04:44:58.867443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-09T04:44:58.870821Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.870821Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:fdf4c6e1ce127c8fbc371e06786f6b32ff1433f33497d6fd525f6ce1b33b8bb5","observation_id":"7fbbbcde-d7f9-43f9-8396-ae4a38f4a4a1","resolution":{"observed_at":"2026-08-09T04:44:58.870821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T04:44:58.873900Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.873900Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:56eecd6d8b69eb83fed6dde372439fc9535f32880d539a5f112dadd418c4f6f5","observation_id":"48467c18-75a4-4263-b5f4-cb0eb9e2c9e4","resolution":{"observed_at":"2026-08-09T04:44:58.873900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:44:58.877082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.877082Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e8eed75ed4671ed1e53bc1a1d65b65fa27191c6fdfe48a16f2e54f1b844fa8d3","observation_id":"717a7f45-29f6-4f8d-a1c0-9a0d749f5d34","resolution":{"observed_at":"2026-08-09T04:44:58.877082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T04:44:58.880265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.880265Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6fa8b58543b7d9d9b2e6d86a2ce1cb670378a977ebd793e116d54aa88fbf40a2","observation_id":"9f8917dd-0a2a-4a17-889c-e93499148733","resolution":{"observed_at":"2026-08-09T04:44:58.880265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.132937Z","title":null,"venue":null,"work_id":"bf4c11f8-ded0-456d-91da-14ff68adba91","year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.883755Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:491fd0728028a362760ede8b9fdcb1e1be3bbf71a13c32492ea2a40d097e57c4","observation_id":"ea4c7457-1e85-4795-9aef-25e4d221c7f4","resolution":{"observed_at":"2026-08-09T04:44:59.136172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.123918Z","title":null,"venue":null,"work_id":"5e6fbee2-b2fd-4953-914c-cf191a6a82ea","year":2018},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.886845Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:4970eb56d47500d5c6da99a76c188f40af01237e3d19a0f29311c6ece2ce67e8","observation_id":"c67b4078-98c3-43da-9dad-e60ba0f55d4f","resolution":{"observed_at":"2026-08-09T04:44:59.127192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10082","last_updated":"2024-03-15T07:51:35Z","snapshot_observed_at":"2026-08-04T15:31:16.544639Z","submitted_at":"2024-03-15T07:51:35Z","title":"CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10082","snapshot_observed_at":"2026-08-09T04:44:58.889585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.889585Z"},"links":{"cited_paper":"/paper/2403.10082","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:4f5d83c41778ed9f94b937d66f15b2fa2dff9c45b1007af5c02b58cfade5d9bd","observation_id":"c24f294b-10e9-4497-82aa-61c797d398aa","resolution":{"observed_at":"2026-08-09T04:44:58.889585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.114424Z","title":null,"venue":null,"work_id":"ce9677da-29e8-4993-92dd-8534634ca880","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.892781Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:42b918784d2d7937c1bac83febacdaf02057825a170b64112b800a8571f3f880","observation_id":"5767af60-c35c-4b60-a239-ae281cc10ef7","resolution":{"observed_at":"2026-08-09T04:44:59.117989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-09T04:44:58.895795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.895795Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:33d9d52407ea988706b40c03139beacd3bad4f028fde49e8e7fc472190116353","observation_id":"dafa6a34-9a96-4a51-b004-cbb2b41f7904","resolution":{"observed_at":"2026-08-09T04:44:58.895795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-09T04:44:58.898707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.898707Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:d7e56e8e751bbdf9f43cb374f5f2601954e2dfdba9d71b9d7048bb3559521d5a","observation_id":"fe6622ee-4080-42c8-9e88-a4f32c5ec3cb","resolution":{"observed_at":"2026-08-09T04:44:58.898707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.105166Z","title":null,"venue":null,"work_id":"cdf8a07f-4512-4130-95d4-16c5cacf8e52","year":2012},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.901971Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:3843458ea83617f7db104ba9e38bd163daa796a22aa31430347d4e7f4d5874e7","observation_id":"9602cfe7-07a7-48d8-836c-4fcd743cae2c","resolution":{"observed_at":"2026-08-09T04:44:59.108218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09590","last_updated":"2023-03-21T17:34:34Z","snapshot_observed_at":"2026-08-09T18:51:28.652024Z","submitted_at":"2022-11-17T15:36:48Z","title":"Hypergraph Transformer for Skeleton-based Action Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09590","snapshot_observed_at":"2026-08-09T04:44:58.904658Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.904658Z"},"links":{"cited_paper":"/paper/2211.09590","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:42e2411b39b7aa701ef214a5f094d3b384cff64078428690875feb9a08c7ffe6","observation_id":"91f593e9-4257-4750-9abc-3b818c95ddbc","resolution":{"observed_at":"2026-08-09T04:44:58.904658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:44:59.096213Z","title":null,"venue":null,"work_id":"9fbf2359-3b48-40db-8f8a-2c60e5198c5a","year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.907612Z"},"links":{"citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:1ec32ffee3911e1e8e113b097de4914bd3e624487b4dfd2cef4e9b55d29fc8dc","observation_id":"8cae0090-2e98-432c-8121-24a2515bc481","resolution":{"observed_at":"2026-08-09T04:44:59.099260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-09T04:44:58.910397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.910397Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:8bfa27e632d0557833c5c10d424ca7cfdcb619851fda1099e487da5b43951d68","observation_id":"5d6eaf64-e9e8-4b4f-931f-72eaeb08b46f","resolution":{"observed_at":"2026-08-09T04:44:58.910397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2502.03459."}