{"as_of":"2026-08-19T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e26f5eb8806069ae4e368969df8061681e8567efff702e66fd96ffddc87e4b0d","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:27:10.567596Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10745/citation-record","integrity":"/paper/2411.10745/integrity","json":"/paper/2411.10745/citation-record.json","paper":"/paper/2411.10745"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T19:27:10.131672Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.131672Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:fff274bf248220e82295c415495d2591a8d1efe22b01499755de75f9959fd353","observation_id":"7704b3b4-a5f9-4899-8f5b-f0136578395e","resolution":{"observed_at":"2026-08-12T19:27:10.131672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13224","last_updated":"2023-06-21T12:35:16Z","snapshot_observed_at":"2026-08-16T20:12:06.010100Z","submitted_at":"2022-11-23T18:59:05Z","title":"Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13224","snapshot_observed_at":"2026-08-12T19:27:10.137770Z","title":"Peekaboo: Text to image diffusion models are zero-shot segmentors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.137770Z"},"links":{"cited_paper":"/paper/2211.13224","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:fcbe9f8ab5023a3d6ea55bfd6ed92eae9fd38641edb4df76443eae5f7157ee8b","observation_id":"57bca25f-7b54-4e8e-9f05-b4b62e72a253","resolution":{"observed_at":"2026-08-12T19:27:10.137770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.143440Z","title":"Ske2grid: Skeleton-to-grid representation learning for action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.143440Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:35aea8975e0713e35e9d9015a0c9bfae3f8ef40bbfa824568b70e433ad7b5cc5","observation_id":"52a18fb2-f751-4423-86b3-f99b4bafe846","resolution":{"observed_at":"2026-08-12T19:27:10.143440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.148716Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.148716Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:9b7762e1e198447364192a0c12c106dbeafa6d05f36748399a4acbe4a852550b","observation_id":"0d3b9c86-d495-43e3-a580-3069e8d94e7d","resolution":{"observed_at":"2026-08-12T19:27:10.148716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.159351Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.159351Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:46b88ff3b18bbe3959ad31640b4b9f8911f081e027565aab545a970c090d4d0a","observation_id":"b5a6bfef-61bc-41ab-8e51-139506bd6b67","resolution":{"observed_at":"2026-08-12T19:27:10.159351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:12.009952Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":"ede01280-069c-4db8-b604-7c70ae016b1f","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.166705Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:f1ec467a8aecb0f965a843c8f8270ce1640fc2ddd2bde4a97896af9d0fc63bf3","observation_id":"5aa8d834-d615-40fe-b4c2-8f4eadd20542","resolution":{"observed_at":"2026-08-12T19:27:12.015316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.989360Z","title":"Channel-wise topology refinement graph convolution for skeleton-based action recognition","venue":null,"work_id":"57651a70-9a2e-49dd-84b6-769ae68e9470","year":2021},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.172381Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:f6b9082178e8d81132f72b56f05640ac67c909965ce4bce2a9d242c7167fa9f5","observation_id":"aedffce5-f753-4f5c-a697-d17f7d5e9ac2","resolution":{"observed_at":"2026-08-12T19:27:11.994441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07487","last_updated":"2024-04-15T02:25:22Z","snapshot_observed_at":"2026-08-19T18:26:05.768542Z","submitted_at":"2024-04-11T05:51:06Z","title":"Fine-Grained Side Information Guided Dual-Prompts for Zero-Shot Skeleton Action Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07487","snapshot_observed_at":"2026-08-12T19:27:10.178126Z","title":"Fine-grained side information guided dual-prompts for zero-shot skeleton action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.178126Z"},"links":{"cited_paper":"/paper/2404.07487","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:00f5cfc11fc141ce6ec1ff10122be30453cd9f2f8cfd4c0005d597068e77946e","observation_id":"a6fa3aa0-82cc-4ec5-8d6f-930084af9890","resolution":{"observed_at":"2026-08-12T19:27:10.178126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.972279Z","title":"Skeleton-based action recognition with shift graph convolutional network","venue":null,"work_id":"64cac798-d574-4295-a416-7babd006e454","year":2020},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.184437Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:f2cfde2b7c894129a9fda180c88b9d5050604138c2f87bbf70cb195aacb26ee3","observation_id":"99e4710f-3792-498e-9c38-f5db965592c8","resolution":{"observed_at":"2026-08-12T19:27:11.977989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.953174Z","title":"In- fogcn: Representation learning for human skeleton-based action recognition","venue":null,"work_id":"531ad995-e59b-41f2-b4c2-e78b1e61e462","year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.190198Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:0ebcbfafa0a244bd1c49f514b656b6b051ead98ad533f26e72fd5d11097052fd","observation_id":"709dcb7a-4251-4ce1-87ba-9cd5f67d8fd5","resolution":{"observed_at":"2026-08-12T19:27:11.960200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.934652Z","title":"Text-to-image diffusion mod- els are zero shot classifiers","venue":null,"work_id":"2736ea10-b100-458b-baa4-3372bc5db15e","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.195370Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:070be6d5ae04facc86b11d3fad19b3d9aaa514e488ff2ac375442d44f7f05837","observation_id":"f913a103-d905-41dd-9820-822052ba41cb","resolution":{"observed_at":"2026-08-12T19:27:11.941247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09508","last_updated":"2024-07-17T07:00:42Z","snapshot_observed_at":"2026-08-18T08:26:58.049095Z","submitted_at":"2024-03-14T15:55:53Z","title":"SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09508","snapshot_observed_at":"2026-08-12T19:27:10.200368Z","title":"Skateformer: Skeletal- temporal transformer for human action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.200368Z"},"links":{"cited_paper":"/paper/2403.09508","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:68a27091e7861e4f6295483a8da62c395184d75048f5fc17c1806720f6ae6dea","observation_id":"e9804787-4ff1-4e6c-a217-a69907e9f2ad","resolution":{"observed_at":"2026-08-12T19:27:10.200368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.918206Z","title":"Revisiting skeleton-based action recognition","venue":null,"work_id":"864e7850-c6d6-43b6-84b5-366373fdaa3b","year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.205656Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:cbd15adc4fc59ba23b7ea9f81c4089b5d63a435aa009d626e63c68318a526946","observation_id":"668de051-37f6-4865-8126-59f48ff282a0","resolution":{"observed_at":"2026-08-12T19:27:11.923558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.900739Z","title":"Skeletr: Towards skeleton-based action recognition in the wild","venue":null,"work_id":"360af612-6d7d-4d07-8804-93c2480044db","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.210748Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:52f468467eaa75d5ee6726446d86d57efa92b76aac2ad49fbbe33abd028de1e3","observation_id":"85e40ba6-bd3e-459e-85cb-f72d0ea50269","resolution":{"observed_at":"2026-08-12T19:27:11.906481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.879116Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"7b2e650c-dc96-4a72-beac-538d6aeca670","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.215795Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:8b88d41abaa640419712ba5c900b71b148935195fe9258c53f77b9553ff55f09","observation_id":"71b5a6d7-0ef8-40c8-b30e-fc3bae665fac","resolution":{"observed_at":"2026-08-12T19:27:11.887690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.863045Z","title":"Zero-shot action recognition in videos: A survey","venue":null,"work_id":"70425582-0780-482c-8aad-6f5ceeacc473","year":2021},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.220969Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:781690325baabea5a21df6a0530f6c5b94efd273bf75336097184833d36e81ad","observation_id":"6559d3e7-ef83-457c-8900-63af1fd5f55e","resolution":{"observed_at":"2026-08-12T19:27:11.868147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.846716Z","title":"Action detection via an image diffusion process","venue":null,"work_id":"a3aec1fb-23e7-4303-915e-0716536e15c4","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.225902Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:22f15232353a8da325037c50b65d86b46d3c02ec2133e0d126127c80f1d50471","observation_id":"21dceb01-d66c-4edf-987f-111cc0ce5472","resolution":{"observed_at":"2026-08-12T19:27:11.851860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.831070Z","title":"De- vise: A deep visual-semantic embedding model","venue":null,"work_id":"a94177c9-6b87-452c-8c6a-5011b7a15774","year":2013},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.230844Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:7e29b53b0ab586869fde80066fba183fbd804a9aafe318c033ef426e283f4286","observation_id":"7ed21759-2957-4b59-9ee9-ecbf82798f99","resolution":{"observed_at":"2026-08-12T19:27:11.835909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.814513Z","title":"Diffpose: Toward more reliable 3d pose estimation","venue":null,"work_id":"ee031ded-c408-4654-9278-c9715d558d9b","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.235863Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:17b7f0b5767b2bc1beab960c86c8fe8122fa1e483793a43a81ec7470f27e89dd","observation_id":"7d9f03c7-3821-4612-9019-796e9bc10083","resolution":{"observed_at":"2026-08-12T19:27:11.819943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.242239Z","title":"Syntactically guided generative embeddings for zero-shot skeleton action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.242239Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:4d8e76d8823e5075ce2ac82f807e6f998b3afd0ae66844acbdf7a70fcea5ad5c","observation_id":"e0b3a5a1-d077-40a7-9e21-1d1312f9acd8","resolution":{"observed_at":"2026-08-12T19:27:10.242239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-16T13:15:00.975439Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-12T19:27:10.252315Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.252315Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:ba36cbe917de40069286a2cc54cdfc3e3f8a8681cb034aa617eb47d5cb0fe9e4","observation_id":"ea05b4f9-d52e-4250-b9bc-72f41611cb75","resolution":{"observed_at":"2026-08-12T19:27:10.252315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.257639Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.257639Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:7652a2fec963e6161dac6b199c0298781bf2b9125948ab23699bc6b52a46036f","observation_id":"48f11fac-db59-4f18-b5ee-5c9e75110d03","resolution":{"observed_at":"2026-08-12T19:27:10.257639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.262938Z","title":"Deep metric learning using triplet network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.262938Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:c6e1ecaa5c6bb35517b4fe78c08e525c8658c33d3b4143c5dde2380889f4ed61","observation_id":"aa248ae7-53ac-4e4f-bc45-34c7e457ad53","resolution":{"observed_at":"2026-08-12T19:27:10.262938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.742813Z","title":"Diffpose: Multi- hypothesis human pose estimation using diffusion models","venue":null,"work_id":"76ba6b20-bf7f-4bb4-aeec-6b67a87072a3","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.268355Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:d14ae5296dea77e7fee2df6ab59fae1b2c11f2ec843274618f81c8685899c3f9","observation_id":"5e82b624-9bb6-4f79-8ab8-9576e64f0048","resolution":{"observed_at":"2026-08-12T19:27:11.748023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.726251Z","title":"Stablemofusion: Towards robust and efficient diffusion-based motion generation framework","venue":null,"work_id":"a00b74c7-2932-4427-b365-3e671daf2362","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.273457Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:233f11ab1f8039d239ec4873aeeffa6f30123c1b422ad1c20efd6493c38e4143","observation_id":"08246771-9301-4af8-bd8b-f9f98d143d74","resolution":{"observed_at":"2026-08-12T19:27:11.731777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.703351Z","title":"Learning robust visual-semantic embed- dings","venue":null,"work_id":"47516b66-6c8a-4d94-ace4-22e497d9dc94","year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.278734Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:29d1c6897452b6381408351365f8cfe69602d4c4c2e523872e3c8b06394c9381","observation_id":"a7135a46-710d-4395-8213-ca800de8ee54","resolution":{"observed_at":"2026-08-12T19:27:11.710446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.686352Z","title":"Open clip, 2021","venue":null,"work_id":"bb6e929c-8e14-469a-b810-c7b6d71fd5da","year":2021},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.283417Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:74469807eebea4233a04d38500619f3494bfa9884be0331428b2246dc5529b2f","observation_id":"db15281f-439b-490f-8acf-848b945750d4","resolution":{"observed_at":"2026-08-12T19:27:11.691370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-12T19:27:10.288110Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.288110Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:86ecf9dba5f825b6fad5294d5e4f506f84ea5795df23954e5df77344e1766fa0","observation_id":"ec6c86ed-9b2e-4615-86d5-4b1395b2add8","resolution":{"observed_at":"2026-08-12T19:27:10.288110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.670094Z","title":"Learning clip representations for skeleton-based 3d action recognition","venue":null,"work_id":"a389eab7-2fab-4983-9dbf-2ce7b9f18124","year":2018},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.295096Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:c55e4f3f03db860c8fbe228bb1d78fcd3830ffe63c8da02c5cf2658ae79535d3","observation_id":"7be8cde1-5cdf-4bf4-94dd-dd03dc39720f","resolution":{"observed_at":"2026-08-12T19:27:11.675352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T19:27:10.299921Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.299921Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:b31b029f7e5b418639efb43441add5df31ff2c4dbecaf530db2b69e2bb518fe2","observation_id":"cd4161ef-3761-4a4e-9727-7828cdee306a","resolution":{"observed_at":"2026-08-12T19:27:10.299921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.306445Z","title":"Human action recognition and predic- tion: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.306445Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:2fb0ddbb56ba23437977ed5752966c00bfbbb765e00b84c27b24eb49481ca4a9","observation_id":"b52ee182-1fe0-4654-829b-b52015ed9fdf","resolution":{"observed_at":"2026-08-12T19:27:10.306445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14336","last_updated":"2025-08-22T16:11:40Z","snapshot_observed_at":"2026-08-18T08:26:54.440752Z","submitted_at":"2024-09-22T06:44:58Z","title":"Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14336","snapshot_observed_at":"2026-08-12T19:27:10.311399Z","title":"Zero-shot skeleton-based action recognition with dual visual-text alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.311399Z"},"links":{"cited_paper":"/paper/2409.14336","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:d52e42cdd52bd414c673751c11f35845fc31e99160d39fc769788f0f20a14cea","observation_id":"8e7c4b23-b3bb-4422-a797-b6b2bf4b2750","resolution":{"observed_at":"2026-08-12T19:27:10.311399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.638701Z","title":"Leveraging spatio- temporal dependency for skeleton-based action recognition","venue":null,"work_id":"149ac515-aa62-47cc-a965-62f4f0ebb247","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.317183Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:d4a7d08bba541b87a683fe2ac7106c63df0a818cc088131b2ca5bbbfba7535de","observation_id":"c9c9325c-11a4-43d0-897c-21148bf6fb3a","resolution":{"observed_at":"2026-08-12T19:27:11.643816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.622738Z","title":"Hierarchically decomposed graph convolutional net- works for skeleton-based action recognition","venue":null,"work_id":"a4400e00-20e1-4d1a-a835-f89d329e4327","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.322202Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:468c2fa70392ea762883b5c2b6dfb840d5f5da44a57ac95b420acba35401b714","observation_id":"aed33789-d544-4f81-a54c-6aad5c4f3116","resolution":{"observed_at":"2026-08-12T19:27:11.628138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.327201Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.327201Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:113b5b8494b39646c655f51ffa90664517756637e30d2b38038fd93450c8509b","observation_id":"5e9dbe8e-f763-45e3-87bb-81b5684e4828","resolution":{"observed_at":"2026-08-12T19:27:10.327201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.333517Z","title":"Multi-semantic fusion model for generalized zero-shot skeleton-based action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.333517Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:3e651df018e857fcb9d92a364631aee5c54a8bb4d02c2707840ac50ab8c248ef","observation_id":"e08c6b7e-c4ff-4ab6-89c3-9407c3465786","resolution":{"observed_at":"2026-08-12T19:27:10.333517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.584003Z","title":"Independently recurrent neural network (indrnn): Building a longer and deeper rnn","venue":null,"work_id":"dabb3c17-e23a-4d3e-bb74-bbbad5a14140","year":2018},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.340699Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:a1b3ebc8e316c5add46986fc1c460bf34f20f65cc3ea3be07de744ba49d1f78b","observation_id":"ec6629fb-f27b-4c36-9653-ee9c13c26f81","resolution":{"observed_at":"2026-08-12T19:27:11.589422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13460","last_updated":"2024-07-18T12:35:46Z","snapshot_observed_at":"2026-08-18T08:26:52.879162Z","submitted_at":"2024-07-18T12:35:46Z","title":"SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13460","snapshot_observed_at":"2026-08-12T19:27:10.346206Z","title":"Sa-dvae: Im- proving zero-shot skeleton-based action recognition by disentangled variational autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.346206Z"},"links":{"cited_paper":"/paper/2407.13460","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:e0b026a5c3842c2752139db6c6d0eba077eb4c107107af78cbab84f5c2c9596b","observation_id":"671d4382-de63-4a72-8f5e-6f2e23856341","resolution":{"observed_at":"2026-08-12T19:27:10.346206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07475","last_updated":"2017-03-28T01:01:29Z","snapshot_observed_at":"2026-08-17T07:22:27.261327Z","submitted_at":"2017-03-22T00:22:49Z","title":"PKU-MMD: A Large Scale Benchmark for Continuous Multi-Modal Human Action Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07475","snapshot_observed_at":"2026-08-12T19:27:10.352922Z","title":"Pku-mmd: A large scale benchmark for continu- ous multi-modal human action understanding.arXiv preprint arXiv:1703.07475, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.352922Z"},"links":{"cited_paper":"/paper/1703.07475","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:56e8a6018b9124fe897f3162603f543ef47488695cc05f4da744232826bfbc63","observation_id":"fd993fa8-5dd9-494e-a22d-f9564a9fef87","resolution":{"observed_at":"2026-08-12T19:27:10.352922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.567178Z","title":"Beyond-skeleton: Zero-shot skeleton action recognition enhanced by supplementary rgb visual in- formation","venue":null,"work_id":"83fdb01f-32ed-465c-afdf-2a1eca43600d","year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.358232Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:a7d2c7d52d45ed84be939dec87534d2e9c82ae7d4b2039d897bcbb45915508f1","observation_id":"d26501a0-a505-4316-b02d-ebd625c2d086","resolution":{"observed_at":"2026-08-12T19:27:11.572286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.550699Z","title":"Spatio-temporal lstm with trust gates for 3d human action recognition","venue":null,"work_id":"36fe5026-1b23-44ac-88a7-3af84d34a183","year":2016},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.363851Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:eabf0abdc7b70215abbcd3b5a3580a85df6ddec007660dde45819a4c11906788","observation_id":"90b22c1e-914c-4123-aa7e-8e5e84c21b78","resolution":{"observed_at":"2026-08-12T19:27:11.556323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.533718Z","title":"Ntu rgb+ d 120: A large- scale benchmark for 3d human activity understanding","venue":null,"work_id":"cc7c3a2b-41a4-4dc1-8550-fcd71363bcbf","year":2019},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.368825Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:49f4722304a8742d37fa8bd8d6de8689bc32de9c37e91f1bab8844067d07a263","observation_id":"c67c3928-7b9c-4339-96e7-086ce9d4b188","resolution":{"observed_at":"2026-08-12T19:27:11.539636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.517344Z","title":"Disentangling and unifying graph convo- lutions for skeleton-based action recognition","venue":null,"work_id":"de40e56b-ebdb-4e7b-b9ec-005c8ccf4941","year":2020},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.374227Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:f198ef312832aba7973074c1be034b074e1156750179adeb8ee49f34226d8725","observation_id":"c9ef1e12-7364-4749-afd6-5504bc22de0c","resolution":{"observed_at":"2026-08-12T19:27:11.522505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-12T19:27:10.380168Z","title":"Sgdr: Stochas- tic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.380168Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:96a55cc5cfe0977730040e9027f637b6d5014fead7bdd599f50e2c068103cafc","observation_id":"b5b62cb5-d7bc-499c-99ae-6f604107a50f","resolution":{"observed_at":"2026-08-12T19:27:10.380168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T19:27:10.385684Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.385684Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:081ffe91e24bc10cb7e7f31944232d20495900be146d4fcdbfeac13982e308dc","observation_id":"a60eca15-74f9-4503-b8d9-9baf8451c615","resolution":{"observed_at":"2026-08-12T19:27:10.385684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.390658Z","title":"Igformer: Interaction graph transformer for skeleton-based human interaction recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.390658Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:385448b2f3a2a8068db9390924e86feb78dd4c0c23756a2cecdc6d1cbe34f2bf","observation_id":"9fc8de2f-6577-44a9-a750-22d3ca4931fa","resolution":{"observed_at":"2026-08-12T19:27:10.390658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.396924Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.396924Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:6583511906ac0e20f29b2129f3469348dba885c2b3251fa1ebacf146e8f7d26e","observation_id":"e3bd780d-8d0b-4281-80a3-792b824f6b0e","resolution":{"observed_at":"2026-08-12T19:27:10.396924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.401806Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.401806Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:d1f320857facb686fad42789b67541e5333a1c4f1b67815eafbae66d0c21be61","observation_id":"061569e2-4015-4dc6-842f-f18e354de062","resolution":{"observed_at":"2026-08-12T19:27:10.401806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.456875Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"62441410-28ea-4073-9652-051e71243ba7","year":2018},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.406974Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:1d0cd665e13d247530400bc4e63052817e20c3b260f677734acd64088f2a7683","observation_id":"ff58c1d9-4a56-4ab7-ad74-5bd6042105e8","resolution":{"observed_at":"2026-08-12T19:27:11.462425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.438415Z","title":"3d skeleton-based human action classification: A survey","venue":null,"work_id":"3e5eda2f-4966-44f1-babd-f8dab7798795","year":2016},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.412527Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:705efa09c5f9103eeec1e88605ca6c0467489d9e1b8d8cfa7de279bff7edd793","observation_id":"011a4668-ecaa-4154-8a8d-48dba7ecafb6","resolution":{"observed_at":"2026-08-12T19:27:11.444423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.417135Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"39a0266c-15ab-41a8-9502-6cbfc729439c","year":2021},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.417314Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:0a213ac03ff285c612d89cf4e5922a26d67c6186adaaaecfb8822b3264718c6a","observation_id":"12949ef6-8194-4c78-b802-1550fb1b926c","resolution":{"observed_at":"2026-08-12T19:27:11.423744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.422659Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.422659Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:0e323c9aafe34de42401c8426d115710e7d8999e77d2c0c95a57d39a87a74602","observation_id":"f443ed0a-d9b9-4701-9f68-e9b1eafafb2a","resolution":{"observed_at":"2026-08-12T19:27:10.422659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.379389Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"b77dffd0-a245-4df3-8527-834664e03435","year":2015},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.427873Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:c68bc9cd3533a4419f26063538d329078b20e57cc58b372a597163626e3910ac","observation_id":"4d216b1b-526b-428b-96ae-ff3de39fca82","resolution":{"observed_at":"2026-08-12T19:27:11.385455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.358583Z","title":"Generalized zero-and few-shot learning via aligned variational autoencoders","venue":null,"work_id":"cc89f5c6-439d-40cb-a86f-96d21cd7e76a","year":2019},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.432565Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:efe8b82d016ba7136d693f0377d1c2f2fd2f21c915159ba15c8e04da812e6372","observation_id":"46ba6be8-d4d6-4a1e-9c4e-c9f643ec4249","resolution":{"observed_at":"2026-08-12T19:27:11.364291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.437681Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.437681Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:cb066575c19bae8318b0fd019ddd835bdf54728b22b33a74513deab965aab153","observation_id":"c2c361c7-6197-4c15-9b8f-261558758446","resolution":{"observed_at":"2026-08-12T19:27:10.437681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.443231Z","title":"Ntu rgb+ d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.443231Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:077ad3287ed22e39a00d7215f722706f79a74924ac318f9b600741fd3f3fd388","observation_id":"d58bb60c-4ab4-4b4f-9631-5c7e9136e75b","resolution":{"observed_at":"2026-08-12T19:27:10.443231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.448512Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.448512Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:525c19d5b8beb04d7ecc613372212f9a6b4241907735c0fe8d95b8861a63f41f","observation_id":"0b34134c-1ddc-431c-920e-544241bc1509","resolution":{"observed_at":"2026-08-12T19:27:10.448512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.306322Z","title":"Human action recog- nition from various data modalities: A review","venue":null,"work_id":"830b9163-ba76-4591-bb2e-a10d2e74127a","year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.454789Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:a3621215316e0f90201e849e89572c7e9cedc531b353359e8252580d8eb577ce","observation_id":"0a7674d4-232e-4723-a0a0-7b7a3ec071aa","resolution":{"observed_at":"2026-08-12T19:27:11.311287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.287464Z","title":"Diffuse attend and segment: Un- supervised zero-shot segmentation using stable diffusion","venue":null,"work_id":"01831a81-41ed-4980-9efb-09a5aa35a50c","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.459785Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:fd8b3ade950022617c91e4005eda2be403e7c58197994464270e4f6425f435bd","observation_id":"91d7790f-df78-444b-bfcd-ecaa25684063","resolution":{"observed_at":"2026-08-12T19:27:11.294350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.267745Z","title":"Attention is all you need","venue":null,"work_id":"39acd12f-380b-4e89-8b30-1d551b0009ec","year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.464972Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:3ced5fe27447e77ce40437c88d79c1dbdef15b720943fcbeba0eecb79885fc51","observation_id":"dc35f0df-6908-47be-9729-06139e2c64ee","resolution":{"observed_at":"2026-08-12T19:27:11.273896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.243159Z","title":"Attention is all you need","venue":null,"work_id":"c32608cb-0b9f-401a-8207-f72645c0acd8","year":2017},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.470165Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:a21f86d6ac2b6120f3c20ebe6d174becd9650e131ccc20177b6475399d1c6b5d","observation_id":"29494870-9bda-48af-b105-b7f46e3ff652","resolution":{"observed_at":"2026-08-12T19:27:11.249681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.216009Z","title":"3mformer: Multi-order multi- mode transformer for skeletal action recognition","venue":null,"work_id":"727850a3-1123-4e5e-830f-7f8a59d4030f","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.475322Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:0d229973499c9ce3611e5e469a8d0a78cab71c22c835913a5ffd0918031d49ef","observation_id":"11fdbc58-6701-422e-afb9-cc760a9dbb96","resolution":{"observed_at":"2026-08-12T19:27:11.225615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.186886Z","title":"A comparative review of recent kinect-based action recognition algorithms","venue":null,"work_id":"6f16e0a9-6e7b-4a67-b851-d171bb2c2a38","year":2019},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.480328Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:eade7a1c7b56d93c32f6c709c2516e1a2a57a75b083e3f8778f384950f563714","observation_id":"46855347-1815-4816-9fc9-fb1db85121c3","resolution":{"observed_at":"2026-08-12T19:27:11.196727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.159594Z","title":"A survey of zero-shot learning: Settings, methods, and appli- cations","venue":null,"work_id":"3239798a-35cd-4b6f-b31b-753d4c81038f","year":2019},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.485177Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:efcf25e1774bf6f24c5d33113cd08d6103d67bc3ba1a08fd5184908b647c1bb4","observation_id":"80b9ea0e-e480-4581-9076-3c0a94faed04","resolution":{"observed_at":"2026-08-12T19:27:11.165912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.140432Z","title":"Recovering realistic texture in image super-resolution by deep spatial feature transform","venue":null,"work_id":"c7328e93-c711-4d34-b70d-6f69a661862f","year":2018},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.489735Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:66f2cc8f64b4deada11b487390bac9c1875f9f64cb3cfd6b0ce66a1a726f3e95","observation_id":"dfdf57f6-d801-4f53-b749-56007372da91","resolution":{"observed_at":"2026-08-12T19:27:11.146148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.122493Z","title":"Learning pyramid-structured long-range dependencies for 3d human pose estimation","venue":null,"work_id":"7beb4863-d473-426a-86b5-f562901d027b","year":2025},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.495479Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:ee200b59cf5216c48dc8dcf27ec13fdc3823afa549f3416e01321b06fe03d535","observation_id":"30ebbd71-a3ea-402e-92a8-89f736244696","resolution":{"observed_at":"2026-08-12T19:27:11.127972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.500426Z","title":"Fine-grained action retrieval through multiple parts- of-speech embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.500426Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:9727f90c1bedcc8455a0fbbec3d63793526c5dcc9d49065599d3515e287075ae","observation_id":"a3c58334-dfbe-4991-8d47-9cb75813f153","resolution":{"observed_at":"2026-08-12T19:27:10.500426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.082050Z","title":"Generative action description prompts for skeleton-based action recognition","venue":null,"work_id":"62028b4c-b63b-40e3-89a7-df383811fe28","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.505729Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:ff6043d399d8f3b90adf3eed34c61d41907f2659e5071ca3491de4a487e9d591","observation_id":"0061451e-bb41-423b-a37e-d03339f2dd5f","resolution":{"observed_at":"2026-08-12T19:27:11.087559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00639","last_updated":"2024-06-02T06:53:01Z","snapshot_observed_at":"2026-08-18T08:26:51.188422Z","submitted_at":"2024-06-02T06:53:01Z","title":"An Information Compensation Framework for Zero-Shot Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00639","snapshot_observed_at":"2026-08-12T19:27:10.511222Z","title":"An information compensation framework for zero-shot skeleton-based action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.511222Z"},"links":{"cited_paper":"/paper/2406.00639","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:8b8c68bfee3613ae61e2484ea95dc11f1e5ae7788db0b5024ea69dc0f06010ef","observation_id":"00f6ad30-a928-41c3-8f95-c90c3b315bc9","resolution":{"observed_at":"2026-08-12T19:27:10.511222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.061228Z","title":"Topology-aware convolutional neural network for efficient skeleton-based action recognition","venue":null,"work_id":"edd72543-1441-4a50-b498-b497de6f1358","year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.516285Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:c80477ebfb2d160b65631e9d4dc59492d04a9845e329d33ec54dbb69066b07d9","observation_id":"3b47356e-c786-4d31-818d-2d152ec1eb0b","resolution":{"observed_at":"2026-08-12T19:27:11.067650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.040459Z","title":"Spatial tempo- ral graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":"b7ca938c-57b4-446a-b71e-592882cbe8a8","year":2018},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.521112Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:e8520661fc7b5e7311ecb60defdd2fc65521bb2fe28c9da03910028bfababe0c","observation_id":"6af8a1d7-c392-4435-b4c7-b2d6d42d14de","resolution":{"observed_at":"2026-08-12T19:27:11.047737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17072","last_updated":"2024-07-17T00:10:24Z","snapshot_observed_at":"2026-08-18T08:26:58.613706Z","submitted_at":"2023-11-27T19:00:06Z","title":"IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers","version":2},"cited_work":{"arxiv_id":"2311.17072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17072","snapshot_observed_at":"2026-08-12T19:27:10.626502Z","title":"IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers","venue":"cs.CV","work_id":"5fab4667-6da3-4769-8dce-e1d5f5e56510","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.526648Z"},"links":{"cited_paper":"/paper/2311.17072","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:b7cf6ec16be5965d859e280ab37d31a237acf79ad76a4084790dee09f263902c","observation_id":"179a1de4-d284-4d19-95dc-87144c8b8b10","resolution":{"observed_at":"2026-08-12T19:27:10.634062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.532074Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.532074Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:359cd2c659a2200454a52025bc2cc7aa7d1657e4c8a2ac23a510cde737f66259","observation_id":"6ee95ddc-4fe5-4c5e-ab4f-f6e3f6bd5cb1","resolution":{"observed_at":"2026-08-12T19:27:10.532074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.002702Z","title":"View adaptive recurrent neural networks for high performance human action recog- nition from skeleton data","venue":null,"work_id":"5d807816-7635-4837-9aa0-a6f343a1c266","year":null},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.538181Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:d28c20c33d12ac319f84aa3b24a0bf39d14cc42054ba86afda3aa75a3e40ebf9","observation_id":"fe8d5baa-9bdc-4ed7-99ec-9c85b59fa986","resolution":{"observed_at":"2026-08-12T19:27:11.010000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.979246Z","title":"Learn- ing discriminative representations for skeleton based action recognition","venue":null,"work_id":"89a20a15-dfb9-4051-ad3c-4c8c6b00a5b4","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.542699Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:3d25cf33c45f22838eb48e15969c40164141561db39568b8ee9eb4d4e9fa7590","observation_id":"41bfdca8-7054-49a6-91f1-cfd00315c4a9","resolution":{"observed_at":"2026-08-12T19:27:10.986000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09590","last_updated":"2023-03-21T17:34:34Z","snapshot_observed_at":"2026-08-18T08:26:59.794663Z","submitted_at":"2022-11-17T15:36:48Z","title":"Hypergraph Transformer for Skeleton-based Action Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09590","snapshot_observed_at":"2026-08-12T19:27:10.547359Z","title":"Hypergraph trans- former for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.547359Z"},"links":{"cited_paper":"/paper/2211.09590","citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:7f47f76aba08d1c52408ecc396c7d1e14f022c5e69f84a9bf45efbf68e06eb79","observation_id":"b1e3a7d8-5971-464d-9559-821e2fd5025c","resolution":{"observed_at":"2026-08-12T19:27:10.547359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.955663Z","title":"Zero-shot skeleton-based action recogni- tion via mutual information estimation and maximization","venue":null,"work_id":"6892a6e7-f93e-4823-8be9-decd3fd4db25","year":2023},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.552090Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:7bc6de91b62d0b4aed77d1d0e0a96ef39c949b0dcd5bf86a1e61ddaced2152d2","observation_id":"ab0450cd-cd3e-494f-adb8-fca65a65aa1b","resolution":{"observed_at":"2026-08-12T19:27:10.962431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.934593Z","title":"Blockgcn: Redefine topology aware- ness for skeleton-based action recognition","venue":null,"work_id":"bb67c9b3-3b57-4509-9816-85777d6692e0","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.557031Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:4fed854e326e1ab68ced0e5ebc41f2a157af6da9031e3b57af11ad6834b46316","observation_id":"4ab524d6-da8b-483e-9b68-18dc24d61e5a","resolution":{"observed_at":"2026-08-12T19:27:10.939851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.916924Z","title":"Part-aware unified representation of language and skele- ton for zero-shot action recognition","venue":null,"work_id":"d31b86c1-8caa-4848-984c-d8021120b908","year":2024},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.561830Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:f0d697ae2180158c34fa2fd6ea6ffd35a112e397984a22f81cbcff90a1fa24d8","observation_id":"cc305c24-d733-4488-9eff-fc8decec9dac","resolution":{"observed_at":"2026-08-12T19:27:10.922631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:10.899582Z","title":"Co-occurrence fea- ture learning for skeleton based action recognition using reg- ularized deep lstm networks","venue":null,"work_id":"2c71916f-d118-4585-b8f1-3ccc7a1cf6af","year":2016},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.567596Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:19d63af029883ed38c0b7e9b67bc8b121f686e78704bcee9c77adbb542046e20","observation_id":"4043dec1-a6b3-4a30-88f7-b20684cf5917","resolution":{"observed_at":"2026-08-12T19:27:10.905707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:27:11.784725Z","title":"1, 2, 6, 7","venue":null,"work_id":"1c141ada-93d5-4fd8-9083-130fbc928eba","year":2021},"citing_paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition","version":4},"reference_index":443,"source":"pdf_text","source_observed_at":"2026-08-12T19:27:10.247238Z"},"links":{"citing_paper":"/paper/2411.10745"},"observation_digest":"sha256:40d4fb97e054f1000489860c9b8d2998d834a60c75c83673a304873f2ec3f921","observation_id":"fea565b2-fb3c-4b1a-97ea-9ce4475bcbd4","resolution":{"observed_at":"2026-08-12T19:27:11.790347Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10745","last_updated":"2025-07-16T11:28:48Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T17:08:00.538317Z","submitted_at":"2024-11-16T08:55:18Z","title":"Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":32,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2411.10745."}