{"as_of":"2026-08-15T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7803559ad2240bd265426e6fdb622b2dde8e289048858916b1dcb5c9dfe51c9","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T14:07:39.892672Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.05962/citation-record","integrity":"/paper/2603.05962/integrity","json":"/paper/2603.05962/citation-record.json","paper":"/paper/2603.05962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:d1c15962e81306c04a628643a93a08a631cb874de3f4adaf3c6c45f0441f6734","observation_id":"0b75b2e5-1c3a-41ef-b654-34161a5a6193","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:41afec0f5ff8b088348864caa8e7f9a2f1dcc4efd0630a5b1d439a362e1a3251","observation_id":"16f48e47-3aa3-4e18-b672-e4c201c07bc8","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:d4254743aa9e99b3daca54319c275799be78400c3d4291004f926fd0cc230df2","observation_id":"92c9d89a-73d8-4c1b-ac04-65fb376299ef","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Flava: A foundational language and vision alignment model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:86a6f619d701a136172c8fcdc3c88b09b858a7aabe6807a3430663208a530f60","observation_id":"611b93f7-047a-4f4e-93b2-bb6f6c8d3918","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01133","last_updated":"2024-09-02T10:11:52Z","snapshot_observed_at":"2026-08-14T20:36:11.901202Z","submitted_at":"2024-09-02T10:11:52Z","title":"Large Language Models Can Understanding Depth from Monocular Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01133","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Large language models can un- derstanding depth from monocular images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2409.01133","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:cb723742cd88953b2a1c997740b641e10b25af0d774a7c19324172833de9b1bf","observation_id":"0fa5598e-b729-4188-9b37-d89559577fa9","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:916161d66d223035bb45488fcc3e00ff076daead8849142756536aef5c57227b","observation_id":"b723cfb6-611a-40cd-8b77-87c161635084","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Pad: Self-supervised pre-training with patchwise-scale adapter for infrared images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:68b01d55795d43d42cfc55c9d35dfa5e815a473fe3294d5a8eebadb67887f2f5","observation_id":"111a5061-44b3-4a7b-b6f5-f05989653757","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02801","last_updated":"2025-04-03T17:47:06Z","snapshot_observed_at":"2026-08-15T09:41:58.310939Z","submitted_at":"2025-04-03T17:47:06Z","title":"F-ViTA: Foundation Model Guided Visible to Thermal Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02801","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"F-vita: Foundation model guided visible to thermal transla- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2504.02801","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:2376a617e1bfd12bb9e0cf318b3c74e30c6223c8dd1a2492be3136f24f9618ba","observation_id":"4d44a9db-978a-4e93-a2e7-8b5f2b33831d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f611bc855a1e72ea8364f5f0a9fc67aa2f03f7b0b4442c2bf87d2fe83178c382","observation_id":"cb6d7a1b-7ea7-4cf0-8a8e-490e188954be","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e33f7e4a37cc7539b898d09e0c699f06e7d7a9335233720d6a71adbb27d0ae1a","observation_id":"a1a9f6db-c3d4-4f08-a9f3-795658efce97","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Omnivl: One foundation model for image-language and video- language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e21df94167fb2ff50b2f696059577f6dce9478ed1e283000db524dd3171df0f8","observation_id":"5cd75477-a027-4bc3-a3bb-406a26e6666f","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"P2p: Tuning pre-trained image models for point cloud analysis with point-to-pixel prompting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:525423ebd6e725870cb38ce224da526f0fd0b6de3dfba5040bc190dd96ef9697","observation_id":"2488037c-a727-417a-86f3-ba826fa6122d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Pointclip: Point cloud understanding by clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ac9edb106aa24f3fc3986b9e2d2e3f2dbf1ab70904966dc15c292daf8ea50f55","observation_id":"8ff34b17-245a-4985-b3c0-d6a3df311583","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Diffusion models as masked autoencoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:7036979bb025988c44b5cb83094cdbc2aaaca4985f98ee4cb9718c6537337f6b","observation_id":"e8ed976e-f73d-4c0e-a362-3c5a0ec23c39","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hierarchical recurrent neural network for skeleton based action recogni- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e7c6be05c1d62abb6250a302583077c8e2fad8a5b070357d66d8bcc04437172b","observation_id":"e2978196-0f8b-4c2b-8286-b08a02d76dab","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton-based action recognition using spatio-temporal lstm network with trust gates,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a5280f4529165c2d76e15d4c22ac45698109f168cecefa189db24cdbfd37c864","observation_id":"5523ccd9-7c6d-4732-8217-9691868bda82","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"View adaptive recurrent neural networks for high performance human action recognition from skeleton data,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:95be2b30effb50bb6e2f4347f639d4bc05c723f1b53f502b46029efbeb40d438","observation_id":"796176f6-e6ad-4eae-a3b5-6aef00f31692","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton based action recognition with convolutional neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:4325be059e9c82869cc5e3031da9532bed0df68b798cb25dcce2eea65a90ae39","observation_id":"20f3bb99-eea7-42ce-890b-d1798d643c43","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A new representation of skeleton sequences for 3d action recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:eed3376539b2f77709b0bee437a7def27d45f4678930edcbb71ea77cde8ec454","observation_id":"15bc7c7d-9e61-43b4-955d-1681751aecb2","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Co-occurrence feature learning from skeleton data for action recog- nition and detection with hierarchical aggregation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:9d9ad687db86b669fd252a354da8e99e927ca5721eb836d805b919fb47ea26a9","observation_id":"2e481554-1aec-4c89-a9af-94710de46594","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Spatial temporal graph convolutional networks for skeleton-based ac- tion recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:59cedeccf557b038121de855cb8d6aefa695037826343524a6fd4d4db6a9769a","observation_id":"35da2927-a66f-4c57-8013-ed70c2d900e5","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Two- stream adaptive graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:9d1658ab350e02a6d1a25b33a84257c794f542f9e1b9a869a4935ea9e66fcc28","observation_id":"3b0ed4d5-9bcd-4331-8754-fc6dbfa591b0","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Channel-wise topology refinement graph convolution for skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:beedee68c9d4e068c25fd1aca3b48c02e8e07db25a68d9378554285cf23d509a","observation_id":"685c5728-0bbd-42f3-a779-efdebabb2314","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Stst: Spatial-temporal specialized transformer for skeleton- based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:545d992d8e1a4122aebc82a643ae918ce0285d76f8a40f4ffddddd502f088147","observation_id":"0dd03cef-bd49-4e90-8736-0dc1cf81cf84","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hypergraph transformer for skeleton-based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3af9c45f52d6bed284f8b681661144936eb95cf9cb25f8b23b8e6e567ab0f750","observation_id":"40655a0a-789d-48f3-841e-4af85e150dc8","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"3d human action representation learning via cross-view consistency pursuit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ed60d25dcab33190d4526b3ba01484a3393ac6ee5ff255389eeaec7f19f25109","observation_id":"0e4e9a83-972a-4ea9-bee0-aafbbdb67098","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Contrastive learning from extremely aug- mented skeleton sequences for self-supervised action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:7501437ea16485be41a111b692cacd091f7a29ea0bf3f57e541fac92247e7df2","observation_id":"ff3fe65c-ac7b-4946-866c-0cf3d22890f4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Contrastive positive mining for unsupervised 3d action represen- tation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:d2b1183cff04cb1069b3e337efdc4a2b0e02fe78347196866bf6ce78e337e7b2","observation_id":"36cbc4a1-ebc3-4c8d-9e15-b43af9bbe8e0","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked motion predictors are strong 3d action representation learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:86eca7db5044cf05fc9155c4376e5ba1ae9e0579df8d3714dd5607def8ecd4d6","observation_id":"d7610019-3dee-4acd-ae89-32d6669e20f4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Macdiff: Unified skeleton modeling with masked conditional diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:96c8dae1df3c1c3daf8deb36508cacba5bd2b89a91495f208dcf8b10be149aaf","observation_id":"e1b9ff96-6b20-470d-83d8-866757908ec9","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeletonmae: Spatial-temporal masked au- toencoders for self-supervised skeleton action recog- nition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:fa9643ce30ee1f6eabe7d46cfa63ef04d3b75623412853ef873f749d699cd1f3","observation_id":"8e3d93a3-9fd4-44d4-ad14-3bc87e06cc2c","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Momen- tum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:672b588bd73d434c1c94563cd08e006c8cb200afce8930e452ba5dcf038d520d","observation_id":"c1d1644d-adc5-4f5d-9dae-0c4a96b9cc1a","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:8e97363464e9a0dee72b06c5677e9bf3fd959a28ac7f5a17581376aa8985c783","observation_id":"bc34bf90-a585-42aa-b5e5-4d1c071e875b","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Spatiotemporal contrastive video representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:155c7c197b396a323de42f00afe30d2f8891dcf52dd6c4d14387fd80316f1597","observation_id":"2d1cac2a-ec23-459a-ac93-88679ac68309","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"BEit: BERT pre-training of image transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:e6b7ac018b792dc0fffadf73a31a711c1e6aeb3ac0d58a7452affd31c5711d30","observation_id":"a1e20b50-8770-416c-9a95-5c0ebfe960be","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Masked feature prediction for self- supervised visual pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:9594fbbd8c45db8cc6734042edc6fc623055f3b28c79b806b603c784b7266f2f","observation_id":"963da4a3-adcc-4625-9d6d-06b317d49c95","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Dynamic multiscale graph neural networks for 3d skeleton based human motion prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:4f9eb2f0a3ae45431560b04dfa8533dcd896fd1638fcf944c1b6dd3c8452ab06","observation_id":"d72f2d0e-9b95-4758-a0ca-4fc926622d97","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Exploiting spatial-temporal relationships for 3d pose estimation via graph con- volutional networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:fa5aabbef7592873126e67d30e1a01b31caa0750bc15c780d98f7866f0093f04","observation_id":"45bf7f52-8a73-4808-89d0-3ae3b0957aa4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03993","last_updated":"2021-11-07T03:50:50Z","snapshot_observed_at":"2026-08-15T06:06:08.449424Z","submitted_at":"2021-11-07T03:50:50Z","title":"Multi-Scale Semantics-Guided Neural Networks for Efficient Skeleton-Based Human Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03993","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Multi-scale semantics-guided neural net- works for efficient skeleton-based human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2111.03993","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:53e5ba2ff80a1c185a9330ea84bfa4fbe0a091e0ad6cad284d3c500cfaa5caff","observation_id":"e7fc133c-520b-4a72-8b5e-26dd6b02075d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skele- ton cloud colorization for unsupervised 3d action rep- resentation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3c4d97616439632e33ff8ddd212b4a36db0804451e02bb3f59faeda09832136d","observation_id":"d86fc034-19a8-4dd6-919a-b288fbf868cd","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Collaborating domain-shared and target-specific feature clustering for cross-domain 3d action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:24a050a542a25064e4148284c3f50a873bafb17395e91a4ee4e998e90d3c1c4a","observation_id":"954ff6b5-b7a8-4f83-9fd0-fb72b4f4c071","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:6f9defe80f512c2e1afb4212bb39e570819b1655c216967dfe2a0371d23dfccb","observation_id":"ad617174-7455-431d-a686-caf1be3f010a","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ntu rgb+d 120: A large-scale bench- mark for 3d human activity understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:6f6f41498ed93c410a0bba2bfc55d67824e727bbb9cbb4c5c4719f9ca18bce51","observation_id":"740dac90-8092-4db9-8de0-d5d43b59df45","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"A bench- mark dataset and comparison study for multi-modal human action analytics,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f58cadd1e0fe76690bb3f7193e61588ac93437d77254d3ab0060308ed6a51fc4","observation_id":"ff22536a-2572-415b-b8c0-3906f6120615","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Cross- view action modeling, learning and recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:90074ecf5ce8f9b5623d5e0a2d23582ef926f965b749c3409be02a36625fb7af","observation_id":"f5abd89c-e6a2-404d-9f42-56e41e5d601f","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Toyota smarthome: Real-world activities of daily living,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3e825847da0499a366bc28d8e49ec785bad750b0ad29bcb07f83e79d58402bc6","observation_id":"d2685dd8-9338-4a53-9c5f-5a8340194899","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Semantics-guided neural networks for efficient skeleton-based human action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:6b6ffde95d4b4000f5086605cbcb064f47d89804d240c91387b252d43c29c411","observation_id":"e3c34f84-7f86-4f64-bbe4-10bc643a5541","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton-based action recognition with shift graph convolutional network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:37ce7c1c5619a4ed39c167f59fd99653f17f6eb88a18ee82614ff2287c40ca0f","observation_id":"07840b59-f146-4267-82a8-24f6ea7549ab","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Unsupervised representation learning with JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 13 long-term dynamics for skeleton based action recogni- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3d9f3467ba7a47de162abdc517e95914452765ce88e6ae602b778e290944e264","observation_id":"b3831f3d-0de6-44a6-a7fa-d9684c4d738e","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Predict & cluster: Unsupervised skeleton based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:a9993292274d9731ea3b0e7444a78b95748359586600bb45cabf83d626b0f0a2","observation_id":"a4dc1a56-1fcd-4595-93c2-7a8bcba78426","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Ms2l: Multi- task self-supervised learning for skeleton based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:abc822cd2fac47b85ec50087ab18a11f00874f4d988d359429c9fd7febff3646","observation_id":"366592a3-c611-4679-9308-2319924da831","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Skeleton- contrastive 3d action representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:3814f9c1d4e579a3ba3f9fcc4cb49cdbfda41607535395739a38e6c31f325500","observation_id":"a19d53fe-c254-490d-9dd5-be4d7fee82b3","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Global- local motion transformer for unsupervised skeleton- based action learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:b5c4469b2685a7651e9bc5e8aef0011056a08bb366b1fbf85462af4ee9a274a3","observation_id":"802284f4-345b-49f0-ac4c-5ccd63fcca5c","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Cmd: Self-supervised 3d action representation learning with cross-modal mutual distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:0e0aa139a3e622e321a96267e1f85893cc320ae890f641f6e76e43dba6744152","observation_id":"7e277e30-1c62-4f1d-9927-ac0c2ce9a2f2","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Actionlet-dependent contrastive learning for unsupervised skeleton-based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:07889a7f7425c0a69afde42e705c52b7e39c5be9844c3007095dc7deaa0061a7","observation_id":"c8c519ac-761c-4d41-afd3-011be7da6b74","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Self-supervised 3d skeleton action representation learning with motion consis- tency and continuity,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ad33e14132f1c82d893bb3a99cc4820217f055d755b364afa95650b5656de10d","observation_id":"90aecfd8-ccd5-491b-92e3-9ecb43fed72d","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"View-invariant skele- ton action representation learning via motion retarget- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:507c76e8f0f080080d7787ec883ee954f88cc9569bd94004ea608c354b66b661","observation_id":"6db2b46a-de0f-4d0c-ba3b-f61c51bc18c4","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Hierarchically self- supervised transformer for human skeleton represen- tation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:4c9e8613253492e8ee494bbed25373800222be56d8ead85d9ffa8c66e5b8bb2e","observation_id":"d3d46f76-0065-48ac-8b8a-6ff8312fb83e","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Adversarial self-supervised learning for semi-supervised 3d action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:acaf1c0e1f42e63b79d017ecf30172c9ce1a6c4b4d51aa60fb30c89f4e88f952","observation_id":"c66f9d00-dc82-41f9-aac8-616cf56e6707","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08580","last_updated":"2021-07-19T02:00:28Z","snapshot_observed_at":"2026-08-15T09:04:57.516201Z","submitted_at":"2021-07-19T02:00:28Z","title":"UNIK: A Unified Framework for Real-world Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08580","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Unik: A uni- fied framework for real-world skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/2107.08580","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f87f8acd6908c916626d342d2ebac91581fe54ef2c988caa10a17a0db6cbaffd","observation_id":"3d8de597-38e6-4b43-a71f-51f897f56250","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:11653f5c2ed75fc7a8a3593a367a480cfc3297552a695d7147ea2413ff6dcf9b","observation_id":"0d29d8a5-a399-450c-a9ac-72ec1b85f4ca","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Layer normal- ization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:ad311b16cd632e0dd33dc38487420c0606ae872fcacd15d8a401d788396f811a","observation_id":"074e8d82-25c1-415f-b0b8-120a18f04c28","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:f5e0f9ad202be7bd242c596d70fbc385b0396f3573505ba474bf9537c1c607fa","observation_id":"1649a5a0-0926-4997-bedf-1ebce901ada5","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:07:39.892672Z","title":"Lcr-net++: Multi-person 2d and 3d pose detection in natural im- ages,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-15T14:07:39.892672Z"},"links":{"citing_paper":"/paper/2603.05962"},"observation_digest":"sha256:82fd768ed422352d0b7471da1c3663f8e2641f728e9907c3885ed9a9d041d5e8","observation_id":"9cb9a11b-b15b-47ae-9fe5-27f1c93b65f1","resolution":{"observed_at":"2026-07-15T14:07:39.892672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.05962","last_updated":"2026-06-23T00:17:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T19:22:05.151637Z","submitted_at":"2026-03-06T06:53:32Z","title":"A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2603.05962."}