{"as_of":"2026-08-18T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44d4bf1619c7d10537d1b1f00ef524ff053e0a7a8fa25484946b418f4bf1e795","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:16:15.771212Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18675/citation-record","integrity":"/paper/2507.18675/integrity","json":"/paper/2507.18675/citation-record.json","paper":"/paper/2507.18675"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.358659Z","title":"Leveraging Vision -Language Models for Improving Domain Generalization in Image Classification","venue":null,"work_id":"fad80222-39ae-4ada-a1f8-bc79f1646831","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.602955Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:6364840f035f70335f9d21251194133fb419cc8abbb4e39fd734b9457ca55068","observation_id":"5c906201-ce95-4b06-8361-e5bf22231b03","resolution":{"observed_at":"2026-08-15T18:16:16.363661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.343507Z","title":"Are Visual-Language Models Effective Action Recognition? A Comparative Study","venue":null,"work_id":"70dcac25-610d-49eb-8303-68977620f1ea","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.608943Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:25217c8693df5ae2142e863f1b00e75eab612aa669965101436be0af6a35fb9f","observation_id":"b42e8a9c-025b-42ac-a052-645e77104a56","resolution":{"observed_at":"2026-08-15T18:16:16.348253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.328433Z","title":"Vision–language model for visual question answering in medical imagery","venue":null,"work_id":"ba140b66-0d97-479e-b63a-e1dc8c4b8d01","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.613602Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:4b8a7d11acc5f51fc9d6b2eca4a185d09649babd4bf7b238a4a3f3d876b616ba","observation_id":"5091d515-2eca-4f6b-b38b-2a0d3f6841d2","resolution":{"observed_at":"2026-08-15T18:16:16.333516Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.312559Z","title":"When deep learners change their mind: Learning dynamics for active learning","venue":null,"work_id":"44076912-f5c8-4cab-adb6-5c2cef233f22","year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.618379Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:8896da66515fda322b3437b74567f80cbffde11baf90b1f939c16725a1a4c35f","observation_id":"c64017ab-cd13-4b9a-a5f9-3f23b1f9ff1f","resolution":{"observed_at":"2026-08-15T18:16:16.317730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-16T13:49:00.762109Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-15T18:16:15.623253Z","title":"An introduction to vision -language model- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.623253Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:57d23fc0bc264c1135817f5b108510e20371bfbecd379b0364af4b8a3616de96","observation_id":"7116ff25-bad7-432e-913f-b73209cc6692","resolution":{"observed_at":"2026-08-15T18:16:15.623253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.295394Z","title":"PracticalDG: Perturbation Distillation on Vision- Language Models for Hybrid Domain Generalization","venue":null,"work_id":"67943d21-0c08-4095-937e-55da6d12a744","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.628962Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:dd0f2d036dfa6eb07d641ccdc8b8c796ecda77a0097bc5d511a2fd8f89dab248","observation_id":"5a18d4b3-1509-478e-b4d8-5816046489a7","resolution":{"observed_at":"2026-08-15T18:16:16.301352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.278834Z","title":"Pub - medclip: How much does clip benefit visual question answering in the medical domain?","venue":null,"work_id":"9f058bce-cfb7-4880-816a-b77a5b06051f","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.634590Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:9adb4a21e4a428e7c80c412d9ff4e45863dd112dc5df9da3e41a30a779becb3d","observation_id":"4cb39969-b1da-4a9e-a20f-d0374c62e8fe","resolution":{"observed_at":"2026-08-15T18:16:16.284660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.263886Z","title":"Clipsyntel: clip and llm synergy for multi - modal question summarization in healthcare","venue":null,"work_id":"1de13576-253c-4179-b4b5-4df1953baaa9","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.639482Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:ecc1d538c502d1d5994c8860fd4c65f56bd0594db8b8ee5b8b48a8af8bcd6c25","observation_id":"a01ce183-c5e8-4d54-9b26-c00771e8b294","resolution":{"observed_at":"2026-08-15T18:16:16.268728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.249274Z","title":"Learn2augment: learning to composite videos for data augmentation in action recognition","venue":null,"work_id":"c4a71da5-201a-4c0e-827c-280cc18c3061","year":2022},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.643907Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:a15ac98e2327a86b85746a1e96273cb851251609048587a56becac6c3b5a6aec","observation_id":"8599834e-4962-45b3-afce-5fc894760d96","resolution":{"observed_at":"2026-08-15T18:16:16.253854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.234315Z","title":"Class-Specific Noise Injection for Improved Road Segmentation","venue":null,"work_id":"ca5a5564-d827-46a5-bc5d-4eedc3d5fdcc","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.648059Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:d307b3bd88e8d84f26bce3f00abe8d1ae0f3c71d77276c04c4b36909fbb8208c","observation_id":"99c5f218-63d8-4483-a43b-e727a90ef1ea","resolution":{"observed_at":"2026-08-15T18:16:16.239299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.217692Z","title":"Temporal Modeling Approach for Video Action Recognition Based on Vision-language Models","venue":null,"work_id":"f75508c8-699c-4b0a-a4c3-135d9de68db3","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.652509Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:ee38654d5b2b7bfacc5390d7c8f40035072ec5b9e2dbe908260c234a415f499b","observation_id":"9c393a4b-7fef-4d1f-aaf6-e1540c4185f7","resolution":{"observed_at":"2026-08-15T18:16:16.223687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.202139Z","title":"Perturbation- based methods for explaining deep neural networks: A survey","venue":null,"work_id":"ada6a66f-ef65-427a-8593-505bbe3f0d55","year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.657146Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:a5fed40d179887b433bb521ba6c668c6e871266751302534f7a3cacf0fdbaee9","observation_id":"e05f7981-d6fa-474f-97f9-3828fb363c00","resolution":{"observed_at":"2026-08-15T18:16:16.207039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.187143Z","title":"A dversarial attack on yolov5 for traffic and road sign detection","venue":null,"work_id":"3d2d4b97-5e95-4a8b-aa18-f516246351b7","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.661596Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:933f64ee28eefb16cf50c61fcaf4966181bd337cbed917e538cf8f63f6febaf3","observation_id":"a1a36eec-d4d2-4eaf-b7f6-39708a0b1ad7","resolution":{"observed_at":"2026-08-15T18:16:16.192083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.171600Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"fc9a31d8-a229-49bf-8152-c968e7b2daf4","year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.666027Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:b653685fe012e387ae3223e95d6e1c688f32ab4c5585e2e65b59f42f8b51674e","observation_id":"2814c903-1eea-4b62-8ec2-a39b84838e12","resolution":{"observed_at":"2026-08-15T18:16:16.176666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.155467Z","title":"Language augmentation in clip for improved anatomy detection on multi-modal medical images","venue":null,"work_id":"b147c2a8-51d6-40cb-9328-c1534eb9f029","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.670475Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:c2c595e994b8cb70362ecfb816005bcce272dd05694e099e4e9489705e09f9ec","observation_id":"e99755b9-7c87-4a02-8f9c-c7eebdc838d3","resolution":{"observed_at":"2026-08-15T18:16:16.161183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17944","last_updated":"2024-07-18T10:31:53Z","snapshot_observed_at":"2026-08-16T14:39:25.611075Z","submitted_at":"2023-11-29T02:17:27Z","title":"PALM: Predicting Actions through Language Models","version":2},"cited_work":{"arxiv_id":"2311.17944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17944","snapshot_observed_at":"2026-08-15T18:16:15.964830Z","title":"PALM: Predicting Actions through Language Models","venue":"cs.CV","work_id":"b5e1ec56-552b-411d-bfe7-82083c490148","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.675732Z"},"links":{"cited_paper":"/paper/2311.17944","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:0bfdc7c183070f3ae68792b08839b16c18e974ef1efb9d5299e92638b1149ad6","observation_id":"c0a9211b-c188-4843-a68b-8cbbf12409c7","resolution":{"observed_at":"2026-08-15T18:16:15.971825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-15T18:16:15.680772Z","title":"Segment Anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.680772Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:18abee5ab9c4fa10a52f6142883ef1ae4e4ed5d064ca9f10b1c4754ce0d8f842","observation_id":"2a182daa-20e5-425d-a840-eb420f81bad6","resolution":{"observed_at":"2026-08-15T18:16:15.680772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17956","last_updated":"2023-11-01T07:10:23Z","snapshot_observed_at":"2026-08-16T14:48:22.025365Z","submitted_at":"2023-10-27T08:05:21Z","title":"Qilin-Med-VL: Towards Chinese Large Vision-Language Model for General Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17956","snapshot_observed_at":"2026-08-15T18:16:15.685735Z","title":"Qilin-med-vl: Towards chinese large vision- language model for general healthcare","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.685735Z"},"links":{"cited_paper":"/paper/2310.17956","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:42c8085e94279d3ac4a69d7da993c6b234082837d05d31f37f7e78a31a94f55b","observation_id":"6e691084-371f-4eee-9828-7132922ec243","resolution":{"observed_at":"2026-08-15T18:16:15.685735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.140774Z","title":"Enhancing clip with gpt-4: Harness- ing visual descriptions as prompts","venue":null,"work_id":"c5cde655-119a-4e09-8e01-65bf9a4a1133","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.690697Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:0e990a1911319e9155f9ff3b86260dc8cc38d106f30924679b2d3b822960573c","observation_id":"57251939-f85f-4b06-908c-fd9499ee11db","resolution":{"observed_at":"2026-08-15T18:16:16.145623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.125542Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":"c31074c3-044e-4bec-9f8f-320e407bce9b","year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.695366Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:ddf7ca36a7f2a8ead09f49f541e9ef62b0e8e024a92497a6d7e764b409d0ed57","observation_id":"da2b2fb5-34e3-45a8-afb0-7628970b5995","resolution":{"observed_at":"2026-08-15T18:16:16.130369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-18T12:32:09.276205Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-15T18:16:15.699872Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.699872Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:c03f316d71ca9f9452a142d9d1a1a234920f75d945f9f262f6f7cddeee212d48","observation_id":"7f484ea5-da3b-4100-8470-099fa43f2cb0","resolution":{"observed_at":"2026-08-15T18:16:15.699872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-18T14:41:48.442811Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-15T18:16:15.704561Z","title":"How much can clip benefit vision-and-language tasks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.704561Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:12fc7126ca7bfe85542899e15a7320f595b06037b3dbc6c5d0da915da382c820","observation_id":"331a88c7-9971-4d18-8149-35d44671dac7","resolution":{"observed_at":"2026-08-15T18:16:15.704561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.110059Z","title":"Test-time prompt tuning for zero-shot general- ization in vision-language models","venue":null,"work_id":"63dcc319-e409-46b0-a0dc-859d3c44f0bc","year":2022},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.709612Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:ce1adfb817c8d771965a5eba27f709e0952091bf2d9e170e2c9085b36770f96c","observation_id":"ddf7199f-94ae-4eed-86a3-d5d6845f63a9","resolution":{"observed_at":"2026-08-15T18:16:16.115214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-18T14:40:03.298908Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-15T18:16:15.713836Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.713836Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:aff64ca551efdf5613d1a597b62bcc8f84d26798aa3f2b7e0c34a074cf3d8ed3","observation_id":"bf7884b7-6150-40d6-b059-befcade4fa8c","resolution":{"observed_at":"2026-08-15T18:16:15.713836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.095583Z","title":"Motionclip: Exposing human motion genera - tion to clip space","venue":null,"work_id":"52e3e554-227f-4ab4-ac97-7b6475c0dcb6","year":2022},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.718612Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:1ba1760fb2efe6b92537d5ef2c81907f31810325cffb62c46bb44ae8765135a4","observation_id":"b738c268-606b-4352-b927-1ba254d6912f","resolution":{"observed_at":"2026-08-15T18:16:16.100219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07971","last_updated":"2025-05-07T14:26:09Z","snapshot_observed_at":"2026-08-16T15:24:11.802554Z","submitted_at":"2023-06-13T17:59:59Z","title":"XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07971","snapshot_observed_at":"2026-08-15T18:16:15.723157Z","title":"Xraygpt : Chest radiographs summariza - tion using medical vision -language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.723157Z"},"links":{"cited_paper":"/paper/2306.07971","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:d1836be10e2de3176dce6c792cb022f21e706e9280f8f9f2ab387851329e7f7a","observation_id":"0b0f2520-2a16-4ca4-b37d-d030f0fcd319","resolution":{"observed_at":"2026-08-15T18:16:15.723157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08911","last_updated":"2024-05-14T19:06:24Z","snapshot_observed_at":"2026-08-16T13:52:41.743576Z","submitted_at":"2024-05-14T19:06:24Z","title":"CLIP with Quality Captions: A Strong Pretraining for Vision Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08911","snapshot_observed_at":"2026-08-15T18:16:15.728021Z","title":"CLIP with Quality Captions: A Strong Pretraining for Vision Tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.728021Z"},"links":{"cited_paper":"/paper/2405.08911","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:b4b75f73f9902951a4a6f30fbc01535dfa1ff6d75f1c475e98a0de36cc8a2ddf","observation_id":"e3929c2c-f003-455f-b096-1c14574783e1","resolution":{"observed_at":"2026-08-15T18:16:15.728021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-15T18:16:15.732959Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.732959Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:a047c6ad64e813678379da13b30ba4f42c293ba04c573493afbd25b5f05c4946","observation_id":"315d1def-45df-424e-974c-f6743b83bf3c","resolution":{"observed_at":"2026-08-15T18:16:15.732959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.079595Z","title":"Actionclip: Adapting language-image pre- trained models for video action recognition","venue":null,"work_id":"71bd5afe-2e85-4955-a297-47314f95b928","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.737740Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:7b04070e90d2e7474f5e4653fa83e14e8bd3876b3727609e1d7962e0f8536373","observation_id":"8dbdee37-4579-415f-b08d-0d3b788052dc","resolution":{"observed_at":"2026-08-15T18:16:16.084863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.062410Z","title":"Incorporating Scene Graphs into Pre-trained Vision-Language Models for Multimodal Open-vocabulary Action Recognition","venue":null,"work_id":"393cbc8f-9bb8-402c-a856-b4f6c3063be0","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.742143Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:a493d1729ecf8921e9bb4ec6ed1abf2fe37a49be8d2c0714d9a17ed4577f90da","observation_id":"d57a36ad-9822-466a-87d4-44028a193620","resolution":{"observed_at":"2026-08-15T18:16:16.067933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-17T19:34:59.417167Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-15T18:16:15.746661Z","title":"Clipself: Vision transformer distills itself for open- vocabulary dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.746661Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:4828d38f422a3f19460046bb64d93379eb3e0a92424003d39412ecc384801727","observation_id":"088b7585-9ecb-44ad-bdeb-4998e8802493","resolution":{"observed_at":"2026-08-15T18:16:15.746661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.046919Z","title":"Revisiting classi - fier: Transferring vision-language models for video recognition","venue":null,"work_id":"2319d130-2743-48c1-88ae-07d3efd62bb6","year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.751782Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:5b8a4bc95f536049ceca5edb07df8df42c38b51603496a36de683c494b400dfa","observation_id":"ba183e20-0401-4f89-9bb3-aaceb3f15e20","resolution":{"observed_at":"2026-08-15T18:16:16.051759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.031540Z","title":"Investigating Compositional Challenges in Vision- Language Models for Visual Grounding","venue":null,"work_id":"c6efa030-2670-4fad-bcc9-e34a5fdbc43c","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.756446Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:a09683d3bc3e125bd1641bd7f543c69564a7c0b6438854b3f7227a17b1a4036c","observation_id":"e8df1d71-a006-40a7-aed9-07546bda48d5","resolution":{"observed_at":"2026-08-15T18:16:16.036514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:16.015787Z","title":"PeVL : Pose -Enhanced Vision-Language Model for Fine-Grained Human Action Recognition","venue":null,"work_id":"b867e79f-9ebd-4299-9dff-29430d7fca95","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.760727Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:6c87171b00d342d864cd5766a616608f2393e90e39b701040817368ef9645572","observation_id":"9bd7a2d6-847d-41af-9280-a3edbb1c6d6b","resolution":{"observed_at":"2026-08-15T18:16:16.020935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:16:15.999709Z","title":"Vision -language models for vision tasks: A survey","venue":null,"work_id":"2268f427-b55b-44e9-b6d8-e070e0434a2e","year":2024},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.765144Z"},"links":{"citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:55428c81682ed8f0ccd602972912eafd107963330b5790ca0b5c90f8326382e7","observation_id":"88089a6f-6aff-4ae9-978b-d96fc226bd36","resolution":{"observed_at":"2026-08-15T18:16:16.004907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07353","last_updated":"2025-03-26T13:32:28Z","snapshot_observed_at":"2026-08-16T14:35:27.100627Z","submitted_at":"2023-12-12T15:21:57Z","title":"CLIP in Medical Imaging: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07353","snapshot_observed_at":"2026-08-15T18:16:15.771212Z","title":"Clip in medical imaging: A comprehensive sur- vey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:16:15.771212Z"},"links":{"cited_paper":"/paper/2312.07353","citing_paper":"/paper/2507.18675"},"observation_digest":"sha256:f6d1436c3d50ec517b0acb95f9edbcbc8d092db1f375dfa087f6d87199b1e1ca","observation_id":"c828b911-0368-4390-9f3a-ef08f5229124","resolution":{"observed_at":"2026-08-15T18:16:15.771212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.18675","last_updated":"2025-07-30T20:14:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:40:32.514725Z","submitted_at":"2025-07-24T13:13:28Z","title":"Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.18675."}