{"as_of":"2026-08-14T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd518c24f581759b1fd1bdc15499b6ed6229118feadceaf29ce1137825530fce","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:44:50.965141Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.13808/citation-record","integrity":"/paper/2510.13808/integrity","json":"/paper/2510.13808/citation-record.json","paper":"/paper/2510.13808"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:44.695818Z","title":"Thinking with images, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:44.695818Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:a2619610a16808622f5b66ce91c8afc6b5a03ecc3b4d8972178f1f1901080cfb","observation_id":"703c74ad-0bdf-40fd-a576-612ff0538a68","resolution":{"observed_at":"2026-08-04T09:44:44.695818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T09:44:44.802882Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:44.802882Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:e1c737189983b514760e48012b42e920ff3f2ec616e55b5f708caa0845ff7882","observation_id":"3fa84e41-81e5-41b2-90b9-f9ebd3e2e573","resolution":{"observed_at":"2026-08-04T09:44:44.802882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-04T09:44:44.942510Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:44.942510Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:321f176e043ff9d37febfe9b9c8ec61e24b78338d3c66408529247edf05a6c09","observation_id":"5347d4a3-8a61-4f5b-8d5d-eacbc4be409d","resolution":{"observed_at":"2026-08-04T09:44:44.942510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:45.114367Z","title":"xgen-mm (blip-3): A family of open large multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.114367Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:5193e92a0cede184feb8fe575a891f328f6c7cfb48bbdab8b6e5afc16b65176b","observation_id":"dd10a2b4-2dba-47cc-9d04-db6d0ee37960","resolution":{"observed_at":"2026-08-04T09:44:45.114367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:45.284291Z","title":"Socratic models: Composing zero-shot multimodal rea- soning with language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.284291Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:cc1b8149ac194071fd210940714f60d700f070e2bc1cb336211f7e9c5e050f82","observation_id":"92163ffc-9d70-48ac-8fc1-a11a9b1faae7","resolution":{"observed_at":"2026-08-04T09:44:45.284291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:45.435292Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean Conference on Computer Vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.435292Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:3a52e9357324d123e6fee6ddf9b0c0d84e5cfef6208edefe38a59cc922836cb1","observation_id":"ed888a4f-484b-4e1e-af2c-f7f422d28372","resolution":{"observed_at":"2026-08-04T09:44:45.435292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-04T09:44:45.580737Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.580737Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:86432235629dc0821104ff0478b607114d4a569082ed078124fc80b1d3ea3656","observation_id":"e27b91bd-f254-44cf-a1a9-9939fb1c3a6e","resolution":{"observed_at":"2026-08-04T09:44:45.580737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:45.721037Z","title":"Ryoo, and Tsung- Yu Lin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.721037Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:e9ba70bc1f091f643c3c839f7e7d78b84dd1c1a29bbcde98e228242cdd1be242","observation_id":"ee02fc50-6892-439a-87d4-6324647577fd","resolution":{"observed_at":"2026-08-04T09:44:45.721037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:45.904826Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.904826Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:9ed80027dac2268f2f2a1efac8df8432e3bfda6eb65069b32dac50cf1e6f54fd","observation_id":"731e11fd-50a3-4db6-a776-4718e223b13b","resolution":{"observed_at":"2026-08-04T09:44:45.904826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.020920Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.020920Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:47f41277bfdc79e98f9a2f8f15fb9b1312cf1e6dbdf086f64249a03552af6cee","observation_id":"b98e510d-70ab-4803-9b9d-1a529ffe0993","resolution":{"observed_at":"2026-08-04T09:44:46.020920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.119853Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.119853Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:7b784e01b6dc2d209b6ad9845548b0ff07dbe8266426f20b86451d9f1a67fd16","observation_id":"0438d23b-29dc-4097-a7ed-9215bd13511c","resolution":{"observed_at":"2026-08-04T09:44:46.119853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.302660Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.302660Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:a43ca7284a6685019a0bef81838921ad26e26be17930102772aca75ba0033c58","observation_id":"2d80083f-a11d-42f7-b433-4dca7311ed2f","resolution":{"observed_at":"2026-08-04T09:44:46.302660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.421954Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.421954Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:4376d327b3d60300787425ea1da73c835534e8166f7a46bf9f4a64b6a43a48c3","observation_id":"eb838706-b226-4911-99cc-02e620c5c3bc","resolution":{"observed_at":"2026-08-04T09:44:46.421954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.502225Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.502225Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:aa5652d4e1a9f1d53c0fff6d71029d42700fb9e87f899eb08c34043385cd0aa7","observation_id":"ed10b1be-5ae6-4fc7-853e-f3e962310adb","resolution":{"observed_at":"2026-08-04T09:44:46.502225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.690847Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.690847Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:6158d1c227bc811c11c278eb5915c41d84739ec6bd74dd61b7e8efdcb55e6d41","observation_id":"9d0c5737-7e21-4090-a776-6cce7783a518","resolution":{"observed_at":"2026-08-04T09:44:46.690847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.821253Z","title":"Cinepile: A long video question answering dataset and benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.821253Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:42afbe50b7b076f4188d4cd4ec92ead558ef1c85934a6a474337afd88afb24c3","observation_id":"6d41108d-5aca-4786-80bb-73884693a5e2","resolution":{"observed_at":"2026-08-04T09:44:46.821253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:46.942298Z","title":"Is space-time attention all you need for video understanding? InProceedings of the International Conference on Machine Learning (ICML), July 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:46.942298Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:521a2ef1b6a081fb180660d9b1eae68952ad71825e4a25007153edaeaae52277","observation_id":"7953156d-0ae6-4d7e-8ad7-e2a80f007008","resolution":{"observed_at":"2026-08-04T09:44:46.942298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.098323Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.098323Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:443f4797c7b07ccb9e6cda3220b80162a85b291eaf7a688ddfb38a3f9fd84126","observation_id":"8db839ba-1d39-44d9-8644-febbdf9291ff","resolution":{"observed_at":"2026-08-04T09:44:47.098323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.204008Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.204008Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:b35778a33e3b29d1c9380d72112046d311f57dd400017cc0c7028481e7aae69f","observation_id":"bd8bd5ff-67ff-4883-95d7-b0b4a446bfc9","resolution":{"observed_at":"2026-08-04T09:44:47.204008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.321751Z","title":"Aim: Adapting image models for efficient video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.321751Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:4bff333e4c3a14a58f2df2eeec9804bab6d7430f696525ec5278f6e4079e5807","observation_id":"2345d0e5-69ca-4c56-9360-965e88d689ed","resolution":{"observed_at":"2026-08-04T09:44:47.321751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.479768Z","title":"Overcoming the pitfalls of vision- language model finetuning for ood generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.479768Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:693e73227ce91b49e79ca96908d38b452c64b0c7de034cde5e0c00ee04fa1b95","observation_id":"2d01dee1-66ea-4f8b-a6ff-7c34bced0fd1","resolution":{"observed_at":"2026-08-04T09:44:47.479768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.594715Z","title":"Vision- language model fine-tuning via simple parameter-efficient modification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.594715Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:a541bbf8b34b0e4e292a278fb5e76d3b2c8d538f379f468cb9f12d5d0d4e2ef8","observation_id":"7cce8824-06e1-4cf5-96ef-194973dfc908","resolution":{"observed_at":"2026-08-04T09:44:47.594715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.732506Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.732506Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:64c3be55f1052801b1f9f425a232f8c8b42dd34c73106774460560cbe6f77976","observation_id":"0e8ac2bd-34db-4e79-a892-f56c42d21e74","resolution":{"observed_at":"2026-08-04T09:44:47.732506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.848413Z","title":"Video swin transformer.2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 3192–3201, 2021","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.848413Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:b8913b64631ffd671a4f74a77e0c2103bbe3c6e9d3b221176a14de05f67885ad","observation_id":"1eb3cbb1-652e-4426-a733-35feb873af7f","resolution":{"observed_at":"2026-08-04T09:44:47.848413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:47.989069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:47.989069Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:e354fd1936e4850d87cb9c0b300b3bc1e42f931b71b97e0f1aab207ed0814759","observation_id":"3cba4304-3b6a-4786-8306-ec03f06328aa","resolution":{"observed_at":"2026-08-04T09:44:47.989069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.073445Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikołaj Bi´nkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Karén Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.073445Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:8360d5a2c86d63d61fed81f16702abe4f8d5c22d9c9637efb24a8bcaeec3c747","observation_id":"bf39505f-b5d5-462e-84ea-8653c103f11d","resolution":{"observed_at":"2026-08-04T09:44:48.073445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.193133Z","title":"Fusion of domain-adapted vision and language models for medical visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.193133Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:9b5d162461087d414778387c0cdb21bde7a9be7013b5b70977e1906e069dc86d","observation_id":"e43e9f4f-e94f-4afe-88c8-bb00605e6cb2","resolution":{"observed_at":"2026-08-04T09:44:48.193133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.274249Z","title":"Ryoo, Honglu Zhou, Shrikant Kendre, Can Qin, Le Xue, Manli Shu, Jongwoo Park, Kanchana Ranasinghe, Silvio Savarese, Ran Xu, Caiming Xiong, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.274249Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:7218baaa945daaa8e8ca2302f45dd88e86961ca23d932d4e51978f7099631fe1","observation_id":"2d6c48cc-da5e-40b1-b426-1d0db4bd8bf5","resolution":{"observed_at":"2026-08-04T09:44:48.274249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.411022Z","title":"Finetuned clip models are efficient video learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.411022Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:3a5c247d401ef34dc2e42ec9e531ff8954bb13342b51db8584debeca8c35b830","observation_id":"6ffeb72b-f20c-4262-bb38-97926e745109","resolution":{"observed_at":"2026-08-04T09:44:48.411022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.474795Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.474795Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:7f01cd8c15a9460c3e7ea5907fa12b5c029ce87537a15161da6d2d8d8a37664a","observation_id":"f7a88768-743a-46db-b621-68d364b46111","resolution":{"observed_at":"2026-08-04T09:44:48.474795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.524319Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.524319Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:d7aa5ac9c6f5d3276667631c1fca3b67186a9823cf4187cf8dd8fcfe4ca6c363","observation_id":"cd45331a-3824-462b-b964-8453fe39cbfa","resolution":{"observed_at":"2026-08-04T09:44:48.524319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.626790Z","title":"Visual-language prompt tuning with knowledge- guided context optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.626790Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:935e4d5891dbd2107eeebb0c103a4c059c774ecd5e5b6dcfcf51a49e68ce3236","observation_id":"ba1b7fb0-a1c5-402e-9230-de2f5f689cf6","resolution":{"observed_at":"2026-08-04T09:44:48.626790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.704116Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.704116Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:4babe6dc61c54fce1ed93c87cdc27cb88d45850cc9a8579a766be02328d7de52","observation_id":"5d6a533d-0a5d-4f9f-bfa6-484eba016fea","resolution":{"observed_at":"2026-08-04T09:44:48.704116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.805476Z","title":"On domain-adaptive post-training for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.805476Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:396d985c6e8a89f15b2da492508129e63ccf5d75411bef5d1b89c6fd78785bff","observation_id":"c254138b-8778-4437-ad37-f91c40ae2657","resolution":{"observed_at":"2026-08-04T09:44:48.805476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:48.875216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:48.875216Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:661d653d9a7463841f722513c5c7091648186ad8859b7081b9960e9050833531","observation_id":"72584479-cbe5-4b20-ac57-f90012f8e66a","resolution":{"observed_at":"2026-08-04T09:44:48.875216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.032642Z","title":"Llavidal: A large language-vision model for daily activities of living","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.032642Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:cc33a2115933335bb0daf8cae9c1e9f062a5f11e35323dbecdf5975621fbec5d","observation_id":"4d5f8f65-81cd-47d5-be42-1e57e3bab511","resolution":{"observed_at":"2026-08-04T09:44:49.032642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.092729Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.092729Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:9c00c95c5c8e599ff2a42431ab180a29203e5bebae1fefc3521a5d4f4033dbb6","observation_id":"eea5c746-c53e-4855-8090-c92daa703f02","resolution":{"observed_at":"2026-08-04T09:44:49.092729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.152203Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.152203Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:c50fdb0efc3d1c667522c515ecd33e797ad9b3b13f88fd9c2154d55bfc9f07b0","observation_id":"cba64c5a-d775-44d0-9055-84d17570ff1d","resolution":{"observed_at":"2026-08-04T09:44:49.152203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.258254Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.258254Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:0ab9f87855a659603ae67a966c05bc31c7fe434cb616f7afab55fab9e2f15b90","observation_id":"2356a3cb-984d-442c-a650-2133a2114045","resolution":{"observed_at":"2026-08-04T09:44:49.258254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.306602Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.306602Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:eba461d6ee73270722737382b9bb63dbb78508d72d09221af7d338df62eac662","observation_id":"8a76d039-9da7-4f66-9b87-337588268ab5","resolution":{"observed_at":"2026-08-04T09:44:49.306602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.418322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.418322Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:23c74ecf8f681932c7b01d11c0a29fcd6c61711b58fa1f0bdbceb3b65538cbcd","observation_id":"9b48874e-5625-435b-8025-d4447f24fde7","resolution":{"observed_at":"2026-08-04T09:44:49.418322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.535653Z","title":"From my view to yours: Ego-augmented learning in large vision language models for understanding exocentric daily living activities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.535653Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:215c0bb5005bb49290980b0674ae1cc6ea340375d6a4a7152169e987011ab38f","observation_id":"85c45f6a-4bd0-4d03-9e82-a930608e22fb","resolution":{"observed_at":"2026-08-04T09:44:49.535653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.589103Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.589103Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:954ec21b39e8d279c45db6238e927a64c6001ef5d3fe4f2d7895d52eafab86e7","observation_id":"889de24a-01e2-47bb-8d9f-c647e51b9421","resolution":{"observed_at":"2026-08-04T09:44:49.589103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.700819Z","title":"Vima: General robot manipulation with multimodal prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.700819Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:73ac95e1bd0ba77ab6d58bea0357fc39b949ca740971484030d589a47d0974ef","observation_id":"a2e3786e-38c0-4edb-b7fa-325de65507eb","resolution":{"observed_at":"2026-08-04T09:44:49.700819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.777926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.777926Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:b259bebc5c14e42fd664a557d68a85ec6a0437926e685f9f56e2c96fe6ddf30b","observation_id":"4f4cd366-8ca7-48f2-a15d-76c755a24c24","resolution":{"observed_at":"2026-08-04T09:44:49.777926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:49.888970Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:49.888970Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:62cf2f2a2e1477ac020697612b90c1f0a6e4d4b870e3a63aca6c45feb7e94ec7","observation_id":"520aedaa-1907-4e17-a493-5a2fa1ef0193","resolution":{"observed_at":"2026-08-04T09:44:49.888970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.010830Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.010830Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:62f16a18370e4eb667a25c35fb8cab3dfbb731f4530d7605ee00191913a9d1c4","observation_id":"16bee8ce-67c4-466a-b3cd-22101435a773","resolution":{"observed_at":"2026-08-04T09:44:50.010830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.090316Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.090316Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:5d526f5d8129af9be86ba2be9479063d21254084aa64127e398f30bc5f760cb8","observation_id":"2338c354-6ad5-456e-bb39-f6b3928ffbfd","resolution":{"observed_at":"2026-08-04T09:44:50.090316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.170468Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal large language models in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.170468Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:12575ac12eeee5ab2b3746f07d59f92ab59be98c06f122336f48ea3db05e70e8","observation_id":"167acb43-5eb7-4d4b-b6eb-60226a32dd53","resolution":{"observed_at":"2026-08-04T09:44:50.170468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.237677Z","title":"Toyota smarthome: Real-world activities of daily living","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.237677Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:78ea07b74bea5316e5366cc7da7ede36f39f0e574fcf7244b649e3cc3fb0ef84","observation_id":"c5a9ad19-db59-474a-a511-7e57ad6b1db5","resolution":{"observed_at":"2026-08-04T09:44:50.237677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.365277Z","title":"Sigurdsson, Gül Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.365277Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:77d5fd65da08f6e8b53b5ed383325133e19196f6af973aa434901e52f761f188","observation_id":"d5da6090-b0a0-4783-92be-d4f377fa44bc","resolution":{"observed_at":"2026-08-04T09:44:50.365277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.510994Z","title":"Lemma: A multi- view dataset for learning multi-agent multi-task activities","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.510994Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:035731a1c51a635e2cdf272e25822e7acaaef76ca4d8c6260b562396aaca7e07","observation_id":"46374306-4d2d-4cea-a22a-3dc8184c17ad","resolution":{"observed_at":"2026-08-04T09:44:50.510994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.665501Z","title":"Toyota smarthome untrimmed: Real-world untrimmed videos for activity detection.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.665501Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:ecec422f269dacebb055f3f3c8f570145e00ff0ce63063d583ac1b4891463844","observation_id":"82eab911-937f-4ef1-ad36-ce4e4b3d5f3d","resolution":{"observed_at":"2026-08-04T09:44:50.665501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.805308Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.805308Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:e76fd5ff4f1be156e60d059d8d7515b82b9ef79d2d64e0039b88b4696f666885","observation_id":"f9b593c0-f945-42dc-b6bd-5918f1372bcd","resolution":{"observed_at":"2026-08-04T09:44:50.805308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:44:50.965141Z","title":"Place the carrot on the plate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:50.965141Z"},"links":{"citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:938d4030d8bed64d6de146465d9636d4928443c6099a605f755b114ac7fb9943","observation_id":"f4673158-ce69-4f31-92c7-f9e615754da7","resolution":{"observed_at":"2026-08-04T09:44:50.965141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2510.13808."}