{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a701e68040f04e822a7d218582712aba8fe271bb3e789d8a48065c7e5922585b","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:04:38.641568Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08887/citation-record","integrity":"/paper/2506.08887/integrity","json":"/paper/2506.08887/citation-record.json","paper":"/paper/2506.08887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.099416Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"3066ff7a-fc50-4a48-a8ba-4058a7a948a7","year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.504246Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:efebb0d774581bafbfd628b78c946f788b53e63f404ebb2d675eca943aeb9661","observation_id":"69266413-019c-46c6-9327-ef3c60df9862","resolution":{"observed_at":"2026-08-07T05:04:39.101686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.093662Z","title":"Vqa: Visual question answering","venue":null,"work_id":"3151278e-62ad-4277-b98a-8e829ff3d45e","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.507071Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:99146b7745bc3a1aa953aa48d0c7091094f9d7cc2e01eb61cdb51839e1a179d6","observation_id":"8819666a-0375-46b3-b42a-42f9bb34c443","resolution":{"observed_at":"2026-08-07T05:04:39.095804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.087712Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"379c6afe-0763-4837-a653-779f63be6c95","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.509532Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:08980d3cd4d0fb4745b45b0e15e090cdae0235359bc39b84fdcb70f2e6b9ce4e","observation_id":"4628a9ca-b838-4b54-b7ce-56bd9964f1c3","resolution":{"observed_at":"2026-08-07T05:04:39.089994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.081119Z","title":"Cross modal retrieval with querybank normalisation","venue":null,"work_id":"73a03b12-9a63-463d-9061-68112ab7c610","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.512142Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:b60baabb87f64b6101c3887eee9f473bfcac62e6135ebd82b282adb7ace787f7","observation_id":"0b308772-8625-4b7a-b330-03ca9c3b1748","resolution":{"observed_at":"2026-08-07T05:04:39.083821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.074602Z","title":"RAP: Efficient text-video retrieval with sparse-and- correlated adapter","venue":null,"work_id":"3c8c3d20-8ad8-4657-ab4f-58aeadbf022d","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.514579Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:1407a99708bde979a79792ef372d79ba376abd5676f80ebd25468dfcccefb34e","observation_id":"dc198174-2b83-4f14-a585-9fe2ece5a579","resolution":{"observed_at":"2026-08-07T05:04:39.077014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.068169Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition.Ad- vances in Neural Information Processing Systems, 2022","venue":null,"work_id":"30f8513f-3cae-4145-a265-f1cfff0d04a2","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.516855Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:2a01360df310df173ee315b737c4201be177c8f0c25652e32b9195244ca5cb45","observation_id":"b5ee4d76-0774-4ee6-9b80-77e60927dd13","resolution":{"observed_at":"2026-08-07T05:04:39.070737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.062123Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset.Advances in Neural Information Processing Sys- tems, 2023","venue":null,"work_id":"c0c7b4af-cbc8-4776-944f-6ac02b1ea0a8","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.519656Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:94e49c9c3eb05fc30add1516acca3066e22ea431e80a12f7ab1eaef9efedecba","observation_id":"23c14efb-88db-425d-b8a0-770b3f7f91d7","resolution":{"observed_at":"2026-08-07T05:04:39.064336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04290","last_updated":"2021-11-22T09:35:30Z","snapshot_observed_at":"2026-08-02T03:10:09.409839Z","submitted_at":"2021-09-09T14:10:43Z","title":"Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04290","snapshot_observed_at":"2026-08-07T05:04:38.521872Z","title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss.arXiv preprint arXiv:2109.04290, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.521872Z"},"links":{"cited_paper":"/paper/2109.04290","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f467bbf771f9e9967138dbf99b331c519590c4ea08a8251a58468523230fb875","observation_id":"32d8a49a-cd82-4d9a-ac3e-fd9236325f46","resolution":{"observed_at":"2026-08-07T05:04:38.521872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.055866Z","title":"Prompt switch: Efficient clip adaptation for text-video re- trieval","venue":null,"work_id":"5c3c9b4c-edc7-49f9-9413-b18935ae80c0","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.524699Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:509f01ca291b4bbc29eaa39dd1f335e95a1c20dc6f0746accafd0be4814d9385","observation_id":"f48e58cb-3cbe-4924-ba15-f4b2fe443d8c","resolution":{"observed_at":"2026-08-07T05:04:39.058173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.049025Z","title":"Acnet: Strengthening the kernel skeletons for powerful cnn via asymmetric convolution blocks","venue":null,"work_id":"1e009285-dabb-489e-b43d-cd35fb7d5cf4","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.526766Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:0ee7696a5cc3f009d2bd6bac9646b2b10c63da355cbf5106c10f4939cd56f0d9","observation_id":"97dfb5ab-823f-42b0-a475-1ea517437e7a","resolution":{"observed_at":"2026-08-07T05:04:39.051684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.042470Z","title":"Repvgg: Making vgg-style convnets great again","venue":null,"work_id":"19842ed0-3501-4a58-bb60-0a5f62a6eff1","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.529008Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:c82533ccceee9bc3b85b03e67a093c52cb820e84faf3dbee1932c305fa23d986","observation_id":"41a91c59-7797-47da-890b-a138a5bbbdcf","resolution":{"observed_at":"2026-08-07T05:04:39.044688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.036038Z","title":"Improving clip training with language rewrites.Advances in Neural Information Processing Sys- tems, 2024","venue":null,"work_id":"52872c65-6d75-4831-b20d-7ceb67ea04c1","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.531373Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:d12a9673edab1ff4ec56e252c6438609d1a2f90507d2eddf99219cdf542106bb","observation_id":"1a91173e-b2c3-4f50-a64c-20c3fbbf3af1","resolution":{"observed_at":"2026-08-07T05:04:39.038445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.029574Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"dc06819a-0437-4d5d-b247-9fe7b124bc4c","year":2020},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.533670Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:612969414e40eee78071ff4e25c064cc7cccf62bc4d58f6d8793e18151fd8ed8","observation_id":"32c04091-3f0f-4b2c-8cd5-ef0c393c6c98","resolution":{"observed_at":"2026-08-07T05:04:39.031867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.022945Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval","venue":null,"work_id":"49f07794-fc77-4887-a188-4012ffecb3d8","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.535876Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f14415a31c006cc343138e9edcc8d65dccc6917bb472ee8171fd6e7dc2a178b5","observation_id":"9f8a736e-eac1-4dc4-acbb-27e3224e3cfe","resolution":{"observed_at":"2026-08-07T05:04:39.025277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T05:04:38.538033Z","title":"Accurate, large mini- batch sgd: Training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.538033Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:5cc296a0be60322cd0a55ae416c747229e5c693a9eac6dcdf22c8e18db59225d","observation_id":"093d98e5-9f5f-4bc0-af90-1ad33cb684ec","resolution":{"observed_at":"2026-08-07T05:04:38.538033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.016375Z","title":"Framewise phoneme classification with bidirectional lstm and other neural net- work architectures.Neural Networks, 2005","venue":null,"work_id":"dedfd61f-d50a-479d-b6f8-c054424a83b4","year":2005},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.540500Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e0d26cd289c61b2e5d57f994e78a5aed14b6f94cff3f0e3255785b36f1b932a4","observation_id":"55a5bf61-fbbc-45a9-8b9b-848a786f3dde","resolution":{"observed_at":"2026-08-07T05:04:39.018752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.542644Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.542644Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:4a97e293d2c1e8f37083d80b3c95a52d403a1efc69039decfc5121005e6d301f","observation_id":"57571e0b-2ffa-47b9-996f-bb3704489bd4","resolution":{"observed_at":"2026-08-07T05:04:38.542644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.005692Z","title":"Secret: Self-consistent pseudo label refinement for unsupervised domain adaptive person re-identification","venue":null,"work_id":"7c67bd42-dc1f-41ec-8d2a-a03b721f2b12","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.544754Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:daf7ed3959563a505717b4b2e0a3bf88e3bea1e63b8d30a58985cf8827069e77","observation_id":"63af92d2-9708-40f8-bd12-91613cb213f3","resolution":{"observed_at":"2026-08-07T05:04:39.008141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T05:04:38.546950Z","title":"Gaussian error linear units (gelus).arXiv preprint arXiv:1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.546950Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a2b87058b1a6d47e08a56b97d652f1d727289e226e394bfe84615c1f5cba6cd3","observation_id":"3e4554c0-31bb-48be-b182-ab87fffcf3f1","resolution":{"observed_at":"2026-08-07T05:04:38.546950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.999111Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"398e632d-8cbb-4a8f-81f3-59d97427abdd","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.549128Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:67fcedc6cd79f6f1888ee8a7f174ae34d47ffe2f7a25c07f9652c5393183b3da","observation_id":"82e4b745-76e2-4cf8-b463-6c323e630f29","resolution":{"observed_at":"2026-08-07T05:04:39.001674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T05:04:38.551012Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.551012Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:796c83a9ebcc4d6f82af7280a4c0208a78be42c49d83311f9d46d225b3673b0a","observation_id":"6625c00c-b459-4507-a833-94e918b277d1","resolution":{"observed_at":"2026-08-07T05:04:38.551012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.992073Z","title":"V op: Text-video co- operative prompt tuning for cross-modal retrieval","venue":null,"work_id":"3a6bbd1b-846f-4206-b9bd-6990bc6e7b7f","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.553091Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:d4e2fdbb4987f4b177023ce8b188745dd81b91bf6cbc9d5b327d35f716777ecf","observation_id":"0329a248-4f29-4b20-8274-a3a2a8f55253","resolution":{"observed_at":"2026-08-07T05:04:38.994442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.985583Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"8befc7e4-7fb1-4af7-a268-adf578ab0921","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.555136Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:5b626b1b9e474bef91de17f9266dba23b96af6278bbf5de2e519f930e610ff1e","observation_id":"1c1c649c-d85c-4583-90dc-8678cbbb7fbd","resolution":{"observed_at":"2026-08-07T05:04:38.987864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.977870Z","title":"Video- text as game players: Hierarchical banzhaf interaction for cross-modal representation learning","venue":null,"work_id":"12984ad9-b86a-4203-8003-144b9c3d9580","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.557171Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:4cfcbb0c76d8d545c4de36f7a126318a59b517608f9f2a31fdc13f90cdde349f","observation_id":"e48bacc2-7389-4021-ac23-3c6a801563a9","resolution":{"observed_at":"2026-08-07T05:04:38.981161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.970350Z","title":"Mv-adapter: Multimodal video transfer learning for video text retrieval","venue":null,"work_id":"dc406a7d-59d2-4261-af0b-22d47ce77637","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.559599Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:cb6407464334d7e745ab4a76183a13e12542836bcaec4dbbfee78a85c4cda34f","observation_id":"c79fb09d-18d4-46c3-8db5-a85b3247de15","resolution":{"observed_at":"2026-08-07T05:04:38.973336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.963618Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"326abadd-5380-456f-93ad-a43e2692bb57","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.561792Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:12e124a13cd9a1f03a917322df21273c4c6b455fed5f961e91df13374162b426","observation_id":"903f48d1-5eee-4799-b8b3-5b30427eb340","resolution":{"observed_at":"2026-08-07T05:04:38.966127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.956834Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"15844ece-9377-4fb3-97b3-41b06d54ea41","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.563869Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:de5938922e559bbc80c5ae6f744672036def200d7acced399402d68a8defda82","observation_id":"66598c33-e1f8-43e7-8b1e-b96415f926ba","resolution":{"observed_at":"2026-08-07T05:04:38.959199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.949514Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"7c439413-1e57-4f6b-ae5e-5c6ff26e7065","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.566045Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:36c7dcaef3f9673a72a149ffec3358dabc6f02b0059d402db2aeb003825ba61e","observation_id":"e1b60c54-ab64-4a65-b8c8-ddbdc45a349a","resolution":{"observed_at":"2026-08-07T05:04:38.952290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.941608Z","title":"Dense-captioning events in videos","venue":null,"work_id":"42f366b0-0d1e-4e1e-a2bf-73991fb712ad","year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.568125Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:c58e3b485a01ca5f91e7a1d24e458056ae47029d4e45d010945464c74fc01e88","observation_id":"be6e81ff-b0a4-4c84-96dd-753df8724479","resolution":{"observed_at":"2026-08-07T05:04:38.945206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.570005Z","title":"Courier Corporation, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.570005Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:2858e88b80a3a0970f0a6813c6f0e5ab593fdb545b6b12e28e632c8ab957f8a9","observation_id":"37d14fd7-c852-4144-b417-c8a86a2965dd","resolution":{"observed_at":"2026-08-07T05:04:38.570005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.930151Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"1c5ed20d-4972-411a-9196-2bc11ee25c3a","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.571998Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:bb7cf5926e8c68de53e23ad9292d11ba54576b02f32d2e2d4e7c052ef936ce39","observation_id":"0a4cfc7b-c815-4033-bf1b-934abdf1bb8f","resolution":{"observed_at":"2026-08-07T05:04:38.932510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.923165Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in Neural Infor- mation Processing Systems, 2021","venue":null,"work_id":"37ec0590-f7f9-4e3f-b693-75794cbc0143","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.573993Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:9910b63788b75612e12e0c9b79578bc396179fb126095cfa11995de90493c5f0","observation_id":"92789e07-17c7-4199-bb2a-94da68badea5","resolution":{"observed_at":"2026-08-07T05:04:38.925580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.576455Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.576455Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a9dfae6e98816bff45e8292abf0cd98ce5bb335a9b5048781a473290c1dba3f2","observation_id":"6669b5e9-2724-497d-9548-25bcd1d9e577","resolution":{"observed_at":"2026-08-07T05:04:38.576455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.911887Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"2d923333-4041-4437-82a8-494cb250b428","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.578756Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:fa12957201637dff22c814c28b3b463e2be8aad500b3452b0cbad8e57d172f17","observation_id":"472df5ca-6f3a-4ae8-8f94-535037418fd3","resolution":{"observed_at":"2026-08-07T05:04:38.914431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.904416Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"dfdbb8ae-7501-4f53-aff4-e1a84b44c0d0","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.580758Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6499532bc182a655e256dbc45a3effdbe07a7b1a47b22dd803903459c7f5d70e","observation_id":"2470c477-442b-4551-8d82-6811e1f69e24","resolution":{"observed_at":"2026-08-07T05:04:38.907185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.897567Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"b34ec202-057f-4e37-8c27-ea17bb263b2e","year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.583189Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6bb3364d4b7fbca3ee950c5a52f0f3b79ac4cc1bbd21594e68cc22786df2f313","observation_id":"c4330bd7-a4c8-4b56-b714-198727c40189","resolution":{"observed_at":"2026-08-07T05:04:38.900181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.890414Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neu- rocomputing, 2022","venue":null,"work_id":"e065e1eb-a5f9-4a9c-8769-2f4f05016afd","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.585284Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f7bcb4ff2786e992d918807ee96bbe44d3b917b2e18e17473ada59e2afb2eaa5","observation_id":"e6db3627-e858-42d0-b83d-3907c87c4145","resolution":{"observed_at":"2026-08-07T05:04:38.893052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.883654Z","title":"Ea-vtr: Event-aware video-text retrieval","venue":null,"work_id":"7a984df3-bcc0-4e23-97cc-9e5f7dcdcb5d","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.587649Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:805de32ae782a3251c86f5b4d8307f9f4bc041f1a13a1fb02367690c39af48c3","observation_id":"d1a8c765-90e9-45e0-8f5a-0a79c9e6f4c4","resolution":{"observed_at":"2026-08-07T05:04:38.886181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.876394Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"164c2d54-1b1d-459f-9d3e-9f6170c37ef8","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.589815Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f2e07984248a2a42674ded931b3815ab3f9eb864c25d064f2c8e286a24951f6f","observation_id":"675359d4-1a39-4b9f-b23d-8ee148482d73","resolution":{"observed_at":"2026-08-07T05:04:38.879247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T05:04:38.591729Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.591729Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:7bc7447558d1c00838f21d6eafe0c56a4e9c3d236c2dec10538ee046d23c59ef","observation_id":"cb69a46c-7eb6-4721-ab43-ac139614fd12","resolution":{"observed_at":"2026-08-07T05:04:38.591729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.594112Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.594112Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:8011ce6f0e9c53b8b8a9b1cb14dc8277516473e584515aae71c1b417ef511683","observation_id":"e4603b17-f9ba-4280-bf00-2e3f29eb956a","resolution":{"observed_at":"2026-08-07T05:04:38.594112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.865086Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d092dad0-b9da-4738-9b92-974859ddaabb","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.595898Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:d3f204447b5b50e95424181d250bcfe517accb5035636cc71250f1ad246d583d","observation_id":"f5a8f1e4-476f-4dbb-aadf-fa421504ecd9","resolution":{"observed_at":"2026-08-07T05:04:38.868194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.857033Z","title":"The long-short story of movie description","venue":null,"work_id":"b9fc4706-4fdc-4ed8-91ae-6bbd715e474d","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.597925Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e564007b00a7ae7d028746e063d4be8b479171eaee332e5017134396af948ffd","observation_id":"3ddc66e8-4b1c-40f1-a540-51cc0dec58eb","resolution":{"observed_at":"2026-08-07T05:04:38.859860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T05:04:38.599960Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.599960Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:42f559a46644d05608c3b91dab1aa7f1f3c4001ef17baa28329ba772827883f7","observation_id":"20943e42-6839-4b62-ad48-600cbe32f003","resolution":{"observed_at":"2026-08-07T05:04:38.599960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.849734Z","title":"X-reid: Cross-instance transformer for identity-level person re- identification","venue":null,"work_id":"64498e88-51f1-40f3-828c-481aec074ba6","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.602395Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6108696974b11defa7aa115b2ef5bbc36106bae7925d81ebddb6b3d1e08fc7e3","observation_id":"5050387a-a682-48d0-87e4-b2319976e873","resolution":{"observed_at":"2026-08-07T05:04:38.852437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.841235Z","title":"Zerocap: Zero-shot image-to-text generation for visual- semantic arithmetic","venue":null,"work_id":"a5baa023-6484-46b6-a99e-57a797468d15","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.604375Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:39c8be0cb28d7ccd21e99844e1897c8eb75048bdb6593d57855e1ce342813f63","observation_id":"a487edaf-4706-4cd6-8dc1-127138457d33","resolution":{"observed_at":"2026-08-07T05:04:38.845005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.834458Z","title":"Yolov10: Real-time end-to-end object de- tection.Advances in Neural Information Processing Systems,","venue":null,"work_id":"85a3dd15-779c-4e96-9774-6574a4ae562b","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.606186Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:85623b09f5384419d78b2705edcd8495f12223b195f6c3a3fa3ef2f172544180","observation_id":"f644fda7-d10d-4b96-8176-32ee03ac7e91","resolution":{"observed_at":"2026-08-07T05:04:38.837245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.825066Z","title":"Text is mass: Modeling as stochastic embedding for text-video retrieval","venue":null,"work_id":"f6a11fbd-5979-40b6-8aae-3756aa8e99b8","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.608355Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:ce526fefb8d0acfe3efe14f767b75ab01cd08f35f5d8f83be595238ca9070ce7","observation_id":"aaef0ede-80b5-4deb-9093-06115b7bdf9d","resolution":{"observed_at":"2026-08-07T05:04:38.828037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07111","last_updated":"2022-03-14T13:55:33Z","snapshot_observed_at":"2026-08-06T20:50:04.667147Z","submitted_at":"2022-03-14T13:55:33Z","title":"Disentangled Representation Learning for Text-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07111","snapshot_observed_at":"2026-08-07T05:04:38.610482Z","title":"Disentangled representation learning for text- video retrieval.arXiv preprint arXiv:2203.07111, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.610482Z"},"links":{"cited_paper":"/paper/2203.07111","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:97c297957364a8876a5f768e639dc987bd4ed08f57cdf9738c62c0d562bc425d","observation_id":"318d79f3-c194-4bb6-a2ea-277328ae9909","resolution":{"observed_at":"2026-08-07T05:04:38.610482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T05:04:38.612750Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.612750Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f3e931745ab2cc73aedf3b8e678f8469acba8216f6a33aebd139836a685107c7","observation_id":"300d6d22-2ed4-4a14-89bc-5e3f9fe69607","resolution":{"observed_at":"2026-08-07T05:04:38.612750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.817108Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval? InProceedings of the IEEE Confer- ence on Computer Vision and Pattern Recognition, 2023","venue":null,"work_id":"f305dc79-d1f8-45f4-8fac-b9345789fa6f","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.614769Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:092de2bfc15c8e7efaa3c69bba75b379913a3c447a313312fa59bcc5fb24cc02","observation_id":"13d9f64f-a526-4fb3-8666-890cc69a6917","resolution":{"observed_at":"2026-08-07T05:04:38.820295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.807755Z","title":"Demystifying clip data","venue":null,"work_id":"df147d7e-5e1c-418b-a58c-bf90abc3d4ab","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.616890Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:bb206f630bc2b84df992e3900f73d7cd9cb21d1cd571a70cbae7bcb43835b102","observation_id":"d3bb257c-fec5-4d6a-b455-d1824b8df63d","resolution":{"observed_at":"2026-08-07T05:04:38.810675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.798864Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"5aeef146-68a8-4205-ba5e-bf5614126e59","year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.618838Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:4798b0426fe720b8cc6df96114dc79b443a211f45f3c3e56ccc5ed0f0adede44","observation_id":"62a76fcd-6b96-400d-a602-ea4d4ecd08fa","resolution":{"observed_at":"2026-08-07T05:04:38.802277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.791075Z","title":"Show, attend and tell: Neural image caption gen- eration with visual attention","venue":null,"work_id":"172fa46e-ac80-46e5-8158-a84d026f41ac","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.620852Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:cd764432e4a037889cae9ff16597fa4006865c4dcaa3d9680a5729a6055eed20","observation_id":"a2d4fc0f-88d0-4624-877e-0ea3b83a0e31","resolution":{"observed_at":"2026-08-07T05:04:38.794086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.782417Z","title":"Clip-vip: Adapting pre-trained image-text model to video-language alignment","venue":null,"work_id":"15f88510-09cd-4719-8897-1adc1933fe80","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.623017Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:0c3aca530412fca0cb9378dc67141d1448fc23e652807987bc6f8c47cea61fc4","observation_id":"ac8193da-961f-4068-b1fb-a10e92076d7c","resolution":{"observed_at":"2026-08-07T05:04:38.785496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07422","last_updated":"2025-02-13T09:32:44Z","snapshot_observed_at":"2026-07-06T19:00:35.877802Z","submitted_at":"2024-08-14T10:00:16Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","version":2},"cited_work":{"arxiv_id":"2408.07422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07422","snapshot_observed_at":"2026-08-07T05:04:38.677859Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","venue":"cs.CV","work_id":"fb4e934a-3912-4af7-81fe-b5e991a7abad","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.625078Z"},"links":{"cited_paper":"/paper/2408.07422","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6025442537ef426959da82dde842f019d452c658ffad0f3fb5e7bfa20e55bff7","observation_id":"4429bc67-e6b9-413d-8cfc-0eeb2161aa64","resolution":{"observed_at":"2026-08-07T05:04:38.682071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17261","last_updated":"2025-05-30T15:15:51Z","snapshot_observed_at":"2026-07-06T19:57:10.411888Z","submitted_at":"2024-11-26T09:37:59Z","title":"HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17261","snapshot_observed_at":"2026-08-07T05:04:38.627382Z","title":"Heie: Mllm-based hierarchical explainable aigc image implausibil- ity evaluator.arXiv preprint arXiv:2411.17261, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.627382Z"},"links":{"cited_paper":"/paper/2411.17261","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a491dd0905c1560a811641ee28399f965749fa62d03a9dc5383150f00e94e71f","observation_id":"c7252e5e-663e-4109-b549-6fbcafb3c3dd","resolution":{"observed_at":"2026-08-07T05:04:38.627382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.775209Z","title":"Dgl: Dynamic global-local prompt tuning for text-video re- trieval.Proceedings of the AAAI Conference on Artificial Intelligence, 2024","venue":null,"work_id":"f3b2321d-1294-4b33-aad9-eeca914fa6d1","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.629860Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:7c57c53654ed90b5cf4e734c27d12eb08821b9bf2aede03a90225f33f1b439cf","observation_id":"cbdea981-e643-4f0b-9a62-f98e4d62c816","resolution":{"observed_at":"2026-08-07T05:04:38.777722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.768423Z","title":"Cross-modal and hierarchical modeling of video and text","venue":null,"work_id":"a7d197b2-7782-4ac6-b55f-78973db55b62","year":2018},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.631911Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:888bc9d27988f45c65f40ccd415f1cef26efb44b339a4e5e2fe5563a9b508040","observation_id":"e338126f-3b20-4a2c-813f-89a4f1771003","resolution":{"observed_at":"2026-08-07T05:04:38.770886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04673","last_updated":"2022-06-14T12:15:55Z","snapshot_observed_at":"2026-08-07T11:36:51.183489Z","submitted_at":"2022-06-09T17:59:58Z","title":"Neural Prompt Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04673","snapshot_observed_at":"2026-08-07T05:04:38.634022Z","title":"Neural prompt search.arXiv preprint arXiv:2206.04673, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.634022Z"},"links":{"cited_paper":"/paper/2206.04673","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:595ce52100078f337a3292bf80f5345957aabdf7e9b40a48eda3aadaf9fd2121","observation_id":"d77fac82-44a4-4399-8190-8b237b154d11","resolution":{"observed_at":"2026-08-07T05:04:38.634022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.761346Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":"125416a8-16a1-4c8b-8de2-da37b45cfe72","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.636387Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:0b72535dc2179184c9ec85ec40e9909e484ad8536701b77f6c07f8d29eae83f8","observation_id":"7e438381-88ec-420d-8564-76c6862d6121","resolution":{"observed_at":"2026-08-07T05:04:38.763763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.752382Z","title":"Learning to prompt for vision-language models.Inter- national Journal of Computer Vision, 2022","venue":null,"work_id":"2bc5a9ff-72ca-48e6-bab8-17bde715aa7c","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.638481Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:8b80157d6fbdb911c1e571c859d2df53168bdbfdcddb25b32723dbc08a78f46b","observation_id":"60c6db4a-d10a-4ccb-b7c0-3814677297bb","resolution":{"observed_at":"2026-08-07T05:04:38.755584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.744979Z","title":"14,αandβare set to0.3and1.0, respectively","venue":null,"work_id":"09c190b8-09d4-4ba1-9551-e45d586bbf76","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.641568Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:2090a3cb6b6b10deeae39ccd29e06c763e55bb45481457bdfb58fed1720b65fb","observation_id":"207f0633-d482-4615-9278-a64b4d1f201a","resolution":{"observed_at":"2026-08-07T05:04:38.747510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2506.08887."}