{"as_of":"2026-08-11T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e96f52b7b4303822f16c72fb89d504bd06da000481b678cc744baf5b881d9db2","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T10:40:01.902254Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.20597/citation-record","integrity":"/paper/2601.20597/integrity","json":"/paper/2601.20597/citation-record.json","paper":"/paper/2601.20597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f38fcb04-8510-4d54-aaaa-32b96f9c4487","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e86f7eb24052a1b561a159fdb72b3a0c879b226e00c7899dea47cd1d7709153f","observation_id":"1116804f-5659-4cc0-9b45-1d9667496262","resolution":{"observed_at":"2026-05-16T10:40:51.709794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ashok, K","venue":null,"work_id":"3f8330f8-18da-4ed7-8d95-25be01ca6a6e","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c19fbd9c39797bc2c2aadb0003d163630aaccd3e0cccab1f836d477001892f99","observation_id":"4f82f5e7-7c65-4c5d-9e40-dee810632c0d","resolution":{"observed_at":"2026-05-16T10:40:51.714676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"56020771-2490-4ac2-849d-1b7866e9b9ce","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f0a587ab766ce5ae64a11aff77fffb75faa09ac1d196a5bb597770974b08edcd","observation_id":"6e0b33d6-b5fd-43b8-860c-b96508f0c9e3","resolution":{"observed_at":"2026-05-16T10:40:51.707392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-autoregressive cross- modal coherence modelling","venue":null,"work_id":"c72334bb-f015-4091-990e-054c3fa1024a","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:201b9b6565e5108c69a1e68c8967d98fa0ac94df3c22402d919d35c85fd00704","observation_id":"37f15509-ad8c-4d42-87e0-b2800cb4290c","resolution":{"observed_at":"2026-05-16T10:40:51.716828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5053359d-2a0b-4732-8e7d-e1d4a7d54093","year":2015},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:3cd26dcd76dce2e3966d22aefbf4e215ca76e85779696c5c191855a85009fa9d","observation_id":"1982bc2e-ebc8-4b69-9931-0a75c947a475","resolution":{"observed_at":"2026-05-16T10:40:51.705324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online fast adaptation and knowledge accumulation (osaka): A new approach to continual learning.Advances in Neural Information Processing Systems, 33:16532–16545","venue":null,"work_id":"efab7ea7-900e-42ed-a967-1b6be72ef8af","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:46b2d50889feab23f07140ea5ae50b3033442760cd8c8c18d8312bb6e85d14f8","observation_id":"fdc776cf-03f6-418a-a7fd-e847250d8444","resolution":{"observed_at":"2026-05-16T10:40:51.709995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clumo: Cluster- based modality fusion prompt for continual learning in visual question answering.Journal of Artificial Intelligence Research, 83","venue":null,"work_id":"529f91f0-8c9c-4110-9170-a82254120b30","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:b9bc99fe1151a6be11dc6cfecb278da33ffc29521ebd4cb1b3333f4a4f95bf35","observation_id":"dcab8dd2-25f9-4a20-9dff-5d406f0fad9e","resolution":{"observed_at":"2026-05-16T10:40:51.712837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Castro, Manuel J","venue":null,"work_id":"9774654a-e3eb-4a3b-8ab5-9d2bf9da31bd","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f44b5ac7221a9d2fad4eacbfd99aa928a825e398f342ffeec1150ddea69afde9","observation_id":"7681fd1e-64b4-4899-8472-6a0cfa999907","resolution":{"observed_at":"2026-05-16T10:40:51.701475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained video-text retrieval with hierarchical graph reasoning","venue":null,"work_id":"d18dc915-d054-40cd-b05e-90be61475d2a","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e970d469b53c808c5961e79c45d32f6d8c042208b01958ada83da82b202afeae","observation_id":"3b2f0bbb-149a-4ba9-8c8a-369115acf023","resolution":{"observed_at":"2026-05-16T10:40:51.694266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision- sensor attention based continual multimodal egocentric ac- tivity recognition","venue":null,"work_id":"3fb5bcb2-d976-40c0-9711-8f55c3bd74f1","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:66b7c6fc21b96f70b2faefbcef8aba559b832d55a6db387cfcea368d02b5be2b","observation_id":"da9974f5-19a1-4cfb-9e61-c1b7a53ee94f","resolution":{"observed_at":"2026-05-16T10:40:51.703508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teachtext: Cross-modal generalized distillation for text-video retrieval","venue":null,"work_id":"c7813ecd-8ed1-48b0-93e2-e70490ea9820","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5a06d24ca811ec59d740c76043ddd6d4b80837e82af416d06ea8d166bf309ded","observation_id":"169e921f-6c01-41e7-abb1-4d21d640f6a5","resolution":{"observed_at":"2026-05-16T10:40:51.705551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09248","last_updated":"2022-07-20T02:21:33Z","snapshot_observed_at":"2026-08-06T04:34:02.844683Z","submitted_at":"2022-07-19T13:03:14Z","title":"Don't Stop Learning: Towards Continual Learning for the CLIP Model","version":2},"cited_work":{"arxiv_id":"2207.09248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.09248","snapshot_observed_at":"2026-06-29T23:14:01.248032Z","title":"Don’t stop learning: Towards continual learning for the clip model","venue":null,"work_id":"444360a3-7095-4848-bde3-b9e0a8f6828f","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"cited_paper":"/paper/2207.09248","citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:85288c95fe69f3befefb6518906854075cb310455ad44e58b60625b1e57ae558","observation_id":"8c686c0e-6338-41a2-9249-55373b401d8d","resolution":{"observed_at":"2026-05-16T10:40:50.904706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Podnet: Pooled outputs distillation for small-tasks incremental learning","venue":null,"work_id":"ce4fe070-55d2-4292-b719-723dad1be60f","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f99a0028d9ee12cb7a9d1bc6aa2030da1dfffbd11a981739453420ea142344ee","observation_id":"227e82ff-e973-409c-b3cb-f3a67b75ef71","resolution":{"observed_at":"2026-05-16T10:40:51.696497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A feature- space multimodal data augmentation technique for text- video retrieval","venue":null,"work_id":"1c6fb986-1824-44cd-a9e6-eb6ad78787ef","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:89306d0566b8a47ac622661fec9fe35be8367fad04767d2637aea34fa95d0408","observation_id":"d136fbec-b734-4c12-aa50-905633e73a58","resolution":{"observed_at":"2026-05-16T10:40:51.598654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uatvr: Uncertainty-adaptive text-video retrieval","venue":null,"work_id":"b2ca7630-a7e7-40f8-a3c1-c97d8a6aeede","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e0f452760e921bc4f8b43f95d4bc2c7adc6b6ed8cdf7d3a13436ae7825421093","observation_id":"cd9416df-fac6-48d9-91d0-cdce30f56e10","resolution":{"observed_at":"2026-05-16T10:40:51.600733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring image-clip to video-text retrieval via temporal relations.IEEE Transactions on Multimedia, 25:7772–7785","venue":null,"work_id":"3d06e8bf-ec8e-4a30-b035-3f50569d73be","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5ad3a6ce31f3fa3a8bff13a2d92af113daabd7cbd6d34ec7a3d4c8465a146b77","observation_id":"c99db1a2-c20f-4648-a484-33184fd37811","resolution":{"observed_at":"2026-05-16T10:40:51.618257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"b1cfbced-5efd-494c-9895-ea84f2e681a6","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:369ec7f23cf40f2e5d7121bb13b3d36327658a67523fccf946c853bba0e12351","observation_id":"c0b5fd60-b1d3-4dee-b8fa-af287fae4eef","resolution":{"observed_at":"2026-05-16T10:40:51.620652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval","venue":null,"work_id":"9e37a8f3-a150-46a1-870c-dae272dd1ba3","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:39fff1b29b4b95ddbf4c5dfee1f2e29fe7a3c2411e5fe4259335357e42202149","observation_id":"52c14299-a180-40fa-93af-00ca30203a9a","resolution":{"observed_at":"2026-05-16T10:40:51.625377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dyson: Dynamic feature space self- organization for online task-free class incremental learning","venue":null,"work_id":"788e01db-c57b-4a80-9a17-8f073d6eade2","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:0a4cfba7617f9bb9e1d00037ceba0fa558d4e22e1749a135a6076a945e33e793","observation_id":"ea1e9ff3-71d0-499b-b885-fedd0577eae9","resolution":{"observed_at":"2026-05-16T10:40:51.630233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a unified classifier incrementally via rebalancing","venue":null,"work_id":"04cc1a49-178b-4524-bb6e-c9a264b37940","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6d6d4c05b877da770f2facd59e789eff1ed74880dd3ccd640bfb3c089ff6d1f9","observation_id":"235bf544-8942-41bd-9e04-cc4ce4c8aa7b","resolution":{"observed_at":"2026-05-16T10:40:51.639797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curiosity-driven class- incremental learning via adaptive sample selection.IEEE Transactions on Circuits and Systems for Video Technology, 32(12):8660–8673","venue":null,"work_id":"d5df7971-2ab7-40c6-83d7-c1cbbba46923","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:4fda322a5f2e904121f754c55043bbdb4f6ee83c5e8ad5c1ff8a4f5cb67f9417","observation_id":"23e57aa6-d95f-4629-a46d-21e504b01840","resolution":{"observed_at":"2026-05-16T10:40:51.635083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilling causal effect of data in class-incremental learning","venue":null,"work_id":"94673169-104d-4b9c-911c-015fdd9d259e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:78418f6308da218f157f5b4f3d3893d7e258bd44e0b9323291ad25e9c31a16d4","observation_id":"e604ae7e-8b2e-4f53-a92d-f059bf6d3837","resolution":{"observed_at":"2026-05-16T10:40:51.675445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural collapse inspired federated learning with non-iid data","venue":null,"work_id":"98d6bab4-6d2c-4c0d-83cf-f8e515810942","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:48d6983d04d985fb3598d6622af26a5df1677757bb10d1667e9e4cf153d0f862","observation_id":"8480298d-d87b-4d0b-b8ea-1a0e5e4af4bf","resolution":{"observed_at":"2026-05-16T10:40:51.609558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cfc59e08-cc10-4942-856b-f8371186a551","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:d35c54de87a74cbf20fd385c97f08f421e1fe67648df18da75912b484de0f1de","observation_id":"4dfa2c9d-afc7-46a9-8162-c85451acfb4f","resolution":{"observed_at":"2026-05-16T10:40:51.582087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"97003b38-28b1-431b-ad1b-b9f362d6a34b","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c65deb2027c7ac3733ec46611517f0a8c3aaf0c72a57e5f10720d1c989edf98e","observation_id":"8b9fcda3-507a-41ba-92c2-0993e30f8931","resolution":{"observed_at":"2026-05-16T10:40:51.573147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid-tower: Fine-grained pseudo-query interaction and generation for text-to-video retrieval","venue":null,"work_id":"16d3be4b-77b4-42fc-83a9-2cd1d0355424","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:13ffeca4ce341cc3ad5ef5fc3222697a01cb76cf352ea906ccec813413623baa","observation_id":"ddb1b485-f960-4d80-b661-c6fd3649bfd3","resolution":{"observed_at":"2026-05-16T10:40:51.567018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bakker, Nicu Sebe, and Michael S","venue":null,"work_id":"f41c6581-a72e-48df-a7c0-9de9fb623f63","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:7d8c3440c02849cb004e6c876813ab679e361095c756303a4989fcf6d718992b","observation_id":"ab85f800-dd7a-4da5-a188-4f29c50e368d","resolution":{"observed_at":"2026-05-16T10:40:51.569168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic integration of task-specific adapters for class incremental learning","venue":null,"work_id":"3a7bbe08-bca3-4bb9-9bb9-28221b527f1d","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5ed6d28382e3eaa591689b23d94602482f989f48bce85a1bd7e2181be3282cb8","observation_id":"afe372b3-fb8c-47ef-b4ee-d415d6312775","resolution":{"observed_at":"2026-05-16T10:40:51.576420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal inductive framework for text-video retrieval","venue":null,"work_id":"58038497-2a42-4135-8e85-3c4b38d5ea2c","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:17e66ec8ff91b4678c81a5a13ed40dde24708a6f83e23a62e9ca1010f186fb56","observation_id":"a2dd7117-829c-4ad6-ba6f-a74700987012","resolution":{"observed_at":"2026-05-16T10:40:51.658278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning without forgetting","venue":null,"work_id":"72a5f71b-35e8-4c91-8397-86baf20b32a6","year":2017},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:391afddc4ae7c0403c528e794f0dcda266b0accfd7331ff434bc79cc7032bf11","observation_id":"3bcd1dc6-93b9-493d-8c62-a0ebf4ce32be","resolution":{"observed_at":"2026-05-16T10:40:51.663084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anchor assisted experience replay for online class- incremental learning.IEEE Transactions on Circuits and Systems for Video Technology, 33(5):2217–2232","venue":null,"work_id":"fec18764-cd4d-40f8-9d45-3211cfcc6c28","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:3fce01a0b3e143e4c7ab227f02b33d7e218f8dc7c778ee2673e5de4985fd5df8","observation_id":"edebad7e-2da5-4a8d-9e83-d68f5976bc11","resolution":{"observed_at":"2026-05-16T10:40:51.667584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing.ACM Computing Surveys, 55(9):1–35","venue":null,"work_id":"d2cf53d5-c804-4235-9ce4-f4894e2367b3","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:824fc8106525c4060c4688953b2864341e04a4220215ac343f3e0d4153afbd19","observation_id":"b3b04c33-f98c-4d7e-b06a-1c2d3b4ab5ff","resolution":{"observed_at":"2026-05-16T10:40:51.687741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Use what you have: Video retrieval using representations from collaborative experts","venue":null,"work_id":"5c6da124-f566-43e2-b173-3b42d5d695c3","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:04bb1135e5be01e491473121f2cfe54adee320cbb79ab6a7a384b30187ecfee0","observation_id":"6f9179a4-001e-4107-967b-5669b4a120f1","resolution":{"observed_at":"2026-05-16T10:40:51.645249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive aggregation networks for class-incremental learning","venue":null,"work_id":"36339042-ac9b-4a85-8e95-43a01cbca58c","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f27736bb02a3a29daea4d0385ceb034d8f77cd24f211dac87be2ba7971505656","observation_id":"eb99e289-a5c8-44d6-bc01-1f01e42901f9","resolution":{"observed_at":"2026-05-16T10:40:51.647251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ts2-net: Token shift and selection transformer for text-video retrieval","venue":null,"work_id":"2a1cab95-c028-441c-a011-fe6cfdd8fc9b","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:549b53bf7f4403e6b5d35ae44ea1ab2ebc16e1de857c401e05072d32b9f458b4","observation_id":"dd4eb987-5ff5-4cc8-8321-8b6609bd0d7d","resolution":{"observed_at":"2026-05-16T10:40:51.640901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"8f668226-b0fe-4998-9eb6-f8779a97ca53","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:0501600335581c388ab24085dea77d24e07ff2cf632c1da58ac59a4c6eaead90","observation_id":"a06aaf53-a0db-4a1f-8699-a4c9bf11e4e1","resolution":{"observed_at":"2026-05-16T10:40:51.643129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval","venue":null,"work_id":"c10bfd44-6482-49fb-8edc-c392d8332fcc","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6bda42b689b5954229a38a018544dcb51a4ee5ef8656da8cd1e2559089fd808e","observation_id":"b9c1695b-e4ae-4135-9907-1c55d730415a","resolution":{"observed_at":"2026-05-16T10:40:51.649523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Packnet: Adding multiple tasks to a single network by iterative pruning","venue":null,"work_id":"c5673c99-891c-41af-85e5-022e14f099f0","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:942e69b62ddf53a2a610c033cd135732dd88d58dd2c8ba8bebc2e993b8242494","observation_id":"cc713bd8-6722-4803-9dcb-d562db5fcfc9","resolution":{"observed_at":"2026-05-16T10:40:51.674326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prevalence of neural collapse during the terminal phase of deep learning training.Proceedings of the National Academy of Sciences, 117(40):24652–24663","venue":null,"work_id":"b405f0f0-bcc6-4255-a4d8-8cceed530f4e","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a91ceace1ce289baa8cadaaa95a3e53f3283b2c730fad39a24a39da6d7a7ae8f","observation_id":"69ef110c-35c8-4964-b321-bec612227c23","resolution":{"observed_at":"2026-05-16T10:40:51.661076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prabhu, P","venue":null,"work_id":"e5d7f7c6-bcda-48a7-8997-08f71151f48d","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c85c74cd2d3206662c60a20250941602ff6502f0ea565e4917fa478997512fcf","observation_id":"ca335b31-e5ac-4caf-8464-f3fcb3b3b882","resolution":{"observed_at":"2026-05-16T10:40:51.591003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"8c07e7e3-72c8-49a2-afed-1913d7898042","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:eedcc7d6129829126fc6166521f3626126dc1d53d44a9056606583bb1a39d823","observation_id":"396540dc-c96c-4a1c-9ffd-0ff774ac9832","resolution":{"observed_at":"2026-05-16T10:40:51.605292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"De Melo, Benjamin Van Durme, and Rama Chellappa","venue":null,"work_id":"3e70e44c-f519-4883-ab4f-3399b60bd089","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:22524afbcea28133f4ffb96ecdbbb74e39a55e4b0c87bea04876b472957d1654","observation_id":"c2124e43-fd82-4aff-86a1-65bc36a5367d","resolution":{"observed_at":"2026-05-16T10:40:51.620155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28643026-4fb2-43d6-860a-0e094be0fd66","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6f27f73962ed7a168b1a8db4640b3041b945fdc209e0c0482758213e99f5df77","observation_id":"db425f6b-aa98-4063-b043-ce955592cef6","resolution":{"observed_at":"2026-05-16T10:40:51.591571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relation triplet construction for cross-modal text-to-video retrieval","venue":null,"work_id":"8991e47b-9616-4d99-9c7a-9416c0546329","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:fa8f0676eb7962d063dbd95fc37f05e4bcc899524b0e30ed0c8aaeee843f90e7","observation_id":"01acc3f3-6af0-4b52-971d-ed6d2bd58277","resolution":{"observed_at":"2026-05-16T10:40:51.661864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial-temporal graphs for cross-modal text2video retrieval","venue":null,"work_id":"28581551-b298-490a-b208-7402322b3f94","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:672f7722c921e5f801b8cde2f6a239a9210ccc0f91448a7b6411c76724c77885","observation_id":"1e61f864-8c9c-446a-8fd5-297b26d80f5d","resolution":{"observed_at":"2026-05-16T10:40:51.666346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning endogenous attention for 12 incremental object detection","venue":null,"work_id":"0e3d138f-dd49-4d28-b862-c42a97c4204a","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:18abbf810f0c20c3d8891155909496d88c2ea25803e8a3c95ae3489b5b2185f3","observation_id":"1921058a-4e86-402b-8514-441de59d9813","resolution":{"observed_at":"2026-05-16T10:40:51.648600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal continual learning using online dictionary updating.IEEE Transactions on Cognitive and Developmental Systems, 13(1):171–178","venue":null,"work_id":"50c2e798-fc5a-4cfd-b53e-70558f950d64","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:96e854683c25f2869387ab00b4b1a631bdb771bc50eb685e2f16d016f112cf1c","observation_id":"a58a7f6e-660d-4dac-b416-4111b8a21b09","resolution":{"observed_at":"2026-05-16T10:40:51.651198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f5a82dd-5678-4ee5-aec3-a2cc1a15933a","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:7552772188741a3faed8614c19df1fae1bcc86e2aa55f6973911371f829451da","observation_id":"3fdd9fa0-b3d5-4eb6-b708-802f7c1f237c","resolution":{"observed_at":"2026-05-16T10:40:51.669820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topology-preserving class-incremental learning","venue":null,"work_id":"487b2e6f-34e2-49aa-8036-084958391a54","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c92edef6de793f806fbbc076f4f54c5151123a3e7af0810b73e5dec6bf1a53ac","observation_id":"8f1985a2-8ea5-4538-ae4f-cee317aeadb9","resolution":{"observed_at":"2026-05-16T10:40:51.670974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"new” while consolidating “known","venue":null,"work_id":"d2dedaca-b2b6-473f-93a8-8fd72870a3ad","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a5506fcb744a56aab090cedf30117b76a1f20b214492d36c51e1a77c60754734","observation_id":"b7428cfb-c325-49d1-b8a4-7d36a9a4d9cf","resolution":{"observed_at":"2026-05-16T10:40:51.682933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic features are almost sufficient for text-to- video retrieval","venue":null,"work_id":"dbda30de-ebd4-4c60-b754-619192667634","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a6a576cdd2c5b73bf15fd74ef9753aa92b598b6fd7ed6d0cd563a18e036bbd15","observation_id":"e983ac38-969c-421f-ace1-8e98a8a855b8","resolution":{"observed_at":"2026-05-16T10:40:51.615710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dualcp: Rehearsal- free domain-incremental learning via dual-level concept prototype","venue":null,"work_id":"df8892db-6fa6-48c0-a543-065f6b14e9aa","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:692bf853c1db8b59e17d72b1974ea4ee2453cb8a08657400ef22082494c2b340","observation_id":"c3ecd1c6-91d7-406b-82a4-28246964eb74","resolution":{"observed_at":"2026-05-16T10:40:51.636271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic knowledge guided class-incremental learning.IEEE Transactions on Circuits and Systems for Video Technology, 33(10):5921–5931","venue":null,"work_id":"1affd163-12a6-493a-8079-97f0d35797ef","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:1a17a256d1b94902c1da798684c1e32db3e64065a59c4683cca068969e78e25e","observation_id":"2ef25a4f-1dcc-43b9-b5cd-c8d759a4a279","resolution":{"observed_at":"2026-05-16T10:40:51.679224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-exemplar class-incremental learning via adaptive old class reconstruction","venue":null,"work_id":"dc331865-353c-4f2b-9bf4-2fb7d48d836f","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:26fdf3c30baa2f59eb43f83dc5dce065631a95e9baee35dc63eaceb74743a74d","observation_id":"5be729ff-f5be-4411-86c5-2238436c0c81","resolution":{"observed_at":"2026-05-16T10:40:51.676623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2vlad: Global-local sequence alignment for text-video retrieval","venue":null,"work_id":"47f913dd-37b4-43d5-a694-8902a0f8df4e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c581cbd949f707b62c789166b758e703272f57e84500aef57c98c9fe67ee0143","observation_id":"b24ac00e-0264-4a54-9f7b-0aca9746794b","resolution":{"observed_at":"2026-05-16T10:40:51.663904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d20fb2f-f2dc-4e50-afba-77f42465fcc5","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:cdf0d8c2fcac1c09f1e275936179d3866d5f6206fff6e84279b09c9b92e788dc","observation_id":"2a1936ad-5e4f-43f7-9ece-dedbc41a08e5","resolution":{"observed_at":"2026-05-16T10:40:51.609246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified coarse-to-fine alignment for video-text retrieval","venue":null,"work_id":"837bcd87-12ff-4113-8a5f-53079ee8e77a","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:fb783d1295f0b9f33f49801a886b8c96bdae03a5f0ed3b5905983b99c21486b7","observation_id":"37d9e1c2-d717-4481-b2c1-fdb53fc4fe02","resolution":{"observed_at":"2026-05-16T10:40:51.624099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d33fe565-7a18-43d2-baaa-6eeab399bf59","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:02bc267c41756a7cf514cc85a40f8105e130ecc3ea54d8a88aa01a6c189baa04","observation_id":"72e1b749-ee1a-482f-8266-452eb054661d","resolution":{"observed_at":"2026-05-16T10:40:51.683137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"316bac61-de3e-462a-8b65-b77a344c4202","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:55094de0946b3acfe923a3f7acca34d121031ede624514a0c72c8fc15ed47e1a","observation_id":"f599089f-2aec-42db-b05b-dcf40d1976cc","resolution":{"observed_at":"2026-05-16T10:40:51.681235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Striking a balance between stability and plasticity for class-incremental learning","venue":null,"work_id":"0156f2c7-274b-44b4-a52f-d86da8330710","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:1d49e966023d9ca14bd84826b86b4fa205ae7297b4823974c0a701138599ebe0","observation_id":"8575d487-c113-46d4-b50c-953a9fb3053d","resolution":{"observed_at":"2026-05-16T10:40:51.622234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large scale incremental learning","venue":null,"work_id":"24d5dd27-0c0a-4cc3-9584-9d7129ede3ca","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:159c6964fa1388d443d808ba319a301485600ca158fc14adefcc88231c1b18cb","observation_id":"bf5cbcf8-e89d-44a7-b88a-955fb23350a6","resolution":{"observed_at":"2026-05-16T10:40:51.628196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"4fd033ba-face-4254-a3a8-1608ec2a8dac","year":2016},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a140f942456bd4d96c5d82c85ce424f943ec15c442c8a2438009eb4bd781ad75","observation_id":"76bf1e52-9479-4f74-ad57-51d64cfcb98e","resolution":{"observed_at":"2026-05-16T10:40:51.638408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language alignment","venue":null,"work_id":"e801a8a6-d9d6-488d-9563-76a2cf98ee55","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9cff8c4cd816d8e6fa9b4dc0510407491ae3366ba1e1a0ca55052a14b5c1c830","observation_id":"323b25a9-ab67-4122-84d9-172ef450bf81","resolution":{"observed_at":"2026-05-16T10:40:51.618052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Der: Dynamically expandable representation for class incremental learning","venue":null,"work_id":"9d2ec520-b18f-44aa-9a6c-36a1e3e37cf2","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c4de7b9e0794474a84ed3e29a5e02d053508724375fd93c8dc424844c3bd4c9b","observation_id":"3a3e8bb0-5807-46a3-bcf9-5b05ae7d85a1","resolution":{"observed_at":"2026-05-16T10:40:51.632232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-rank prompt interaction for continual vision-language retrieval","venue":null,"work_id":"dd0118b3-9bb4-40af-9e16-f37d9335982f","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:b43bfcb352ca1e1672901cd36a4538d1f764c7d1582ca490b165181904bbc389","observation_id":"293d60e1-c208-42ac-b50e-fd430be27fa1","resolution":{"observed_at":"2026-05-16T10:40:51.685321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic support network for few-shot class incremental learning.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"523917f7-50e8-4506-b346-4cc96335a160","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e493f54f2c89a93eb8dcb7641581331be2afaf2857996e9385e84c019e37d4e0","observation_id":"e20f0040-64d1-4218-bc02-81aef12cc4ae","resolution":{"observed_at":"2026-05-16T10:40:51.673508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taco: Token-aware cascade contrastive learning for video-text alignment","venue":null,"work_id":"09c2bd4b-7651-4216-9edd-1417c0af8e9f","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:2509e0566324230cb50e852f8cc4826f94e5788a9f5105bb9902194c533f096f","observation_id":"e9a3d12a-91c7-4c8e-ab7f-6b50dee6a5ed","resolution":{"observed_at":"2026-05-16T10:40:51.680932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances of multimodal contin- ual learning: A comprehensive survey","venue":null,"work_id":"26297c61-8333-4a32-a4d0-46a1ea24e3c7","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:72776c4c15a1576422e9b0ab27590224e9c896c1b62f85298531e73a9763163a","observation_id":"e30ce547-9178-4dd1-8db6-b74f4d7e132e","resolution":{"observed_at":"2026-05-16T10:40:50.901410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting continual learning of vision-language models via mixture-of-experts adapters","venue":null,"work_id":"f62b4c3b-52b9-4f73-b1a7-e645781e1f97","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c1ca1091d029e7358e37f717d102d162a5399ae32b4355faecf505f13185ccc6","observation_id":"254ee880-1289-427b-92b8-a25f65be6876","resolution":{"observed_at":"2026-05-16T10:40:51.659474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A joint sequence fusion model for video question answering and retrieval","venue":null,"work_id":"5ebb6d6c-b5e3-4faf-9a6b-95af7e780da6","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:897a3a4827c4573f79e80288e1af38a08f8528885966ffea934fded9ade59ef8","observation_id":"08d621ff-ad31-4363-b78a-363b35155a17","resolution":{"observed_at":"2026-05-16T10:40:51.602712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantifying and narrowing the unknown: Interactive text-to-video retrieval via uncertainty minimization","venue":null,"work_id":"8af28e55-dbda-40b2-a942-d07a1cbf9c77","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:90d2a1dcce4c6e7c4495a4d639149e3e162b5a5cbd3a229172492bc89b97f0b5","observation_id":"30180881-0e62-4084-8fc1-e23f12b15cf6","resolution":{"observed_at":"2026-05-16T10:40:51.611791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mpt: Multi-grained prompt tuning for 13 text-video retrieval","venue":null,"work_id":"309ab5a1-74d4-4a36-9379-36ff4672c037","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c2b53030293f484cb233e71ca098316a5d3e2071123040d2eacd93f6d7457b46","observation_id":"b71c631a-5f11-4577-89f4-5fa686a4dc94","resolution":{"observed_at":"2026-05-16T10:40:51.655518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqacl: A novel visual question answering continual learning setting","venue":null,"work_id":"f9568e3a-a775-4627-85a2-14dc27cebd45","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:b85714f9a9c30d79072c20b86b33620c6092f067899702ab7d92abd5e97d26a7","observation_id":"01de61a7-4be2-4976-a52d-d3be55779950","resolution":{"observed_at":"2026-05-16T10:40:51.602711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mgsvf: Multi-grained slow versus fast framework for few-shot class-incremental learning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(3):1576–1588","venue":null,"work_id":"69f5be2a-00a6-4fb2-8951-2ccf30e4c938","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:43f438a57fcccb64586e91a15b50fef6380a75f604deaae641d17b38173ba375","observation_id":"ecf872ac-51ad-464d-8f45-838e029c0fbf","resolution":{"observed_at":"2026-05-16T10:40:51.690142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Centerclip: Token clustering for efficient text-video retrieval","venue":null,"work_id":"f3456a90-0062-4471-9aa7-f5670197b1e6","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6b34370cdfdcac1af4a56b8d9373a01f6976ac795a10080ff6debef771038980","observation_id":"c018a695-a164-4cdd-a9e8-4969c9698d9b","resolution":{"observed_at":"2026-05-16T10:40:51.672177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual text-to-video retrieval with frame fusion and task-aware routing","venue":null,"work_id":"16a483ca-85a6-48f9-933a-c8d50f642250","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:36f0e92aa410b7bfa1716fa19c3b3443d7ecb0eb8361fde7fa2b5b72ef6593d3","observation_id":"5282bee4-e656-420a-bff7-aebc91fd4343","resolution":{"observed_at":"2026-05-16T10:40:51.651540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preventing zero-shot transfer degradation in continual learning of vision-language models","venue":null,"work_id":"f9224c66-c7a2-4c1d-ae51-47ce80bb8817","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5a6a7fb1654e3a1b6d5935b4bb7c46167b83892d0ff269f8fd601cca27a55e0a","observation_id":"30e8075a-d419-4b5c-8dd1-9e0ea72e66f0","resolution":{"observed_at":"2026-05-16T10:40:51.653601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding imbalanced semantic segmentation through neural collapse","venue":null,"work_id":"75fab212-a95c-4a79-8cf9-54c6fa76593d","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:2034b6e6ace0427c1999588f3b2a35f4ef9d0dfd215b1d24a1dac48ced868b66","observation_id":"0e8f7948-cea6-4260-ad51-2af72f224ec2","resolution":{"observed_at":"2026-05-16T10:40:51.665178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1473d04c-37b6-4b6d-96be-f02a4d0f3921","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:d68bfcf48877b796294aefa0e8e8ae87696477be4b97d83cb9e2c3598fe224c2","observation_id":"fc92ad12-59cd-4713-ab6a-5ddf29ecbce1","resolution":{"observed_at":"2026-05-16T10:40:51.678753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79d67096-4364-4145-ac80-ce4db14cb13e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f5b5c845e655f02eea4d9d3c8102a3ba9f44ad7e829a0d0134c37e1dcc6ff184","observation_id":"f406e808-57cf-4780-88ec-ec31b8bf628e","resolution":{"observed_at":"2026-05-16T10:40:51.626212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Complementarity- aware space learning for video-text retrieval.IEEE Transactions on Circuits and Systems for Video Technology, 33(8):4362–4374","venue":null,"work_id":"77f4a213-4872-481d-9b96-fdeb03b1a932","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:82e4fb5f1ae0968aab986b887d24caa7a02d42956973eaff6822ea0501ad5723","observation_id":"68c220ba-d509-46e9-b739-cd48f2e79ba2","resolution":{"observed_at":"2026-05-16T10:40:51.614174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":69},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2601.20597."}