{"as_of":"2026-08-23T04:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2ac376d4de204f753848b637a77fb1351ba1a562ccaa9ce489b19065d9e7c95","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:51:29.261016Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:49:03.038872Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:41:06.814014Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02885","snapshot_observed_at":"2026-08-03T18:49:03.038872Z","title":"Expertized caption auto-enhancement for video- text retrieval.arXiv preprint arXiv:2502.02885, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03627","last_updated":"2026-06-02T03:13:58Z","snapshot_observed_at":"2026-08-16T13:12:41.036049Z","submitted_at":"2025-12-03T10:06:14Z","title":"MemVerse: Multimodal Memory for Lifelong Learning Agents","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:49:03.038872Z"},"links":{"cited_paper":"/paper/2502.02885","citing_paper":"/paper/2512.03627"},"observation_digest":"sha256:a067265b895d82322066c288178e7da51bced15c0f089b01b82f4026fd617d62","observation_id":"c435583e-9907-42d8-9e71-7104318873c8","resolution":{"observed_at":"2026-08-03T18:49:03.038872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"cited_work":{"arxiv_id":"2502.02885","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02885","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AGENTSAFE: Benchmarking the safety of em- bodied agents on hazardous instructions","venue":null,"work_id":"b3b058c2-82f1-499f-84c4-5dd44332067d","year":2025},"citing_paper":{"arxiv_id":"2604.11174","last_updated":"2026-04-13T08:34:04Z","snapshot_observed_at":"2026-08-17T22:10:10.435949Z","submitted_at":"2026-04-13T08:34:04Z","title":"EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:21:20.231759Z"},"links":{"cited_paper":"/paper/2502.02885","citing_paper":"/paper/2604.11174"},"observation_digest":"sha256:da79092685c034af74b09c14a4327f3ee6412c94364a00d49c8b76a6389d1946","observation_id":"721cd6cd-30bd-4b95-9f61-3a8e8471d1b0","resolution":{"observed_at":"2026-05-11T10:41:06.821330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02885/citation-record","integrity":"/paper/2502.02885/integrity","json":"/paper/2502.02885/citation-record.json","paper":"/paper/2502.02885"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.692983Z","title":"Un- masked teacher: Towards training-efficient video foundation models,","venue":null,"work_id":"82a32304-233d-46dc-9c38-31dd9036b695","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.122961Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:010682f4c0ff1bb9164269f90fb35f596aa270abe0f264445b6b7d4b3ea21256","observation_id":"43ea0d3f-6a88-400a-8816-1faee030fb74","resolution":{"observed_at":"2026-08-09T10:51:29.696729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.681844Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset,","venue":null,"work_id":"d69d0c87-f3a1-48c1-bef6-3673cc184f43","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.127239Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:0ac09d001252f3ba937ff7988b0f2601542378bfe5fd0205521d136367090e82","observation_id":"e24eff71-66be-46ee-a89f-960ce4464e67","resolution":{"observed_at":"2026-08-09T10:51:29.685915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.671082Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning,","venue":null,"work_id":"217d88c6-267d-4b15-aa1d-dc660e16c87d","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.131271Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:a837c7aa138b0991909617726e93d5e4159181c41c16a50f95ab5f5679ccac14","observation_id":"fbc34ced-5b6b-44ba-9302-d687cb966a61","resolution":{"observed_at":"2026-08-09T10:51:29.674886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.660808Z","title":"Clip-vip: Adapting pre-trained image-text model to video-language representation alignment,","venue":null,"work_id":"24cd7fae-1148-4f96-b4b9-7a6de4be2c8d","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.135065Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:5b09c1c15ae39587c73d491f6820e9b27a4eb3e992db71e95c5fb779d14f9194","observation_id":"d885a4a9-5386-4a2a-8d18-2715cd315e63","resolution":{"observed_at":"2026-08-09T10:51:29.664590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.650247Z","title":"Long-form video- language pre-training with multimodal temporal contrastive learning,","venue":null,"work_id":"ca9b6df5-b08d-47a9-a8bb-2dd6470b9472","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.139048Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:6113eab396c5a0858fce7d85d95ee31b0e395e2dde8eec1c368924d6a8d795db","observation_id":"084cc9dd-47b9-45a1-8ea7-a539e7277e10","resolution":{"observed_at":"2026-08-09T10:51:29.654191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.639661Z","title":"Litevl: Efficient video-language learning with enhanced spatial-temporal mod- eling,","venue":null,"work_id":"10230a82-193e-4707-8478-d2c44d1a53d5","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.143114Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:70fbf474137b727b462d3070b9eea3794990dd22d5f73300c0ed2558790449c7","observation_id":"a78c93a6-f973-4b2f-9e37-08aa319a33ae","resolution":{"observed_at":"2026-08-09T10:51:29.643321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05610","last_updated":"2022-07-21T17:19:19Z","snapshot_observed_at":"2026-08-16T17:42:48.054489Z","submitted_at":"2021-11-10T10:05:11Z","title":"CLIP2TV: Align, Match and Distill for Video-Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05610","snapshot_observed_at":"2026-08-09T10:51:29.147075Z","title":"Clip2tv: An empirical study on transformer-based methods for video-text retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.147075Z"},"links":{"cited_paper":"/paper/2111.05610","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:8c469fde38b440a1d22d386b3f56fec031458d99ba2df29c957e3f94c14ad4e1","observation_id":"4b77a9ed-dfc2-457b-b4ea-295080229ff5","resolution":{"observed_at":"2026-08-09T10:51:29.147075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.629145Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":"b8701cfa-d654-41f3-a672-cc2d6ba7bc3d","year":2021},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.151198Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:07af19a2273362742d1b1c142ed7c789c4e917faaef5650669cc5e3e7566ce8d","observation_id":"a78511e2-5632-4827-841d-41e5e5b8285a","resolution":{"observed_at":"2026-08-09T10:51:29.633102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.618535Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval,","venue":null,"work_id":"ff9016fb-fc5c-4a18-98d2-b7ab3d0b5091","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.154898Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:7e1cecbc6dd4b0d7e17f18522f30bf12c81d278485c3038103fbaef0609912fa","observation_id":"20f71575-29c3-45a2-bc5c-663fd5312806","resolution":{"observed_at":"2026-08-09T10:51:29.622543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.608052Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions,","venue":null,"work_id":"f36d9a0f-4001-4321-bf80-a5a8d6fd4090","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.158633Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:ef45d2e06c673242b8a3720853b5e5254c1a78a8ade2c56f7e18521f68b8ed2a","observation_id":"62e86228-f5fd-47bd-80ff-50fe959a3636","resolution":{"observed_at":"2026-08-09T10:51:29.612035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.597655Z","title":"Bidirectional cross-modal knowledge exploration for video recognition with pre-trained vision-language models,","venue":null,"work_id":"bd58a738-11d8-48a8-8860-8b661d5e929d","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.162492Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:a754b3f636b9570fd19d755aeebf837c0d0329dd708b0daf38bd0cfeb41f7db9","observation_id":"bb633cea-6a1b-40ce-a1a7-d7509da2db60","resolution":{"observed_at":"2026-08-09T10:51:29.601539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.587303Z","title":"She-net: Syntax-hierarchy-enhanced text-video retrieval,","venue":null,"work_id":"d4a6152b-93ff-4016-bc8d-1e8270dfc768","year":2025},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.166800Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:b3105d8c69998ff076a7512956d673ce0d0cf276d702786ccf42a326934a857a","observation_id":"5064f4a4-2741-41f2-89d4-e4df90d2c81a","resolution":{"observed_at":"2026-08-09T10:51:29.591079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.577100Z","title":"Teachtext: Crossmodal generalized distillation for text-video retrieval,","venue":null,"work_id":"10644aa2-2021-49f9-9058-3a797ad43d1e","year":2021},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.170475Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:7b44250c6c6a2b139f0bc57d4e79cb50219c4fb1219dfc80c20d3ae1b505c8db","observation_id":"ceec9b38-2584-4c6e-b585-bf67748092d1","resolution":{"observed_at":"2026-08-09T10:51:29.580904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.566674Z","title":"Text is mass: Modeling as stochastic embedding for text-video retrieval,","venue":null,"work_id":"f410c099-3b1f-4e3e-bcbc-8244102d51b3","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.174312Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:8959265acfc3497a7c75b40baf19bef94124145b4fb020699f8b285b2450736c","observation_id":"4c3a5699-381f-46f9-95e4-016a677f26a3","resolution":{"observed_at":"2026-08-09T10:51:29.570628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.555158Z","title":"Cap4video++: Enhancing video understanding with auxiliary captions,","venue":null,"work_id":"89c8a9fc-5f0c-484d-8a10-dfa4213bd5b7","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.178387Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:9c6b777cffe255fca0abab1d31d5be6e930c99f236bd1223eccf4c8319e77765","observation_id":"3d7c1bb0-8baa-4bf0-9706-2bb8e2502ec9","resolution":{"observed_at":"2026-08-09T10:51:29.559369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.544120Z","title":"The neglected tails in vision-language models,","venue":null,"work_id":"a12cfbf8-c796-43bd-8e57-92f3684b2077","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.181778Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:48976feef3a5c106e885b8bb6668b20f10e9c7730a1e8e0a8c5997a7128e412a","observation_id":"8db09856-898d-47d9-8897-847583b1d86b","resolution":{"observed_at":"2026-08-09T10:51:29.548175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.532920Z","title":"Verbs in action: Improving verb understanding in video-language models,","venue":null,"work_id":"90a8dd63-52b6-4da5-b86f-7aa417250aac","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.185341Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:a45ca5b9a602ba76d52f2bf69a08eb7c727954caf2c7c42871c06ead22954589","observation_id":"9a71ca16-5362-4b0d-9687-fc31138a502a","resolution":{"observed_at":"2026-08-09T10:51:29.537140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.520907Z","title":"Videocon: Robust video-language alignment via contrast captions,","venue":null,"work_id":"51d20abd-c29a-4dc2-a909-0f3352797b8d","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.188542Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:f7af8178d0b63e5d8fa6198a3fcd42993d2d7760794ee89b7a4a4cb1c1bdfd97","observation_id":"67a74f46-f828-4c84-8e47-d1ccd88e212b","resolution":{"observed_at":"2026-08-09T10:51:29.525903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05083","last_updated":"2025-02-04T04:06:48Z","snapshot_observed_at":"2026-08-19T08:29:37.302766Z","submitted_at":"2024-04-07T21:46:47Z","title":"DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05083","snapshot_observed_at":"2026-08-09T10:51:29.191631Z","title":"Havtr: Improving video-text retrieval through augmentation using large foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.191631Z"},"links":{"cited_paper":"/paper/2404.05083","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:6f7c6716564125ef2d6e93bb6c6a771577eab2bd41205a64ba09317bc7bc677d","observation_id":"2c8ee2f4-1d81-4f21-82a9-86326b8c9edf","resolution":{"observed_at":"2026-08-09T10:51:29.191631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.510286Z","title":"Automatic prompt optimization with","venue":null,"work_id":"f7da4a4e-3192-4c7c-9a61-9cda664f2b58","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.194943Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:99cc07349a7f3842bc3c2b4149bd181bf7dd0f551c3e5e7c58b5366a8d7133fc","observation_id":"7afff887-8912-42b5-8552-76931bf2b82b","resolution":{"observed_at":"2026-08-09T10:51:29.514177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.499034Z","title":"Dynamic prompt learning: Addressing cross-attention leakage for text-based image edit- ing,","venue":null,"work_id":"56300beb-7e9a-4231-9e7b-d253c55562aa","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.198349Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:2261f98b0c308047759d4a80da706c34f865481d357650d99db49539cf12526d","observation_id":"0492c361-dc26-425d-bea4-609ac165b528","resolution":{"observed_at":"2026-08-09T10:51:29.502985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-09T10:51:29.201639Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.201639Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:941611deba6350891bee615c7b6fe018cb2c4b1154df629b537b4776cc23be19","observation_id":"18a5d58a-d8dc-486a-bcbf-96dcf678f6e4","resolution":{"observed_at":"2026-08-09T10:51:29.201639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.488554Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"1e05720e-d94f-4a53-83bd-f1e633df3708","year":2021},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.205283Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:c150b270a11c0eead45bd632de751ed7bfcc3ceade2f662f3d8a206bbafab7a3","observation_id":"850cc9ea-5a95-4a69-9af1-084fa2ceb6fb","resolution":{"observed_at":"2026-08-09T10:51:29.492215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.478432Z","title":"Ts2-net: Token shift and selection trans- former for text-video retrieval,","venue":null,"work_id":"90a37310-f299-4689-b262-f4d51cc91d59","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.208352Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:5b69e78f2e31cd6573dfde32c89de3b3931a3470145376a6374655b416595d78","observation_id":"39fef332-2f04-4f03-87f3-699628cf4cdc","resolution":{"observed_at":"2026-08-09T10:51:29.482158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.467431Z","title":"Mv-adapter: Multimodal video transfer learning for video text retrieval,","venue":null,"work_id":"da5be9f7-8e63-41b5-902a-013102b8125e","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.211453Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:2dfff8291eb3e22e21f63705ac38ac35f73ec46f5657d88afc65f7f2c30b3ffd","observation_id":"a6b10a50-a0a4-4918-a58f-63ffde2acf0d","resolution":{"observed_at":"2026-08-09T10:51:29.471327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.456436Z","title":"Holistic features are almost sufficient for text-to-video retrieval,","venue":null,"work_id":"1a00b0ab-6d56-4a81-aa58-7200951416fb","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.214828Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:848f5d0c7259711b22b3d861d9b1b811dc0f57c4ba24982cdcf26b33c150ad28","observation_id":"d60ca170-ae0b-446a-8142-de76b40260b7","resolution":{"observed_at":"2026-08-09T10:51:29.460553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07111","last_updated":"2022-03-14T13:55:33Z","snapshot_observed_at":"2026-08-16T17:14:47.821311Z","submitted_at":"2022-03-14T13:55:33Z","title":"Disentangled Representation Learning for Text-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07111","snapshot_observed_at":"2026-08-09T10:51:29.218350Z","title":"Disentan- gled representation learning for text-video retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.218350Z"},"links":{"cited_paper":"/paper/2203.07111","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:f1d4afcd9e07ab144c9bb8475fcf93b703b828905118fd8ff1da8b818be82dc3","observation_id":"bb58eef9-2878-47e0-af92-cd278f40d59f","resolution":{"observed_at":"2026-08-09T10:51:29.218350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T10:51:29.221981Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.221981Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:7265bbec2a4f73f1d7b6d6bf613823761ffc566a0061196476490b1d4ef5f251","observation_id":"c1b0a681-8aec-459c-9e21-b7a8eb9cd8a4","resolution":{"observed_at":"2026-08-09T10:51:29.221981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.445004Z","title":"Reversed in time: A novel temporal- emphasized benchmark for cross-modal video-text retrieval,","venue":null,"work_id":"e6ee4532-759f-4227-8ed6-86a71fbd367e","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.225770Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:ec6c3ba6f409722184afe6d2059a89d1c80de6583b214dd997c1258fec7b5cb4","observation_id":"c37c38c7-ec0d-4d56-b704-a6a85e782de2","resolution":{"observed_at":"2026-08-09T10:51:29.449360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.228981Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.228981Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:9477c959473b364c3d2b0998cd134246ec04319e864a7a8b87f3c1ef5d49737a","observation_id":"4789df69-4273-4670-8185-82ec70e6dc28","resolution":{"observed_at":"2026-08-09T10:51:29.228981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.428749Z","title":"Improving clip training with language rewrites,","venue":null,"work_id":"4fea3f3c-d4fa-465a-a866-2106b0f8ebdd","year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.232535Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:bc60e7f00c890791a8bd9dc2625b202f1ddd2ec0cd519e0da09a24204b787da8","observation_id":"e9d3b8af-35c7-40a5-93c1-28f4693e274a","resolution":{"observed_at":"2026-08-09T10:51:29.432178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.417762Z","title":"mplug- 2: A modularized multi-modal foundation model across text, image and video,","venue":null,"work_id":"09a3805b-7c31-4c03-be9b-bfb69b2dc922","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.235914Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:8519bf523d45fb0182cfad8f4fe2bf6396d21a7adb505cb07f55e37f08afabcf","observation_id":"99361dea-d931-4b7d-947d-87196362e4d6","resolution":{"observed_at":"2026-08-09T10:51:29.421805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.406141Z","title":"Dual-modal attention-enhanced text- video retrieval with triplet partial margin contrastive learning,","venue":null,"work_id":"a4d42687-a470-48bf-af7c-80741129d39a","year":2023},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.239182Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:573d7b9432b032e89b49d282e62163dc95aa55b40c803b02fc269d46b409fccf","observation_id":"a98214e6-1284-46e5-9904-eed78540db68","resolution":{"observed_at":"2026-08-09T10:51:29.409994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.395693Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"3552cc3f-0627-469f-b6d2-c73d6610bf4d","year":2016},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.242862Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:d4f5703aff7a0445d34666087ef2d393250bfd30e4c95e8af9198f3afa9f65db","observation_id":"22e7c9ee-d26f-49db-a4e7-d6b331c666b5","resolution":{"observed_at":"2026-08-09T10:51:29.399288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13487","last_updated":"2020-02-14T04:32:35Z","snapshot_observed_at":"2026-08-15T00:09:10.811238Z","submitted_at":"2019-07-31T13:19:37Z","title":"Use What You Have: Video Retrieval Using Representations From Collaborative Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13487","snapshot_observed_at":"2026-08-09T10:51:29.246066Z","title":"Use what you have: Video retrieval using representations from collaborative experts,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.246066Z"},"links":{"cited_paper":"/paper/1907.13487","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:2e75c413d44df15278746beb1b491e00fa69021a1ae7af5378092a0f439ddc1c","observation_id":"c5b5af83-5b05-4bd8-b152-d263ee9880ce","resolution":{"observed_at":"2026-08-09T10:51:29.246066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.384750Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":"93d0bac6-297f-4c7e-8de2-0034e16ec423","year":2011},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.250564Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:d24bc5dd41f39b367cd1024a77922d528a2023665a2001d3023644d5dc6905fa","observation_id":"566b2468-af15-439a-8062-096dc8610593","resolution":{"observed_at":"2026-08-09T10:51:29.388645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.373440Z","title":"Localizing moments in video with natural language,","venue":null,"work_id":"1c6d4f27-35bc-4614-bbf6-c52db62c3e27","year":2017},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.254278Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:524891bfd4b24f6a9ac28e2eb1235cf7d861f9092ec800177b76dc14f940e259","observation_id":"70739db6-90e6-4f3f-8833-9c40e6eedc32","resolution":{"observed_at":"2026-08-09T10:51:29.377289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-08-17T15:25:09.479397Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-09T10:51:29.257437Z","title":"Bge m3-embedding: Multi-lingual, multi-functionality, multi-granularity text embeddings through self- knowledge distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.257437Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:e7c545b51fa993a3abfee477295de504a8d0c2425d69c79a62d2153fef41c2b7","observation_id":"b034008b-686c-4a8c-b0cc-f03527e36b19","resolution":{"observed_at":"2026-08-09T10:51:29.257437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:51:29.360144Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning,","venue":null,"work_id":"3ffa06ab-df91-42bd-8f17-b911ed75dca3","year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.261016Z"},"links":{"citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:3f463bd53b362bbd1c3bb3182c4cf4b1b25c77b04615126b45844ef0a2de6a64","observation_id":"914bb2f5-da5f-4acd-8c7d-14a79bc37ffa","resolution":{"observed_at":"2026-08-09T10:51:29.365989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T18:30:45.537724Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2502.02885."}