{"as_of":"2026-08-08T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68dd2670f28d1ba8548872295a28c7d33fda22c830d77d09bd02274cb22c50ef","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:04:06.870962Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03589/citation-record","integrity":"/paper/2506.03589/integrity","json":"/paper/2506.03589/citation-record.json","paper":"/paper/2506.03589"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.219678Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"d99e5cb9-cc84-427a-828d-9dc4560a2021","year":2021},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.503340Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:e8a3504947df52bbb61fe3741cf3d3aee2da3b0630156d1d4556a4a28af15729","observation_id":"37d895d2-34b3-445c-af50-209203f129fe","resolution":{"observed_at":"2026-08-07T11:04:08.225088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.202672Z","title":"Man is to computer programmer as woman is to homemaker? debiasing word embeddings.Annual Conference on Neural Information Processing Systems (NeurIPS), pages 4349–4357,","venue":null,"work_id":"fe76d115-c265-4f11-848a-77e78a028474","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.508471Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:67b80d6ca242e97bf8322b17ee77b191101c00c53f39c55c8e76cea60f59df1c","observation_id":"170f9ec9-47b0-4dda-98db-b60cb63ef068","resolution":{"observed_at":"2026-08-07T11:04:08.208120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.187983Z","title":"Chen and William B","venue":null,"work_id":"692bdf78-5051-4cd0-bb0e-6222a769a4b9","year":2011},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.513265Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:cbfd2ee6e0f89f21615679fc49aae4c777cc1248ad34c82f501b978b05164006","observation_id":"8d7412a1-a379-4daa-ac8b-fcc9eddebdec","resolution":{"observed_at":"2026-08-07T11:04:08.192631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.173650Z","title":"Fine-grained video-text retrieval with hierarchical graph reasoning","venue":null,"work_id":"d3f5dc0c-ca56-4e4b-98d8-4284c588a696","year":2020},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.518420Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:4fc3c53321feeb5c44cd2637f84ccaf024926e3d1a82899c97c3361da9ef03eb","observation_id":"6a7b287e-9a16-4f60-8f42-5e29fb8e4502","resolution":{"observed_at":"2026-08-07T11:04:08.178099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.157797Z","title":"”factual” or ”emotional”: Stylized image captioning with adaptive learning and attention","venue":null,"work_id":"aabbed94-e293-47be-a11e-efd901c7d87a","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.523490Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:6e6db05dd4f600667ba647ea7dc14580d47f38caa8ace43cf66a36f8f1e2d9ca","observation_id":"aeb23d3b-4289-410d-97a3-c2c325d0427e","resolution":{"observed_at":"2026-08-07T11:04:08.162718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.141034Z","title":"Tagging before alignment: Integrating multi-modal tags for video-text retrieval","venue":null,"work_id":"23099b44-d6d6-439f-a02a-6226bdff286c","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.528321Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:bb9d1c0b9411a01b0d239133f0a6e0a6dfb2f608732af5a6c226d28231d67062","observation_id":"4adf04fb-028b-4c48-bb7b-d9aad32dfb76","resolution":{"observed_at":"2026-08-07T11:04:08.146742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.125666Z","title":"UATVR: uncertainty-adaptive text-video retrieval","venue":null,"work_id":"138bd614-0c5c-4b3e-9c58-b45c73473882","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.533323Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:86d782c57f3f0087f7ffc1badfb1c1a884a9c2f2b056a99dd82bda7e765aa67c","observation_id":"be487dbb-982a-48f8-87e5-d3d0c7f9a859","resolution":{"observed_at":"2026-08-07T11:04:08.130551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.108056Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"a0586980-b51f-42d6-bdae-f12b5f3145f2","year":2020},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.537925Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:e2c43bb3300d1a33f5cfe0d07cf37277ac42369dfa1eca37696c47244f161383","observation_id":"1f309bb7-b7a6-4d55-a47b-31324762a0c5","resolution":{"observed_at":"2026-08-07T11:04:08.113451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.090324Z","title":"Word embeddings quantify 100 years of gender and ethnic stereotypes","venue":null,"work_id":"a1fe9743-4c52-4b9c-a645-d9adc257d0a4","year":2018},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.543202Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2c1199f75733ad7d2151cff980fa124da4d7e7cd2d2ed680259cdd0d3dbc94f3","observation_id":"e756754b-57d5-4726-a28c-601d9aea8296","resolution":{"observed_at":"2026-08-07T11:04:08.096333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.073163Z","title":"X-pool: Cross- modal language-video attention for text-video retrieval","venue":null,"work_id":"73a3dd09-5c39-4c7c-aaba-bed30587674a","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.547830Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:f5581b20ac76f782943fa7849782446bc4b5e0e353a18974a850782609d8eaf8","observation_id":"229b0881-9513-4611-b548-f08ceb170d29","resolution":{"observed_at":"2026-08-07T11:04:08.078958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.054383Z","title":"Girshick, Pieter Noordhuis, Lukasz Wesolowski, Aapo Kyrola, Andrew Tulloch, Yangqing Jia, and Kaim- ing He","venue":null,"work_id":"1394bfd8-8d91-4832-86aa-86a538fdc7e0","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.552444Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:e44f1e08d2da1861f86560a146344f0e3fba022d9233a0b58c1227c33dc5c234","observation_id":"74905427-b284-4898-8ca9-7fd21f3fb456","resolution":{"observed_at":"2026-08-07T11:04:08.061079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.038648Z","title":"Mscap: Multi-style image captioning with unpaired stylized text","venue":null,"work_id":"7fad9fa7-732b-408e-b78b-21104f887244","year":2019},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.557385Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2ca7dfe1a3edf3af306a15cc7abfbfd802f6f123d96ead5551a124bdb7e020f6","observation_id":"49c9091a-c126-4c86-8d82-619b9fe343a3","resolution":{"observed_at":"2026-08-07T11:04:08.043200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:08.018682Z","title":null,"venue":null,"work_id":"7415a299-ecff-414e-92ec-fcb6f1f1ce5f","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.561785Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:803e893fcb5ff7850d7e5f0e0647e08479c3faef2b2658d9c2854ee5b04b0f07","observation_id":"168b2492-37d5-403c-a6c0-45e32bb122f2","resolution":{"observed_at":"2026-08-07T11:04:08.024603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.988347Z","title":"Burgess, Xavier Glorot, Matthew M","venue":null,"work_id":"14f2e97f-9a3f-44c7-a90e-586063054ce3","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.566038Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:6623b58083d81ac0803810b3f6474db1bc7f2cd5f496acc4498315d1875cc955","observation_id":"32fd2c9e-cce8-4c7e-a81f-a354ced30798","resolution":{"observed_at":"2026-08-07T11:04:07.999496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.972025Z","title":"Reducing sentiment bias in language models via counterfactual evalu- ation","venue":null,"work_id":"1b80b77d-ab81-499d-9fad-86b49057bafb","year":2020},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.570466Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:3d14110f6cbebb53dac10d203692bd4052693360835873b29bab92c5dcf38cd1","observation_id":"ccc6cc9c-7666-406c-bea0-644e84cd562b","resolution":{"observed_at":"2026-08-07T11:04:07.976714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.952044Z","title":"Narrating the video: Boosting text-video retrieval via comprehensive utilization of frame- level captions","venue":null,"work_id":"fa767ada-6c5f-4a81-af67-b482920dfc92","year":2025},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.575010Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:052dd638f421d978ce8fdaa145943b45aecc15d3822182a702e7b70f0e7ff743","observation_id":"66ee8173-5bf4-40b3-b739-968d6ad437ab","resolution":{"observed_at":"2026-08-07T11:04:07.958727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.936690Z","title":"Imagenet-x: Un- derstanding model mistakes with factor of variation annotations","venue":null,"work_id":"7698e301-7db6-4c1e-9440-773c55543d67","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.579164Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:5f94d6b8f59835a0b3745303af4bf7ae41e2d46bff890a0f732cdd7667e1da4d","observation_id":"8e5c6f52-c8ce-4c68-9668-5c2fbb6de9aa","resolution":{"observed_at":"2026-08-07T11:04:07.941350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.921180Z","title":"Clifton, and Jie Chen","venue":null,"work_id":"734a8b15-71cd-477d-8685-766b03b8a99f","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.583124Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:54933460bd243011edab9d2a920b9de94bf3f826b2feb6bb5dbe6ef94e0a5d7d","observation_id":"6c97bd6c-e8f0-4378-84b0-a16ec8d047f9","resolution":{"observed_at":"2026-08-07T11:04:07.926775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.904499Z","title":"Video-text as game players: Hi- erarchical banzhaf interaction for cross-modal representation learning","venue":null,"work_id":"61a2580b-3e54-477b-ac14-ce30785af1af","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.588403Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:223d5945fd6dbbdf04f2dcfb350ca1a9fe82fe2e8d346b47676dce402f99d7e1","observation_id":"7221a011-802b-46be-81b6-246f04669e30","resolution":{"observed_at":"2026-08-07T11:04:07.909624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.888659Z","title":"Text-video retrieval with disentangled conceptualization and set-to-set alignment","venue":null,"work_id":"5f5d7a78-2fff-4102-9e8f-addd9254308e","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.593093Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:dac17b2eed1ed7262a3d4166569d4ce4a36a01131febecbbc6fa4f15634c6121","observation_id":"0d4653e5-d9fa-4201-b9f7-51a4e8a467e8","resolution":{"observed_at":"2026-08-07T11:04:07.893529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.869266Z","title":"DiffusionRet: Generative text-video retrieval with diffusion model","venue":null,"work_id":"65c0afba-e480-4375-99d0-33f7e8735de0","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.598200Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ec8a3a52239f6f1381e3464bb996d8f2cf710b9cdea8017bdff83e07472a3073","observation_id":"c677f278-7e7a-4e80-9263-2a88caf0f5c2","resolution":{"observed_at":"2026-08-07T11:04:07.874776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.851441Z","title":"Disentangled representation learning for non-parallel text style trans- fer","venue":null,"work_id":"39f1e424-fe15-4548-9d45-2fc18cf3fa57","year":2019},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.602709Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:f2521719d4d74b5fcb6c601980aa5a939c4399c87df59f877427b7952610504a","observation_id":"b6b19630-9bdb-457e-b0a3-7ffab27740b5","resolution":{"observed_at":"2026-08-07T11:04:07.857036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.832611Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"0737aef2-53fc-46f4-a661-571a86f1eb7d","year":2015},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.607438Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:1ce61286b02d53c1f53cd552c53e4d3d90098309186fb1cfe7ddc747817c532e","observation_id":"52ff3296-d78e-4a35-98d3-d0b83c12f39a","resolution":{"observed_at":"2026-08-07T11:04:07.838832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.813972Z","title":"Kingma and Max Welling","venue":null,"work_id":"133d71c1-e13b-49a2-b11c-75a5b7100e2e","year":2014},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.613057Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:d88c8025825ce923604b59fbf9597d31f37d44b386943b408df906084e22a943","observation_id":"4f4a0ee0-b635-4cff-ba4d-0bd3ec01c018","resolution":{"observed_at":"2026-08-07T11:04:07.819429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.798534Z","title":"Dense-captioning events in videos","venue":null,"work_id":"78307010-a06e-4909-973f-5e2a4e634793","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.618291Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:35fa097da372eae9fc40318b37786048f1ec9ce8724bd80b6aaa9ea0a8b28126","observation_id":"ce3a2415-943a-4c11-a8e8-ac04ece91984","resolution":{"observed_at":"2026-08-07T11:04:07.803203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.781631Z","title":"3db: A framework for debugging com- puter vision models","venue":null,"work_id":"a6651524-0a06-4c4c-a60a-c02799bbe0b1","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.622852Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:bed6bc0dc2f65e6c866b83b2bd6e1b8fda3d2b9f20855cde15fa35813075da31","observation_id":"73c7429e-10e0-428c-baa8-8799598f98fd","resolution":{"observed_at":"2026-08-07T11:04:07.787748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.765764Z","title":"Berg, Mohit Bansal, and Jingjing Liu","venue":null,"work_id":"9c2fee7d-3eb0-4978-9852-d2108d95d4a7","year":2021},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.627631Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:29156f347ed7250d779b482db1be152105fe1e475750cfaa41b076a714bc9c50","observation_id":"0b3362f0-d73c-49bb-9e59-1e991ee45f74","resolution":{"observed_at":"2026-08-07T11:04:07.770760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:04:06.632515Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.632515Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:21cced1ea542bd91d7d3eccbbfbe4cf7b86fa48fc1ccea723c8e9dba2d8797ad","observation_id":"cc97236b-55e6-4a2f-a837-c24c04300d49","resolution":{"observed_at":"2026-08-07T11:04:06.632515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.750209Z","title":"Prototype-based aleatoric uncertainty quantification for cross-modal retrieval","venue":null,"work_id":"8fbacb92-266d-4ad4-b2d6-81deb7709fb4","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.637552Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:7d8ab9cca868c7576047c323bfc55a74f1ffafbd778dd2754789fbf040148695","observation_id":"88c616aa-1db2-4987-ad7a-c102da654df9","resolution":{"observed_at":"2026-08-07T11:04:07.755279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.734199Z","title":"Blip: Boot- strapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"c048ea3e-f4b4-4d81-bd70-0a0b207739b7","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.642098Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ed149b93b75dd6afb8048f46c64f2afcfc52ce86771bb7dd96dd3fda21976ee0","observation_id":"70563c63-f49a-40d0-ab8f-7faabb02534b","resolution":{"observed_at":"2026-08-07T11:04:07.739289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.718704Z","title":"Clip-event: Connecting text and images with event structures","venue":null,"work_id":"2f641c8a-b682-4fcf-99e8-8d088bba8acf","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.646797Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:d9a20e2169e5dcf4fb26ddc32181d96eb7788aa1703a575cfc2c1c4c8dfc2cb8","observation_id":"c4f7c7bc-ac61-4039-8e16-d3bba474639d","resolution":{"observed_at":"2026-08-07T11:04:07.723396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.702442Z","title":"Towards debiasing sentence representations","venue":null,"work_id":"7d2d5730-7b42-4768-b321-3a9ebc55a22c","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.652173Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:bdea7a1f5512cdf7d37ef6e7bb8388a97ed34a9812eb8a55ee515abca11ca50a","observation_id":"ca7d9689-99f7-4d91-8e2a-b97f72c530ac","resolution":{"observed_at":"2026-08-07T11:04:07.707315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.686900Z","title":"Text-adaptive multiple visual pro- totype matching for video-text retrieval.Annual Conference on Neu- ral Information Processing Systems (NeurIPS), pages 38655–38666,","venue":null,"work_id":"2edfc6c7-9036-4e45-a3d3-a8a488490480","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.657003Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:848cb91b62efa072aa2b57b1531a4ccb185a0dbbe60dacb3655071946df284fd","observation_id":"ea17532b-9e5d-43ae-83ad-73170d3913d5","resolution":{"observed_at":"2026-08-07T11:04:07.691947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.670851Z","title":"Disentangled multimodal representation learning for recommendation.IEEE Transactions on Multimedia, 25:7149– 7159, 2022","venue":null,"work_id":"82ff76ef-3451-4feb-abd3-08d672e24103","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.661918Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2d79da29d3e152dbeac1da4f418553d391285f037a646b81c1017126b3111d52","observation_id":"a1189552-8ce7-44d3-9b46-8836e4345609","resolution":{"observed_at":"2026-08-07T11:04:07.676034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.652570Z","title":"Ts2-net: Token shift and selection transformer for text-video retrieval","venue":null,"work_id":"ed676b9f-1a42-4708-a890-a272d5494043","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.666267Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:95afb8b8b7d8640bb515a6c1312e8d4bff6dfe20a6d1df0c12a5acb523094a1e","observation_id":"66de7fee-7f47-4b6a-b8f4-057cc5505204","resolution":{"observed_at":"2026-08-07T11:04:07.659399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.630608Z","title":"A decade’s battle on dataset bias: Are we there yet? InICLR, 2025","venue":null,"work_id":"84a5887f-c99f-42d0-b405-4d9f6c145319","year":2025},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.671726Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:4670a20885c5b129cb5e5d081e9eefaaf214d0c1d935dc1a7dd90bd8d6ea9444","observation_id":"257b646d-e30a-47c2-a928-caf29e8e0780","resolution":{"observed_at":"2026-08-07T11:04:07.636759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.599957Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neurocomputing, 508:293–304,","venue":null,"work_id":"a3765a37-276a-49fb-b087-7490a4866e83","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.676370Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2429fba113e92c4e7467e010b757c9ee01c1c91f1a94c131a0a1746046e9d0a7","observation_id":"79ffc9f8-52f8-4cd9-9009-c00c1bf75211","resolution":{"observed_at":"2026-08-07T11:04:07.605157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.582781Z","title":"Hauptmann, Jo ˜ao F","venue":null,"work_id":"a3f81d77-b81b-45d8-9385-67cc239d2d9c","year":2021},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.681627Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:e2dc57c2379c76e0e250d0d195c956e65ca563565f5de5b55498b0a714aac68c","observation_id":"dd2b4a7e-ae1f-48f7-913c-cc1dcfc95902","resolution":{"observed_at":"2026-08-07T11:04:07.587494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.563661Z","title":"Find- ing and fixing spurious patterns with explanations.Transactions on Machine Learning Research, 2022","venue":null,"work_id":"f130c016-a241-484e-8049-497cc95db60c","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.686895Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:65a59a170abc3aa31b9e6732088289d60273b72605a9e8978a7bd28370f4bfa4","observation_id":"cf747373-4554-4b49-9b0b-f648dfcfa9c0","resolution":{"observed_at":"2026-08-07T11:04:07.571356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.529805Z","title":"Learning transferable visual mod- els from natural language supervision","venue":null,"work_id":"62dce499-914b-4638-a647-c4a3d8388e18","year":2021},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.691437Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ee5de1c500603964388e1b537abcca308c742893f6bb69b63efad9961ab7019f","observation_id":"e2456427-48a1-4fd4-9bd1-f3d3ad196fc8","resolution":{"observed_at":"2026-08-07T11:04:07.538376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.509363Z","title":"Movie description.International Journal of Computer Vision, 123: 94–120, 2017","venue":null,"work_id":"a3d627cf-1127-455f-8bdc-5bb8a35fe207","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.697424Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ff0141b1c0c07a9b6b02b00c9106dc594a17f7dfac1407db3c7f10a3db2a2dc5","observation_id":"01338411-91d9-4d93-9979-a8fe3ff983bc","resolution":{"observed_at":"2026-08-07T11:04:07.515973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.490260Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"47568201-2c13-4867-b54d-2c3c5b7327dd","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.702516Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:7dae3f8fa02279238f6e5234d2bcf36e6de5b0e99866f21e5ba694b7d74b14d6","observation_id":"3af9e6db-9d12-47ed-88b4-a3d6e929a511","resolution":{"observed_at":"2026-08-07T11:04:07.496267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.470811Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval","venue":null,"work_id":"d79ae5a8-9907-4c8a-baea-3f2063785d9b","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.707267Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:960f62cc5a232b0d810b557bcae97adbe2df1eb73c46723b957e66a82da79697","observation_id":"15e59e41-8262-4cc9-91df-69dc30cfa90a","resolution":{"observed_at":"2026-08-07T11:04:07.476355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.453898Z","title":"In-style: Bridging text and uncurated videos with style transfer for text-video retrieval","venue":null,"work_id":"f3ede3f8-6609-46e3-aa66-7805b74e7a05","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.712127Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:b77875367ce63b754d4836748d15d264add0e403b271690354c0dfa1897af98e","observation_id":"950ccd69-3f02-490d-98bd-d03f335ad74c","resolution":{"observed_at":"2026-08-07T11:04:07.459359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.437508Z","title":"Unbiasing through textual descriptions: Mitigat- ing representation bias in video benchmarks","venue":null,"work_id":"96d68aeb-805c-4d90-81ad-f6a683eaf002","year":2025},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.716822Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:0cffdd65860dec898cba211293d67792030b66d8e72b19e0ad0c5be96b13d9eb","observation_id":"3e400561-23ac-4728-a00b-2b1d578c19c1","resolution":{"observed_at":"2026-08-07T11:04:07.442309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.418927Z","title":"Belding, Kai-Wei Chang, and William Yang Wang","venue":null,"work_id":"98e5dc34-348b-439a-ba1e-8622ba0cce57","year":2019},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.721597Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:d7a13efd8c4ba8cdbedc9d297c1f8e659b8be052dd91a48bc93e4450e2619013","observation_id":"6e37c67d-662e-4f4e-a665-1980d9ed3a21","resolution":{"observed_at":"2026-08-07T11:04:07.423449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.403702Z","title":"Detach and attach: Stylized image captioning without paired stylized dataset","venue":null,"work_id":"bdc52f37-d913-462c-b1ea-9ced810aa2aa","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.727033Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:c524aded48d247cc7ff92bf49bd3870f02e513a4ff0eeb398627ffa10fe6a705","observation_id":"a682861e-2c7c-42a1-9ec7-ffc00682187d","resolution":{"observed_at":"2026-08-07T11:04:07.408518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.387281Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"55533d97-68ed-4029-81fc-73411caaf2b7","year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.732765Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:fa9197f2de24d421234812743b4af2a7cfd05d91b33336ca6055896ffe1b9dab","observation_id":"9ad7de97-29d6-4cf9-be6b-3cc55a206ddd","resolution":{"observed_at":"2026-08-07T11:04:07.392585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.372413Z","title":"Holistic features are almost sufficient for text-to-video retrieval","venue":null,"work_id":"36fba9a5-4269-4ac2-85b2-ee79974f90e7","year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.737531Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:66914dfd2a12fece9ea1a218edb2ab7796d6c3c1b229cc938ab99eff3cbab9ce","observation_id":"7ce73968-b1bf-45b8-b9f4-82eb5ddfff49","resolution":{"observed_at":"2026-08-07T11:04:07.377348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T11:04:06.743359Z","title":"Representa- tion learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.743359Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:cffcaaa49df0555d8ab21db900e0c0fd9a2b3a02ab5d641428ddd83cf3614f1a","observation_id":"f57ee609-eb93-4931-8698-1834a4f30bcd","resolution":{"observed_at":"2026-08-07T11:04:06.743359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.354123Z","title":"Visualizing data using t-SNE.Journal of Machine Learning Research, 9:2579–2605, 2008","venue":null,"work_id":"68eb0b16-f424-48b5-be6d-092a9e0103af","year":2008},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.749768Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:9fda18515fd7f33de316723cfe41de698216f64a048c94c2c5f52d556c787dc2","observation_id":"8d70c2fb-0c01-4c3d-9e5b-2c5c6a4fd046","resolution":{"observed_at":"2026-08-07T11:04:07.361184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.335840Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"353e90a1-e851-4f7f-821d-3ee4c9b39e15","year":2017},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.754364Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:1fbac912deabba8f759c0718c96ceed36f490a8155474b42e9f3db9fda3fb2a5","observation_id":"71d674a7-de73-416f-abeb-1ec3d5191398","resolution":{"observed_at":"2026-08-07T11:04:07.341857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.315867Z","title":"Aoe-net: Entities interactions modeling with adaptive attention mechanism for temporal action proposals gener- ation.International Journal of Computer Vision, 131(1):302–323,","venue":null,"work_id":"12d9f474-9e0b-4385-9cfd-7f894050a116","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.759232Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:03313d026b9650d64bc086250827ace888154fd8cb7f6e0df4a0cd6d172c8601","observation_id":"1823b0d6-669b-42fb-8ece-118cb8b9eaf3","resolution":{"observed_at":"2026-08-07T11:04:07.321829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.298608Z","title":"Dianat, Majid Rabbani, Raghuveer Rao, and Zhiqiang Tao","venue":null,"work_id":"1f6277db-fea6-4288-b078-eb170b69e172","year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.763574Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:c49e6c37620704c5a3747d26d8a9e6f774f9e1c741b83987cee33106e681224e","observation_id":"b0069af1-fd92-41d4-9fb4-437b744df6de","resolution":{"observed_at":"2026-08-07T11:04:07.303786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.282269Z","title":"Towards fairness in visual recognition: Effective strategies for bias mitigation","venue":null,"work_id":"688f45bf-46c0-421c-8ea9-73a7560da7be","year":2020},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.768315Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:c4af10ad261023156eb0ec6a3013131aae1a82bf911b28bb7351b69061d4191b","observation_id":"d9a96611-65c5-4859-850b-dd2da7be35c6","resolution":{"observed_at":"2026-08-07T11:04:07.287611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.267351Z","title":"Text proxy: De- composing retrieval from a 1-to-n relationship into n 1-to-1 relation- ships for text-video retrieval","venue":null,"work_id":"13e0176f-2629-47eb-a34a-319b9b8c042c","year":2025},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.772716Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:e7ab028dc7df1ede6d034ded5e9b549543b198ff4163c848f3d1731da9bfcea5","observation_id":"f49c1913-67e1-4d94-9652-25b87cf2e450","resolution":{"observed_at":"2026-08-07T11:04:07.272177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.251796Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"2f2cab68-9be9-4d18-86da-e068eec49318","year":2016},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.777207Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ada368368bc9b67e3f676d4fe9b34e5705530dfd7ba54bfdf486cd3a1e3a097a","observation_id":"ea58361d-2d60-4baa-b104-05d3fb5a81f2","resolution":{"observed_at":"2026-08-07T11:04:07.256994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.235861Z","title":"Vltint: visual-linguistic transformer-in-transformer for coherent video paragraph captioning","venue":null,"work_id":"b1a4f66e-a538-42e2-b1e6-23fd020c93de","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.781831Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:d98f835a38cb63bf05c9cff14814b92c0ad0ebe38b6cdee5ed2ee91670814d66","observation_id":"0417153f-9687-4fe4-9138-a1fec28e17ee","resolution":{"observed_at":"2026-08-07T11:04:07.241270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.219546Z","title":"Video-text pre-training with learned regions for retrieval","venue":null,"work_id":"b4bdac66-1761-4957-a576-b3d875b71ffd","year":2023},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.787253Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:4e3f8c675b7b954bad4cb5e955c8233e5e3247c853156cd22fdc05fd09cf15ce","observation_id":"28fc1343-f53e-4a5a-a9cf-692204ed8500","resolution":{"observed_at":"2026-08-07T11:04:07.224964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T11:04:06.792244Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.792244Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:baf4b50cd762cb5a73f126a45e6aaad06e8d710f89a36989813bbeaaf0f729c4","observation_id":"64f44cac-f789-4f9a-aef3-9f00e4aede8a","resolution":{"observed_at":"2026-08-07T11:04:06.792244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.203219Z","title":"Dgl: Dynamic global-local prompt tuning for text-video retrieval","venue":null,"work_id":"875eac48-5fa5-4b79-901f-47027b6b9c03","year":2024},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.797139Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:ef2150e7c2bea839d87877a819638217929efd3a93e3200428a73a46ebcd4d77","observation_id":"0e9bc1af-0aa0-43d7-8d3f-f962a93f0a9f","resolution":{"observed_at":"2026-08-07T11:04:07.209116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.185184Z","title":"Coca: Contrastive captioners are image- text foundation models.Transactions on Machine Learning Research,","venue":null,"work_id":"66d3aad6-b746-4215-8e2e-754c9cde9e0c","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.801595Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:1fbddf8b4b5422c654268805f9f88fce977ff6868073c1e9623d7ebe0d604569","observation_id":"293d2f09-21d5-489c-9455-d8b1749481f6","resolution":{"observed_at":"2026-08-07T11:04:07.190155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.168533Z","title":"Gender bias in contextualized word embeddings","venue":null,"work_id":"fa79fce7-6589-4d07-9d11-84c2bde0aca2","year":2019},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.806141Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:df280a61b1a5f172c319b15e850a546393a369a47d6718aa55cd660c910ced3b","observation_id":"31021580-f50b-4974-aef1-5c64ce9a573a","resolution":{"observed_at":"2026-08-07T11:04:07.174155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.152822Z","title":"slicing mango","venue":null,"work_id":"38cad679-1f59-47ee-872d-6f18b450c31d","year":2022},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.810912Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:afa05c8902c090f455e68e58469a4af229b62a469c9340d8a61b0c05422bcd08","observation_id":"c54c937e-d13e-4ee5-98e0-13998c35818d","resolution":{"observed_at":"2026-08-07T11:04:07.157837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.136290Z","title":null,"venue":null,"work_id":"3ea6e023-2657-43df-9290-9c7b4de011bc","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.815682Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:a0a39c44b235a85db69967107253c16a4b35568094dc04eebdae5c80c116c52e","observation_id":"dd226f14-f365-48b4-be4f-37fa22c6a966","resolution":{"observed_at":"2026-08-07T11:04:07.141223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.114160Z","title":null,"venue":null,"work_id":"7f969913-44da-4b75-a189-229f2d4c9618","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.820157Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:44bb719ab3cb575008166c63d883195a40ea9792968d9a03fc4de57b7dca19cf","observation_id":"7eb032d8-0359-4101-817c-2ed070de52c3","resolution":{"observed_at":"2026-08-07T11:04:07.121550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.098965Z","title":null,"venue":null,"work_id":"28fb2961-51fc-4c86-a8a6-28f7c03d964a","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.824734Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:831d21d5f31cfb2cdd9b18ed71e4ea24623e1f23938db9f3d244ccb0daac5011","observation_id":"0e1613af-8c0b-4fca-8d9d-831b4050d33e","resolution":{"observed_at":"2026-08-07T11:04:07.103647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.084047Z","title":null,"venue":null,"work_id":"a3958f43-5866-46f5-9db9-e04eff9be811","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.829961Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:59f9f2ae6a3c84a0c37ebacb3bec34ff181a62cb16d33161670cd8d99d0f9b63","observation_id":"96e0427a-6615-4e60-baa4-280e41aa8250","resolution":{"observed_at":"2026-08-07T11:04:07.088783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.069110Z","title":"LSMDC 2) He slaps SOMEONE again","venue":null,"work_id":"79307f08-7cf2-4bd0-b0a1-2dd5e4c81e8b","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.834764Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:024fcc6870c5f36bd68811c9bbb6cbe623604f9ac6628d44b08a25545d8de3da","observation_id":"aab7983f-afef-4b2c-861d-d5e372c60570","resolution":{"observed_at":"2026-08-07T11:04:07.073952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.053646Z","title":"The cup spins across the floor","venue":null,"work_id":"745b56b5-d77a-42a3-bef8-ad54bba0a063","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.839675Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:40a1f4afaec4ea4249d7fe4861e516c5022b0f2f70c95469571679ecdaacf55d","observation_id":"f2893150-87b1-4c29-afa3-4f4cd3c14f8d","resolution":{"observed_at":"2026-08-07T11:04:07.059069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.035959Z","title":"ActivityNet 2) A woman is seen kneeling down next to a man","venue":null,"work_id":"04723517-4ac0-4c67-8acb-55113beda9f7","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.845267Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2e421b786b99eb4928529c4d800f73e54c4e761ec5cb1fdeb644f507c4567b09","observation_id":"dd1016d9-7a51-4d9b-aa3a-cafd0127b0bc","resolution":{"observed_at":"2026-08-07T11:04:07.042523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.017638Z","title":null,"venue":null,"work_id":"d1a4a20c-1a8c-44ba-bf4b-a1e1b2ae9479","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.850727Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:87902e9a76a845139545dd7038f3ed7a09f95e5afb39df435cacde65bec15bc7","observation_id":"34a9de46-5151-42a6-848b-91753b3c4ad1","resolution":{"observed_at":"2026-08-07T11:04:07.022704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:07.001181Z","title":"They first start crouching and hitting the ground with the sticks in a text)","venue":null,"work_id":"f2f405d8-83b9-409d-896b-7ddb91143f8b","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.855384Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:213741707e966fb122b45f143f0c2feb61a601d8f43509eb0cd16128e3173951","observation_id":"82655f37-f877-4303-a711-ed50835fef87","resolution":{"observed_at":"2026-08-07T11:04:07.006124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.985449Z","title":"The guitarist is looking straight up","venue":null,"work_id":"d010fc7e-85b0-4800-93ab-ee088ef0b127","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.860495Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:da54974db7130133014503b8c4ae11b4fdcafb02fc412084fb120a1761366ab3","observation_id":"e140e28b-5224-4e8d-8f3f-e3e65258d263","resolution":{"observed_at":"2026-08-07T11:04:06.989949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.969435Z","title":"White square exits frame left the camera pans back the way it came","venue":null,"work_id":"0f214eaf-6aa8-4cb7-94c7-bbafcf37d910","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.865613Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:2d2e067ca1716f498d128004a99f891ac370f41200cb737090a93abf9c0af18b","observation_id":"25e07902-8cda-4a4c-8cc9-94784d975fe5","resolution":{"observed_at":"2026-08-07T11:04:06.974937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:06.951751Z","title":"a woman spins around several times very fast","venue":null,"work_id":"2a621a52-17c4-4294-a329-25fc86fffdd1","year":null},"citing_paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.870962Z"},"links":{"citing_paper":"/paper/2506.03589"},"observation_digest":"sha256:77f617cea95e6bce8c21860d6008ecfcd6200932427cc0fd973bfc9f498498e2","observation_id":"72abfa9a-704b-4ddb-83c7-bdc57d53d2ff","resolution":{"observed_at":"2026-08-07T11:04:06.958337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03589","last_updated":"2025-07-07T09:47:46Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:57:03.470820Z","submitted_at":"2025-06-04T05:40:54Z","title":"BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2506.03589."}