{"as_of":"2026-08-19T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a026aaad12c2e99a9cba895557f76766dcdc45efb63eaf5cf679e10a360ba8d7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:42:28.284177Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10761/citation-record","integrity":"/paper/2412.10761/integrity","json":"/paper/2412.10761/citation-record.json","paper":"/paper/2412.10761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.243730Z","title":"Vilbert: Pre- training task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":"649a12c4-d96f-4570-bd45-0eb75f123503","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:27.999890Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:5935571019e79332ae34a0f7a86118a907a6fc5de3159b294d6f7310d46b00e9","observation_id":"1239b7d4-e612-4627-8a0b-131fae79a59b","resolution":{"observed_at":"2026-08-11T15:42:29.248782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.227917Z","title":"Explore instance similarity: An in- stance correlation based hashing method for multi-label cross-model retrieval,","venue":null,"work_id":"34530ca8-0531-4a82-9d24-f7812fcd1d96","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.005941Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:f40c8f0b5b5bcf6cc21f40ce28ab708712e2b295cf780518cca4d13497190935","observation_id":"adfb622f-6abc-4bde-adf6-4545f45d3e92","resolution":{"observed_at":"2026-08-11T15:42:29.233043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.211701Z","title":"Dynamic contrastive distillation for image-text retrieval,","venue":null,"work_id":"e8e80932-47e8-4660-a6c4-523c806fa3ed","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.011094Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:e090e27b7f119524f12f435dc01038e206cf1fcd4d22cf3d86ee640189904043","observation_id":"57acdcb3-d53e-420a-8311-d5d55dd634d1","resolution":{"observed_at":"2026-08-11T15:42:29.216828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.195779Z","title":"Covlr: Coordi- nating cross-modal consistency and intra-modal relations for vision-language retrieval,","venue":null,"work_id":"fd227345-a333-44e3-8fd0-9c0f26514c18","year":2024},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.016219Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:66a8c2f450c063a9c2c55b7757f2c1af084b726fe046ee85b5bab66a6fd496e7","observation_id":"35fd993e-a450-4ffb-99bd-867721edd71d","resolution":{"observed_at":"2026-08-11T15:42:29.200935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.179450Z","title":"Deep relation embedding for cross-modal retrieval,","venue":null,"work_id":"6dc16639-971b-4d11-ab96-8d5029a310ad","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.021170Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:7b9eeb5265d00391a6981da61aa888e29ef3706c23548f4c85e3fb9bb6afa01d","observation_id":"354e6e41-1021-4e05-8af5-e3a594e3e976","resolution":{"observed_at":"2026-08-11T15:42:29.184738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.163550Z","title":"Stacked cross attention for image-text matching,","venue":null,"work_id":"611c8c91-97fb-434c-b16f-f1ddc0b85b15","year":2018},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.025802Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:5e985a4c5c1c702cf452de5e69d2041f4c2b81f87751e1937c642276e71b5197","observation_id":"50c8c704-7147-4030-9fe2-e98ef76ff70e","resolution":{"observed_at":"2026-08-11T15:42:29.168613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.147647Z","title":"Cross- modal retrieval with partially mismatched pairs,","venue":null,"work_id":"97fcb704-8d2e-4c1e-9cb2-77dc03d53714","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.031672Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:a585746a3ee716d0fd3f15cd618a241d90e6e0263d10ffb9e309b4558b80a683","observation_id":"e9fb61ca-145a-4f7e-a883-840ad84ab2c5","resolution":{"observed_at":"2026-08-11T15:42:29.152702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.131379Z","title":"VSE++: improving visual-semantic embeddings with hard nega- tives,","venue":null,"work_id":"2edfabb0-70e6-4c51-bd3c-69a6bc410590","year":2018},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.036418Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:88238140812663bfbf13e0197f02eabf91c75fdebc892d0ce7e996d1ea9f7403","observation_id":"d714d033-7122-4f58-9990-ae090dd0e9f4","resolution":{"observed_at":"2026-08-11T15:42:29.136511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.098692Z","title":"Modality-specific cross- modal similarity measurement with recurrent attention network,","venue":null,"work_id":"d565892a-0778-4349-bceb-c7ff2b030d3e","year":2018},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.046002Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:a01c0b43f54befe261de955f5be4b59879804940328f526877465c6d22893109","observation_id":"c935032c-ba13-45a9-b7f2-75bd2eb337c0","resolution":{"observed_at":"2026-08-11T15:42:29.104002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.081396Z","title":"Show your faith: Cross-modal confidence-aware network for image- text matching,","venue":null,"work_id":"064dbb1b-56c0-42f8-9acd-7180e38f04d0","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.050976Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:8d4fd31f9c054a3e9370208898106e5cb64dd112870a336eba4773b79d60f35f","observation_id":"521bf46d-763b-4c28-9736-5616af8ad40a","resolution":{"observed_at":"2026-08-11T15:42:29.086748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.115292Z","title":"Similarity rea- soning and filtration for image-text matching,","venue":null,"work_id":"aa63e977-3faa-40d7-87a3-414f2fb7092d","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.056043Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:09508a9cf7f8dfef2d7d819bfe9f3d4bf5dd60e850afdd030c1d2bca6c63c02a","observation_id":"35e6e395-2ccb-481b-82a0-409c2449c9a6","resolution":{"observed_at":"2026-08-11T15:42:29.120410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.064625Z","title":"Towards lightweight transformer IEEE TRANSACTIONS ON IMAGE PROCESSING, DECEMBER 2024 12 via group-wise transformation for vision-and-language tasks,","venue":null,"work_id":"29c7de79-f96f-428e-95b1-7bc6ba2b28a3","year":2024},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.060979Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:5c026a320c2185f400ff061182f10ed0c23b43cd54081e523f76a5f5587bd476","observation_id":"da98783f-b48d-46ea-b59a-d2d1e0fbf280","resolution":{"observed_at":"2026-08-11T15:42:29.070084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.047699Z","title":"BLIP: boot- strapping language-image pre-training for unified vision- language understanding and generation,","venue":null,"work_id":"597258d3-2912-419b-b9f0-50fff1f99dde","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.065899Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:d45b1aeb981322c30618a1f385492dae5eeb2be42f99f32ce58b57c612cd50a1","observation_id":"dacc8a09-ca20-46eb-8eaa-368d7cd23813","resolution":{"observed_at":"2026-08-11T15:42:29.053248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.030644Z","title":"Learning semantic relationship among instances for image-text matching,","venue":null,"work_id":"316e4fa9-9f9c-478c-a120-fcd06cbbd1de","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.070714Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:4ab9ba1b36c0b66176f4a83120e1b1afa40b8112afcecbd4e35ee52c0cbf54f9","observation_id":"79485594-ffc3-4edc-a93b-e0d3559e4b27","resolution":{"observed_at":"2026-08-11T15:42:29.036038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:29.012567Z","title":"Co-training with insufficient views,","venue":null,"work_id":"682e067b-23b6-4e05-8b79-4413753ae946","year":2013},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.075764Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:ca770787226b35d56e1d380fbb0d7f3c883ae80b8e669e1c9214bf83d365e80a","observation_id":"bb9bfdcf-36fc-445a-8c39-a02dab175cd7","resolution":{"observed_at":"2026-08-11T15:42:29.018578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.994679Z","title":"Multi-modal mutual attention and iterative interaction for referring image segmentation,","venue":null,"work_id":"6e45382f-427a-403c-8dfa-347d402eb66a","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.080609Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:41755e140424dd39cb7b88a76888060dc20e2514cbddbd4cf67c16b654871993","observation_id":"e6bebe61-0add-4e05-b761-302e18295437","resolution":{"observed_at":"2026-08-11T15:42:28.999862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.977909Z","title":"Auxiliary information regularized machine for multiple modality feature learning,","venue":null,"work_id":"f4dbd22c-6108-4a7f-a1be-718c8826b6ba","year":2015},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.085742Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:8ac29aa078e179c946f8ade4cb4402fe8816f1349cca23add91e796e48444acb","observation_id":"3018a639-0b03-4166-a39b-7516f07a50f6","resolution":{"observed_at":"2026-08-11T15:42:28.983479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.961155Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning? (provably),","venue":null,"work_id":"52bc4fda-eb0b-4c5f-acae-637373c9649e","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.090585Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:eb01915f9a461512c70fa13b75bfa89f9f44fc4469c4b24235ea83b3f214b34a","observation_id":"e6029caa-7ccd-424f-94c6-cbc9ef82f26f","resolution":{"observed_at":"2026-08-11T15:42:28.966623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.944572Z","title":"BERT: pre-training of deep bidirectional transformers for lan- guage understanding,","venue":null,"work_id":"848806b7-a557-4d46-8336-0319a68b6d3a","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.095497Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:04b02bfd2ff078b0dc2bc70e5c0e5ab009d53822c2aef665e50f9a68bf7637dd","observation_id":"578d0eb8-cff5-42d4-8beb-4d1c8fcd2a8e","resolution":{"observed_at":"2026-08-11T15:42:28.949795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.927856Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"3bec6c6c-8dbf-4f27-a2a7-34c7b49107a8","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.100278Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:955de28182ff088ae3b37c28344c4eaf7ffadef22be9de17b07b5d1352ef1007","observation_id":"36720ff9-8ca1-43ae-8512-259f5f25036b","resolution":{"observed_at":"2026-08-11T15:42:28.933138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.104943Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.104943Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:cd5aebdf2398d9191d34f73559ea95fa555c61aa79fcd18ec769889ac6f11919","observation_id":"47273d1f-a8db-4662-b99f-cd94c39521dd","resolution":{"observed_at":"2026-08-11T15:42:28.104943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.897381Z","title":"Rethinking label-wise cross-modal retrieval from A semantic sharing perspective,","venue":null,"work_id":"037d9989-87b3-49df-a25f-6a4ff3bd1761","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.109529Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:9d17e6c299b8741422ec08728acfb58f84b83d47ef169e0ea872f6f0dd23e521","observation_id":"bde5093d-13af-4558-8ef1-bf9b1302c991","resolution":{"observed_at":"2026-08-11T15:42:28.902668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.880862Z","title":null,"venue":null,"work_id":"ee52ce73-864a-4989-a989-810e1661090b","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.114406Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:34b472d3439ad2964908c19ddb4506629ea6e945eb271516b7cbe88d4c29d79e","observation_id":"051ea1b3-817b-40a2-813b-3b3e70bb8e48","resolution":{"observed_at":"2026-08-11T15:42:28.885981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.863745Z","title":"Joint feature synthesis and embedding: Adversarial cross-modal retrieval revisited,","venue":null,"work_id":"9130bd3d-9693-45bb-b5a0-b1600b254806","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.119152Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:8187170090456a3187729e1976ebd70e37fe80afeb74a5b2961ad1f62c3a9554","observation_id":"bc50d7c9-aeff-4e7a-b67e-3303ab6de79f","resolution":{"observed_at":"2026-08-11T15:42:28.869062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.846920Z","title":"Ad- versarial graph convolutional network for cross-modal retrieval,","venue":null,"work_id":"e32197b4-251f-4190-a479-e73a50182ac9","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.123955Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:16b735396827d92d18f0b6232f035e8ed5598bf862a51a51065724ad666b04f5","observation_id":"a33c4c2f-5235-4f92-83c6-ed9afb76c422","resolution":{"observed_at":"2026-08-11T15:42:28.852176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.830852Z","title":"Fine-grained visual textual alignment for cross-modal retrieval using transformer encoders,","venue":null,"work_id":"4ae13b3c-4d1a-4570-83a6-384016d8cf59","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.128806Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:fdba196c94708f7e9276fca99f1a76c2de395b207d1bbedd16f44be4e7ee993f","observation_id":"93c78f73-509a-4bd5-848b-30567a467c4a","resolution":{"observed_at":"2026-08-11T15:42:28.836046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.134205Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.134205Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:3a8411fc657faab4915ab55a8b8b5ed773ec0ae3ec501e860cb5136021e37607","observation_id":"97021fae-b162-46c2-99ec-70bbb91a47b2","resolution":{"observed_at":"2026-08-11T15:42:28.134205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.803342Z","title":"Unsupervised contrastive cross-modal hashing,","venue":null,"work_id":"21fadd12-3e8f-44ed-b7fc-f3f53a22e213","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.139094Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:e73f58fbc1a7aebcaa6a3ece6f03a67820dc61a901ee768cf8077fb66eabf3b9","observation_id":"cf41082e-8a5f-4621-a86c-2b29a127e332","resolution":{"observed_at":"2026-08-11T15:42:28.808444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.787563Z","title":"LXMERT: learning cross- modality encoder representations from transformers,","venue":null,"work_id":"2cb29f1f-a8fa-4a90-97e4-242e19caca34","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.143999Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:ad71979f210b52e54dee5c527db170eaac7b8357e498819c5cea03fd284ff372","observation_id":"88ed5a55-c026-4b5e-9523-4722632eef91","resolution":{"observed_at":"2026-08-11T15:42:28.792708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.771596Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":"86131c17-ab32-48da-98f4-adec48333739","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.148752Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:0cf7d46a264b3a470eec1024de6a0dc9cf8b80e584505e34bfaa9a186de0d741","observation_id":"1ccaad70-a3c8-4730-9477-9dfc598a8436","resolution":{"observed_at":"2026-08-11T15:42:28.776814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.756064Z","title":"What makes training multi-modal classification networks hard?","venue":null,"work_id":"430dc2c2-ea06-4233-bd18-2c17bcc827d6","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.153567Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:e2bafc28b2490afab0d22e460c4627c808337b0405184fe992733f6fa1afec35","observation_id":"b20a4390-6347-48ac-8a43-f2482e59c271","resolution":{"observed_at":"2026-08-11T15:42:28.761112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.739922Z","title":"Trusted multi- view classification,","venue":null,"work_id":"9b71ab4b-cae7-4475-8235-8ff119dd9b27","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.158656Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:06e3d6e50abea042def6bc38a26f3484cbe10335eddb5367e900e428ccde3f8c","observation_id":"4b0d9c84-77d3-42be-8556-c429ec79e0d8","resolution":{"observed_at":"2026-08-11T15:42:28.744935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.723862Z","title":"Balanced multimodal learning via on-the-fly gradient modulation,","venue":null,"work_id":"5dff41eb-0d30-48e0-a088-b3153d53278d","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.163526Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:2139df7890a7472ef0cf8e5d24af07f40c2dbc58b8b45d4a1bb7376fa408b159","observation_id":"f70341bf-3e9b-4d99-af95-8c0843083792","resolution":{"observed_at":"2026-08-11T15:42:28.729218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.707962Z","title":"Multi-grained vision lan- guage pre-training: Aligning texts with visual concepts,","venue":null,"work_id":"a2677f99-01cf-4ffe-b7d4-ca9a6ba25503","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.168411Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:179a7c8c5b55b80de6f643b0f99afa530e222291726e3e8e2682839e89a7dc84","observation_id":"bd5eda0d-a85c-4517-a671-68e17c3be8d9","resolution":{"observed_at":"2026-08-11T15:42:28.713139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.692165Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"12da6f47-4a16-4d5f-be9e-6f3584912ac0","year":2016},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.173683Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:9e931f2ed70c4bc05bd795f77bb4b2138686059bacea67d49c4199f3ba08e52d","observation_id":"3d59aadf-2b35-46fb-a452-dce10608da94","resolution":{"observed_at":"2026-08-11T15:42:28.697114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.677070Z","title":"Long short-term memory,","venue":null,"work_id":"d3f672ef-ef8e-43fd-85e7-613e366c27b7","year":1997},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.178597Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:244fe774a4fd56ebb8f72f39e6f2c6fcdaa2337e9ba547b3ab593e3dd6e84f5f","observation_id":"4f39dd36-ed2e-4d3a-8f55-65e86da9f12d","resolution":{"observed_at":"2026-08-11T15:42:28.681814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.660781Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"6b4f2d0e-fe74-4cd0-a05f-a9ce7067dce3","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.183595Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:bc418cbbbbaaa59a01c9c1f06fcfe00a55980368e7e9d145dfefae7c04425c9c","observation_id":"c84b2b5a-605b-4434-8c51-475bc4fd3d9d","resolution":{"observed_at":"2026-08-11T15:42:28.666145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.644147Z","title":"Relational knowledge distillation,","venue":null,"work_id":"4663629e-91bc-43c0-b882-9bb9228888eb","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.188307Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:bfe7175e0df0f5457f7ca53cb0ef26351bd5a994dfcb6b255cd4afbf6135063f","observation_id":"f4d5647d-7812-459d-8a14-9dbd5b946213","resolution":{"observed_at":"2026-08-11T15:42:28.649954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.627860Z","title":"Large-margin contrastive learning with distance polarization regularizer,","venue":null,"work_id":"8b9892da-9d54-4a08-8030-4ae42abd1fcb","year":2021},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.193064Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:08209795edf7c647dab399a256c77e524bdbf5cac4ef669e3f324b915ce6706a","observation_id":"6482f933-c931-4496-baf2-5c3b81ab1212","resolution":{"observed_at":"2026-08-11T15:42:28.632927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.611974Z","title":"DINO: DETR with improved denoising anchor boxes for end-to-end object detection,","venue":null,"work_id":"034f7234-07d4-4e52-b343-0fa7745e7223","year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.197656Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:dbdddfe9f78d06ccc9478e8780d4bbedc83dbb9d5d4e07284d58c7f0a4c04a59","observation_id":"9d8f6a96-c8bb-4e90-8920-0fae10a8618b","resolution":{"observed_at":"2026-08-11T15:42:28.617115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.591142Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"6daea88e-14c5-47d4-b3c0-58092dae3028","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.202561Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:e1dfa93bdc081da5be786051893c5376a7784dfbc974af0513646b1a8f4fb8b6","observation_id":"dc1d3cab-9fef-4c92-a1fa-8b83433e8ee2","resolution":{"observed_at":"2026-08-11T15:42:28.597980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.574895Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"45a12129-8610-42bd-b20e-67728c5f6546","year":2014},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.207517Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:8895ce985377026631a5b55f49b01d8668eaecf9227b05946c8fbdeafdaffe6e","observation_id":"c3d1ff54-9a73-46fe-bcae-e60fa146a093","resolution":{"observed_at":"2026-08-11T15:42:28.579938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.558448Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"a2d9c16b-44b1-41a5-94a0-2864d87ced30","year":2015},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.212825Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:926776578405cd46cb662824ec6c8571d4ee8f8f1b55701f0e0a73ebb1293165","observation_id":"634b4e69-4e92-4d94-82a7-c7d54b234a20","resolution":{"observed_at":"2026-08-11T15:42:28.563748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.541842Z","title":"The MIR flickr retrieval evaluation,","venue":null,"work_id":"a69005d9-dbf9-45a9-a73f-5c7f9ec73a37","year":2008},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.217660Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:e8331b528bc76f44aaeb4d7e986d3f1872f1431b7f901b523b87e5e26da18318","observation_id":"1d472949-ad97-4099-8262-c19cafc6823e","resolution":{"observed_at":"2026-08-11T15:42:28.547232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.524675Z","title":"Captioning images taken by people who are blind,","venue":null,"work_id":"8e182e18-d6a7-4971-9487-e3d07db39c7f","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.222527Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:387d453d902ba38d9c48826c5b1bfe02de9164f11a2decc1974f24c03423122d","observation_id":"43b840e8-ff88-4dc0-a380-ee49f7372bc2","resolution":{"observed_at":"2026-08-11T15:42:28.530673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.508427Z","title":"IMRAM: iterative matching with recurrent attention memory for cross-modal image-text retrieval,","venue":null,"work_id":"d7f36461-eff7-4dcb-9943-f9ac11d6a2f7","year":2024},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.227467Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:34b5bca039198c4974f6ada59e0bf7ea5d6d69a4cc06e529fd91a2af50101117","observation_id":"eaa6dfd3-e219-497d-8468-99e636f1ef66","resolution":{"observed_at":"2026-08-11T15:42:28.513876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.491774Z","title":"Graph structured network for image-text matching,","venue":null,"work_id":"708043e2-4e3c-4423-a437-6aba110832d8","year":2020},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.232464Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:6fb88442f1147b39b65451f49167361c8823ad1f48585ea5fb82f02372e49836","observation_id":"d6ce78ee-f3a6-41d4-98e7-9c2c0be2a5cf","resolution":{"observed_at":"2026-08-11T15:42:28.497055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.475251Z","title":"Visual semantic reasoning for image-text matching,","venue":null,"work_id":"fc7988e7-9917-41ee-8542-d1e0d35997e9","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.237334Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:a49a2280430378db75b46237c4ec470165eba93d69a32762e4559c2effc9446d","observation_id":"f7faea77-7c8d-4586-9baf-aa02ab69adfc","resolution":{"observed_at":"2026-08-11T15:42:28.480530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.458868Z","title":"Negative- aware attention framework for image-text matching,","venue":null,"work_id":"955e2970-07f2-4200-baac-7e9b6c38e0e3","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.242506Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:314639608c64a55a583612ccd063492dbdab056fb1b88dbc72bdce8f266edf5f","observation_id":"2855ac7c-89c5-4e36-9ca9-fb8c6aad4fa7","resolution":{"observed_at":"2026-08-11T15:42:28.464004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.442480Z","title":"Cyclip: Cyclic contrastive language-image pretraining,","venue":null,"work_id":"18bb794a-e011-44f7-8711-64155be3ba17","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.247977Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:cce21bc6e1933cc8be1bd1585adf3502557a5fac168219567ee2e1ec9ff39527","observation_id":"0c59de8c-3129-4e56-ab57-d752aae450ae","resolution":{"observed_at":"2026-08-11T15:42:28.447654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-16T18:15:40.025778Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-11T15:42:28.253438Z","title":"Improving multi-modal learning with uni- modal teachers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.253438Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:60ad871cc8dcbc46160a77d24c35e14786c715c74f89b6b0a131580508c13c12","observation_id":"0b6c0d14-0423-41e7-bff8-8fa542e372f8","resolution":{"observed_at":"2026-08-11T15:42:28.253438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.424759Z","title":"Neighborhood discriminant hashing for large-scale image retrieval,","venue":null,"work_id":"34c71685-c7d2-49a7-ba70-0becc3cbd254","year":2015},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.258989Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:70de30d97cb07ef8d6e80201452315f234d4427f60dd0475680b05791b403e4e","observation_id":"754cb223-4ff8-49d4-a972-b414c9b0019d","resolution":{"observed_at":"2026-08-11T15:42:28.430514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.406838Z","title":"Learning dis- criminative cross-modality features for rgb-d saliency detection,","venue":null,"work_id":"c0165c6d-d45b-4c07-a4ff-1ce87c3c07ff","year":2022},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.264147Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:f19aecb22ebb3ec3a7ba0bdee1cb78aed4aa18fdd2013b486e36b8d76a42dabb","observation_id":"f701a0fe-790c-402e-8af7-22e42d96a677","resolution":{"observed_at":"2026-08-11T15:42:28.412090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.390783Z","title":"Camera constraint-free view-based 3-d object retrieval,","venue":null,"work_id":"f8ebae82-ee7d-4ef9-9539-01e1fb21a911","year":2012},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.268958Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:5c3156432c541f69334f12b2dd7c91dd14e06b69bf3662e7bdc60065092bcfad","observation_id":"04bc54b9-f5b4-499b-99a7-cc263718e732","resolution":{"observed_at":"2026-08-11T15:42:28.395834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.374735Z","title":"Picture it in your mind: generating high- level visual representations from textual descriptions,","venue":null,"work_id":"1dcfdeb6-5af1-4c33-af98-21dbde1ee806","year":2018},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.273983Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:b0987360bae715cf098aa06350a94bf1db5649425f959e1aad4d7b7adcad36b7","observation_id":"124c95db-928b-4e4b-a04b-b7521a1177eb","resolution":{"observed_at":"2026-08-11T15:42:28.379885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.357517Z","title":"Attention on attention for image captioning,","venue":null,"work_id":"89e5a4a2-180e-4840-b0b9-fddefd3854a6","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.279004Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:5bd3fde56643f636f130da19187e18760de8a973b437924306db66e7f9d7c434","observation_id":"104a5a55-ba63-401e-8b87-808f7872fa42","resolution":{"observed_at":"2026-08-11T15:42:28.362920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:42:28.337622Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"430ed367-60d9-4638-ad4c-198d96d053cb","year":2019},"citing_paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:42:28.284177Z"},"links":{"citing_paper":"/paper/2412.10761"},"observation_digest":"sha256:784ce90c4e2a4907aec650e07b4d588ab3059cdc7103a5b450227715747ba784","observation_id":"bdac5ead-e5a5-4b5c-bab6-46a6d67db623","resolution":{"observed_at":"2026-08-11T15:42:28.345018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10761","last_updated":"2024-12-14T09:10:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:35:54.365857Z","submitted_at":"2024-12-14T09:10:36Z","title":"Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2412.10761."}