{"as_of":"2026-08-08T19:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f484cb8ea84d67ea971540201b546ef303a018706824f9ce80db49010335616","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:58.847247Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08590/citation-record","integrity":"/paper/2507.08590/integrity","json":"/paper/2507.08590/citation-record.json","paper":"/paper/2507.08590"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.433776Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":"28745ed4-f4cf-4e1c-9ab1-c125edbf1be1","year":2015},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.647447Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:ada8bb0bf73264ce28a07e86b9c550036e43eaca5f2182b90f208d2c2ad7fa5f","observation_id":"e4cc6cc2-5ebc-46f6-9f6f-bdcaf9a95f63","resolution":{"observed_at":"2026-08-06T18:19:59.439282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.410754Z","title":"Stacked cross attention for image-text matching,","venue":null,"work_id":"bb4b6ea7-4f95-4269-9387-994e539d957f","year":2018},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.652953Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:119de43b296ac90c10a633edab1ef94ac71d4632519c83b047e3a55ecb4d9a9e","observation_id":"820545a0-8f94-4934-b661-03f81fcd31c3","resolution":{"observed_at":"2026-08-06T18:19:59.421214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.382313Z","title":"Image- text embedding learning via visual and textual semantic reasoning,","venue":null,"work_id":"92dcd00e-2e90-4c23-8c04-a8a238404805","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.657786Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:5fa8da8c4079abb1db2cc0ef4bcdb22307251b62536d7249385d59a87ed35f06","observation_id":"cdfd30ec-1d79-4a7c-be7b-f4ca4a409cfe","resolution":{"observed_at":"2026-08-06T18:19:59.397910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.362226Z","title":"At- tentive mask clip,","venue":null,"work_id":"807c0792-22b8-428f-b4e9-85a9cb1a66f6","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.663498Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:55dc750bffc6d5ed53f229aab75f36de5f78eaf8fb2191d009e0e2420f467f3b","observation_id":"514a9348-726f-42c5-b9a6-7cd810702ce2","resolution":{"observed_at":"2026-08-06T18:19:59.367248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.347717Z","title":"Composing object relations and attributes for image-text matching,","venue":null,"work_id":"3fe69b7f-6a0f-4062-b9d2-490707123b81","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.669323Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:927dc0e6ecbdb32ba78c60ed1a596f8e71cb471a038c9634ab0a893dfdb4086c","observation_id":"c5fe10b2-5c13-4113-89f0-2502927467bb","resolution":{"observed_at":"2026-08-06T18:19:59.352015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.331053Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"3e17597a-5371-4c1c-84cc-23e5e6f23704","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.675803Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:a66a1a1dfe328d6411a6d5d6992779e6ebf4efec4af34438794f8c97a031c5bb","observation_id":"8d94c9a9-67e6-475f-adf3-a00f85950f4e","resolution":{"observed_at":"2026-08-06T18:19:59.336427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.313403Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"25ad00aa-0a05-400c-9143-3dfb04e8625f","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.683871Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:7e97687e60ad0cfac3d96b57f1a26d5f7927425896adefb5675e0edd115c7bcb","observation_id":"8ca9b18e-f722-4b92-b8a7-a6d85806f3d2","resolution":{"observed_at":"2026-08-06T18:19:59.319859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.284633Z","title":"Regionclip: Region-based language-image pretraining,","venue":null,"work_id":"e77bedf5-3147-4b29-94ae-ecfc6bcffa69","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.693360Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:c586eaafaef63adca0ff1b0f9801fca3f7461efd4733a15dc72514d2224e6154","observation_id":"2f68182e-5c82-4a45-bea4-6ba588a05ed2","resolution":{"observed_at":"2026-08-06T18:19:59.292337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.262277Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":"fb10f4e2-71f9-40ac-bfba-1a02208d0e15","year":2025},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.703590Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:e8a48dc188aa7b021842e63b696e0370fd2d14ca375c1aae44af44f4fc6aa0b3","observation_id":"30654223-7950-4359-9836-f79e4b7a9526","resolution":{"observed_at":"2026-08-06T18:19:59.267034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.244975Z","title":"Improving clip training with language rewrites,","venue":null,"work_id":"0f66b826-6ea5-4e72-9191-2a36aadd4098","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.715883Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:18b9a1bf83cc94c39313cf4645754af4e9ece5ac1154b21189af8ca0797ee784","observation_id":"9bccf390-e917-45ae-b837-fc8e5ac865aa","resolution":{"observed_at":"2026-08-06T18:19:59.250030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.228752Z","title":"Improving multimodal datasets with image captioning,","venue":null,"work_id":"991cc153-beaf-4a00-b419-71e57665fd6c","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.728908Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:db36f49e3d50001ea83f64b55ae9a0fd70adf1ca011960bb314c80a197f249bd","observation_id":"f1acdda5-029f-4367-ad21-f8a58209a01a","resolution":{"observed_at":"2026-08-06T18:19:59.234196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.212701Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"9126f724-64d0-46c1-a87b-68e9d146ae37","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.735122Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:2ffba970061f53b72adba852831eb6ee3a74afe9d9db77f310f345991882ef36","observation_id":"cbb654d8-1fa7-4e50-b034-6b2ba87c5c8a","resolution":{"observed_at":"2026-08-06T18:19:59.218150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-06T18:19:58.740424Z","title":"Mllms-augmented visual- language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.740424Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:3b673fce440cebef4a86198c46de0224054a0f9c236fb526fa31722be78bcf4c","observation_id":"0ee958d2-bfaf-42c2-be02-df1ebbc15013","resolution":{"observed_at":"2026-08-06T18:19:58.740424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T18:19:58.748432Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.748432Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:9eb75e4856e7f41cffebb4ea24f7b52634d91492690912557b2e9a1acd08853c","observation_id":"6af04eb6-4472-4714-bb0f-7cc3062c3059","resolution":{"observed_at":"2026-08-06T18:19:58.748432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-06T18:19:58.753670Z","title":"C- pack: Packaged resources to advance general chinese embedding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.753670Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:287a93974d29050769ac03d6b8d8d52252f849f33064f5ab5f4986e82e1b2447","observation_id":"0033427b-733e-4acb-b098-13d0f736b924","resolution":{"observed_at":"2026-08-06T18:19:58.753670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.195693Z","title":"Fine-grained image- text matching by cross-modal hard aligning network,","venue":null,"work_id":"8d11b55d-89f8-461a-ae94-5b09f00e4ce6","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.761302Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:ae59b9a84f1af88a00bc3f98d9856ee3f91911d8375ed8b2b5f54926bbfb66fb","observation_id":"08f96dca-8f4c-404a-be87-e9c1a9a24f75","resolution":{"observed_at":"2026-08-06T18:19:59.201309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.177215Z","title":"Fast, accurate, and lightweight memory-enhanced embedding learning framework for image-text retrieval,","venue":null,"work_id":"e8a6cda6-71d3-4b9d-a946-3c590d9776cc","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.768032Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:fb8da6d28e6094abf937f002c76322921599afb20376d806a1bad393dd01e483","observation_id":"50e81f65-4615-40ad-b95f-ed89de7a1fc4","resolution":{"observed_at":"2026-08-06T18:19:59.183805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.159870Z","title":"Learning the best pooling strategy for visual semantic embedding,","venue":null,"work_id":"a5681e76-26d5-43ea-af3d-25ecc79b80a5","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.772689Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:318bc9980f5507e4c292d10e88a5580961e7cae300213ae6ff6c871784d842d9","observation_id":"fcd0442a-4ab7-452f-a98d-8230c52abf65","resolution":{"observed_at":"2026-08-06T18:19:59.166182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.138925Z","title":"Learning semantic relationship among instances for image-text matching,","venue":null,"work_id":"02f829d3-036d-4a87-8508-ba6ea02e0779","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.777092Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:cb21483311d293bb27ddc4cda25f766ad0c87c3b33f734fa213090dc772fffcf","observation_id":"e001793f-3add-4bdf-9b6a-1e4239ba249c","resolution":{"observed_at":"2026-08-06T18:19:59.145425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.118544Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"b9bdf4e1-6a60-4538-bf0e-676ee2d067e5","year":2013},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.797389Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:d02970cd66f7dd1d3f56d7d6c0dcb14bc461915774acb257260c24686c5f5dca","observation_id":"26a67493-2443-427f-b1e0-30aa4136f551","resolution":{"observed_at":"2026-08-06T18:19:59.124932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.099962Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"bbaf3ec5-5829-49ed-a226-a71f017949d9","year":2015},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.805931Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:215f9976cc8c721ff635ffcc195af5ab24cecca294cf6e2696b112431fc4dd1b","observation_id":"f2d0d17a-2ff4-4404-9b24-cbaf2c7c7a03","resolution":{"observed_at":"2026-08-06T18:19:59.105418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13327","last_updated":"2022-06-06T06:51:28Z","snapshot_observed_at":"2026-08-01T17:25:28.863592Z","submitted_at":"2021-08-30T15:46:09Z","title":"N24News: A New Dataset for Multimodal News Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13327","snapshot_observed_at":"2026-08-06T18:19:58.811615Z","title":"N24news: A new dataset for multimodal news classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.811615Z"},"links":{"cited_paper":"/paper/2108.13327","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:2f0e6e0215f90146693032728b270fee3035a6c903a0a3a1fd29c8ac3c2541d8","observation_id":"593e71a4-bd87-4236-a740-ca1389172458","resolution":{"observed_at":"2026-08-06T18:19:58.811615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.079035Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image retrieval,","venue":null,"work_id":"75dbe651-37b5-4bc3-b4a8-20453dbd6c6a","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.817342Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:3929f645ebbc400ec815c34c0201bcb75bfd49024c71a1ef16517c9459daaebe","observation_id":"e83deb29-8974-4017-8f07-bfd8cee1eefa","resolution":{"observed_at":"2026-08-06T18:19:59.084295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.058998Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":"c6776c59-49d6-40fa-a8f9-767391c38caa","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.825844Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:3ca6df92249495cd36d8c462305771c3a9383389add6860b647166e72ce57f18","observation_id":"b76fc5ee-b355-4008-8d7e-2ea5b2803cc3","resolution":{"observed_at":"2026-08-06T18:19:59.065552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.036951Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":"f3bef786-bb64-4ee9-9897-b44513ab2585","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.832266Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:d3ffdfb76180ee091e1d34fdb12fb37137783671cbe559a063edc59f950dd321","observation_id":"337190bb-dc06-4ccb-9f17-3e968b6363a9","resolution":{"observed_at":"2026-08-06T18:19:59.045119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.014268Z","title":"Remote sensing cross-modal text-image retrieval based on global and local information,","venue":null,"work_id":"8bcf3144-9876-435b-ae4f-e86c53ab2edb","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.842725Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:53ec0e953e8afe098d4f457f1925f792cd70d2a80ade4f34aabe2317b78c94fc","observation_id":"8ab328d0-2d7d-4a6b-bbe6-4b9ed6e2c7ca","resolution":{"observed_at":"2026-08-06T18:19:59.019781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.993729Z","title":"Hypersphere-based remote sensing cross-modal text-image retrieval via curriculum learning,","venue":null,"work_id":"94a85b19-386e-4be0-86ec-1931911e7000","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.847247Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:7a994ed17f409364902659b9dc23ea5b4a6ec2fe309b2b77743db1aafee63747","observation_id":"5d951393-c6d2-46c2-b4a3-189abee9d957","resolution":{"observed_at":"2026-08-06T18:19:59.000703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T18:12:34.078448Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.08590."}