{"as_of":"2026-08-08T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7119552ddb68764cd76f0ca53369c1a60cc14de907c3ce470821110aaa4815e7","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:16.148845Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08254/citation-record","integrity":"/paper/2502.08254/integrity","json":"/paper/2502.08254/citation-record.json","paper":"/paper/2502.08254"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-08T05:54:15.808010Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.808010Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9dda8de359b96f75ef7248bc369f7bd09e4a8cb3fa38679f80676f0ab7a54933","observation_id":"38d6ddc2-c253-4ba6-a33a-97550b330624","resolution":{"observed_at":"2026-08-08T05:54:15.808010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.812393Z","title":"Learning attribute representations with local- ization for flexible fashion search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.812393Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1c06a5c9e4c0a6f5b8dddcde6f0cedeea6b30f7d89df71e4d50aa77d3ec3e59d","observation_id":"c558e5bf-2f8e-45f7-b00a-23bdc8214473","resolution":{"observed_at":"2026-08-08T05:54:15.812393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.815852Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.815852Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:abb4da4d639386418aa1ae50c2f01d5ef5cebea0b02431c65cd7d96300a9473a","observation_id":"2a2b8b81-bc1c-4b50-9095-641d36a52911","resolution":{"observed_at":"2026-08-08T05:54:15.815852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.819291Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.819291Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:cb5254069441ed48824d1ffbcac644b245d4b2cde822e37299d28f92d6e6d0b4","observation_id":"b52e3554-78f2-4aa7-a5e2-19a3cc08e183","resolution":{"observed_at":"2026-08-08T05:54:15.819291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.822811Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.822811Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:407fd710097632ae48621900a68a5d9b688dadf0ac5a496fd23256a8ee14c6b0","observation_id":"992f8b97-ed79-42cf-be80-18f80ad192f2","resolution":{"observed_at":"2026-08-08T05:54:15.822811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.826342Z","title":"Effective conditioned and composed im- age retrieval combining clip-based features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.826342Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6a144e622ea6e648ab008d9c812acd0d20ead07974923fd8f936199b526feb01","observation_id":"d9590b7f-e4e7-4517-aa01-fb2b35046b20","resolution":{"observed_at":"2026-08-08T05:54:15.826342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.829572Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.829572Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d0b866225467648318a39b0d94967b4d2dcc88ceb424c58a857c55bea8649654","observation_id":"8034d24e-c299-4e48-9ba7-8187cac9e97b","resolution":{"observed_at":"2026-08-08T05:54:15.829572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.833054Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.833054Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:efd77b35b2b71fc3f40f6967a3fc9057d452141671744dde2a2505345b2b367e","observation_id":"c2c2326d-a5c4-4552-bb9f-fcde8a26abd2","resolution":{"observed_at":"2026-08-08T05:54:15.833054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.836907Z","title":"Tomayto, tomahto","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.836907Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:16fb670cca982ce54ecde5bd9afbc18b400f551e594ec9f120ffc6979c675ce6","observation_id":"06e54353-c76a-4c4a-a521-e9f159eade34","resolution":{"observed_at":"2026-08-08T05:54:15.836907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03668","last_updated":"2023-10-20T13:18:06Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T16:38:05Z","title":"A Suite of Generative Tasks for Multi-Level Multimodal Webpage Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03668","snapshot_observed_at":"2026-08-08T05:54:15.840236Z","title":"A suite of generative tasks for multi- level multimodal webpage understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.840236Z"},"links":{"cited_paper":"/paper/2305.03668","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5b3e00c2325652275c38cf981c8801881993d221334d12f347b65da22b53dd78","observation_id":"d4a09c30-4cdf-40c6-a317-5863e240dfcf","resolution":{"observed_at":"2026-08-08T05:54:15.840236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.843793Z","title":"Plummer, Kate Saenko, Jianmo Ni, and Mandy Guo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.843793Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3747dec626f1781e2c6fb56f4508c576b448c2085ee0a31b0d40cba2e372a450","observation_id":"bbd4ef3c-0289-4215-9ebd-abf83f7d2828","resolution":{"observed_at":"2026-08-08T05:54:15.843793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.847113Z","title":"Wiki-llava: Hierarchical retrieval-augmented gener- ation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.847113Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:40c2910b117a995d1b7b599d5de0df14badca62969d394dcaad686cd82406405","observation_id":"a669727d-692c-4509-ba45-bcbbc5839f3d","resolution":{"observed_at":"2026-08-08T05:54:15.847113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-06T23:46:49.824788Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-08T05:54:15.850481Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.850481Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8de51a648fc9ad7f3e41fe4edf9968dada30379f0891df920df07a029108731a","observation_id":"9a0755fe-5633-45ce-a0dc-c5be88c1260e","resolution":{"observed_at":"2026-08-08T05:54:15.850481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T05:54:15.853944Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.853944Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:be04d3d4be9e9cb74c07ca9f140ff978e12aa6541554156ea7484da1158023fb","observation_id":"1369fc8e-ca41-41cd-ab5d-3da27cc877e4","resolution":{"observed_at":"2026-08-08T05:54:15.853944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.857665Z","title":"Image search with text feedback by visiolinguistic attention learn- ing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.857665Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f2292e7e0ddabf3023846b4e3018b6dbcd06a8f35e335aefc89b44397aa03819","observation_id":"bed027d4-31ba-4427-b29e-619051466185","resolution":{"observed_at":"2026-08-08T05:54:15.857665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.860861Z","title":"Image search with text feedback by visiolinguistic attention learn- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.860861Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d8c7f23e808ae8c681268f4b0f31b8912159c6db1801190284788b641f4c5bd9","observation_id":"3add3c2b-6dd9-44a2-b881-b45c5638c29a","resolution":{"observed_at":"2026-08-08T05:54:15.860861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-08T05:54:15.864357Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.864357Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:a2753170cec9e78d8ab4bb9be59ae7d8be2117a5656bb3e3f4c493bc9caf20f6","observation_id":"3109636d-67a5-415a-baff-0e63cb21a129","resolution":{"observed_at":"2026-08-08T05:54:15.864357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.868000Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open- source suites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.868000Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e5fe2c6b3eff3e974d8b851dda4a562c92bfab9dba32c0dc4ad92bafdcd3550f","observation_id":"4ef45408-0c61-4f29-abdb-4b6c0de8ec1d","resolution":{"observed_at":"2026-08-08T05:54:15.868000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.871260Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.871260Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:cfc5ffce68f6bff9b9865be01f1eafb118de93ec8831c880950e8fd005a031e4","observation_id":"425d9efd-8881-43fa-b621-d4a2072ea104","resolution":{"observed_at":"2026-08-08T05:54:15.871260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.874549Z","title":"Meteor universal: Lan- guage specific translation evaluation for any target language","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.874549Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d76a2c5bff389af980d6c821c443b3d7e3a5690f2b554d7fe6da3747ef7d2b0e","observation_id":"bafc4799-8cb8-4f13-a03e-a855dd5c3956","resolution":{"observed_at":"2026-08-08T05:54:15.874549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.877970Z","title":"Hyper- bolic image-text representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.877970Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:18217e852ac12b25d4127b0c5e190f49d81642f7e29d1f7f9909042eab0ed30b","observation_id":"fcec966b-795a-4e81-85ad-db0c89a83a69","resolution":{"observed_at":"2026-08-08T05:54:15.877970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.881162Z","title":"Toutanova","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.881162Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:79ee8a0b25cae631bd46b5387fee614a1380035efe2c6185d50562a5e533e24b","observation_id":"5ff08aba-4c39-439f-b204-4a38fe95f237","resolution":{"observed_at":"2026-08-08T05:54:15.881162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:54:15.884750Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.884750Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:09a6e392d1a2b090835f9e85c6a5b070fb6121a74edb422e136e6e2299b6d325","observation_id":"1073d162-89b2-4794-983c-09792b776666","resolution":{"observed_at":"2026-08-08T05:54:15.884750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07202","last_updated":"2020-10-06T19:00:27Z","snapshot_observed_at":"2026-08-08T19:46:34.152150Z","submitted_at":"2020-04-15T17:00:05Z","title":"Entities as Experts: Sparse Memory Access with Entity Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07202","snapshot_observed_at":"2026-08-08T05:54:15.888711Z","title":"Entities as ex- perts: Sparse memory access with entity supervision","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.888711Z"},"links":{"cited_paper":"/paper/2004.07202","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:744af67cfb33a819a6e7f36510b187128e5c3241e3dffc1603a4e1e341d6fd84","observation_id":"16874e68-f265-4254-b4cf-48e4ff28f391","resolution":{"observed_at":"2026-08-08T05:54:15.888711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.892674Z","title":"Pyramidclip: Hierarchi- cal feature alignment for vision-language model pretrain- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.892674Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c352253e115c284bee35183d68ae6bdc48a4c92e5aabd27853daf6e6cbe87bc5","observation_id":"033cdd40-4ff8-48c0-8b12-7f28458d3ef7","resolution":{"observed_at":"2026-08-08T05:54:15.892674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17561","last_updated":"2023-12-16T16:27:57Z","snapshot_observed_at":"2026-07-06T15:10:12.213443Z","submitted_at":"2023-03-30T17:27:22Z","title":"SoftCLIP: Softer Cross-modal Alignment Makes CLIP Stronger","version":2},"cited_work":{"arxiv_id":"2303.17561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17561","snapshot_observed_at":"2026-08-08T05:54:16.441409Z","title":"SoftCLIP: Softer Cross-modal Alignment Makes CLIP Stronger","venue":"cs.CV","work_id":"74877700-ecc1-46ba-a943-8495d59ff770","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.895975Z"},"links":{"cited_paper":"/paper/2303.17561","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:235652e64f9b644ca55cb1e088626657d6e7d904a9b6222cb7d369b1de460b1d","observation_id":"dc07771b-3808-4fa9-8b0a-7919c7744148","resolution":{"observed_at":"2026-08-08T05:54:16.446151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-08T05:54:15.899573Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.899573Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d20eff50a6a52d3499d3b62039f65024c8e849f551f306770bb3bf855ceefcd5","observation_id":"4f9696d8-933d-4d91-8b84-0d05be0fc9a4","resolution":{"observed_at":"2026-08-08T05:54:15.899573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.902988Z","title":"Cyclip: Cyclic contrastive language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.902988Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c9adb3f8439cbd96172a4305f9fd178aed09bc8ea6fdfb6095ed91f8b6c67afd","observation_id":"67f67b07-c0a4-4475-8e0d-f043e95af363","resolution":{"observed_at":"2026-08-08T05:54:15.902988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.942802Z","title":"Fashionvlp: Vision language transformer for fashion re- trieval with feedback","venue":null,"work_id":"2310676c-2023-42b2-9d18-9b02b77574af","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.906213Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:be427faa55bfd7d31f9ccdd09291764a273b837d5af3f0fb808e299282cb449b","observation_id":"f34a8fe8-19ff-46b6-9529-34b77634a9ef","resolution":{"observed_at":"2026-08-08T05:54:16.946462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.932165Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"f404f879-53d8-4d9a-b1c9-795a52967c0d","year":2017},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.909463Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:0efcf57723cfa46cc6463a791f8d5b6a1487c430e57f784e0010956abc361a3d","observation_id":"53408d33-2e4e-41c6-8db8-c566824c86b0","resolution":{"observed_at":"2026-08-08T05:54:16.935833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.921859Z","title":"Language-only training of zero-shot com- posed image retrieval","venue":null,"work_id":"76bcfd68-dd82-411c-9f1e-b8dd64d342d7","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.912732Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5ff4e677afc6f51ce5ba85896ed6024a950a69747470ba2ab2f89fbe18c08385","observation_id":"a5810dab-5893-47e6-b4fe-c280901bc02d","resolution":{"observed_at":"2026-08-08T05:54:16.925444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.911798Z","title":"Dialog-based interactive image retrieval","venue":null,"work_id":"ba5fc641-1569-4a21-af52-c95772dd854e","year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.915885Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8f8e35417b51e9fdb502ea8de898aec42cb8a6c00bb10ed2ed72d2567198dacf","observation_id":"efdad6e1-a744-4786-9a69-dbe3c71d3d7b","resolution":{"observed_at":"2026-08-08T05:54:16.915546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12794","last_updated":"2020-11-25T22:10:37Z","snapshot_observed_at":"2026-07-06T07:56:36.079573Z","submitted_at":"2019-05-30T00:15:12Z","title":"Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12794","snapshot_observed_at":"2026-08-08T05:54:15.919336Z","title":"The fashion iq dataset: Retrieving images by combining side information and relative natural language feedback","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.919336Z"},"links":{"cited_paper":"/paper/1905.12794","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:870fdfb1a2a47ec961f426a1dd152a90226314d470f92b2f90517e4191768893","observation_id":"1ffed5d6-3957-444a-8568-7c2949410145","resolution":{"observed_at":"2026-08-08T05:54:15.919336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.922958Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.922958Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:fda9ac2aa840e8c13cb7a4e0209ebbfa044e3fb3841e3e58d525fb64233d564f","observation_id":"c70ead6c-7350-4f67-9286-00a82bb5d4b7","resolution":{"observed_at":"2026-08-08T05:54:15.922958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.926563Z","title":"Retrieval augmented language model pre- training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.926563Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:18abff8fa89f4c5b0bb7a7531b4f2eb35729ffdd7919c950269189d4d531b117","observation_id":"4eca5215-0015-4a15-99d2-9b72b539afee","resolution":{"observed_at":"2026-08-08T05:54:15.926563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.890599Z","title":"Au- tomatic spatially-aware fashion concept discovery","venue":null,"work_id":"16baaedf-c77d-4c25-9f5d-c64d15883a78","year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.929768Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:65c7c6beaa20c2468f39ee97d62a0a6c23c0bc536ea060f3345d8a8c9c2856d2","observation_id":"a3130d19-48be-4574-bc75-17cbf7b07ff9","resolution":{"observed_at":"2026-08-08T05:54:16.893871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.881235Z","title":"Learning attribute-driven disentangled represen- tations for interactive fashion retrieval","venue":null,"work_id":"13b433f5-c00b-40b7-b3a0-6caee5a06d02","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.933138Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2caa3d4ae9ff90e8b997ffa32c980d72bffe454d0882d2eb1ba09250d1167470","observation_id":"8472be4a-c96f-495f-b465-d90702b91cfa","resolution":{"observed_at":"2026-08-08T05:54:16.884577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.871457Z","title":"Open-domain visual entity recognition: Towards recognizing millions of wikipedia entities","venue":null,"work_id":"509c17f7-e153-4b66-afa8-e0e2dcbe2dc4","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.936531Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3bf6ba2e8944736f9af57b38b7a9d2b3c936abe4c7f7487f3fa8740989617272","observation_id":"6e15b028-1da2-4866-996b-1d52a2d3d25a","resolution":{"observed_at":"2026-08-08T05:54:16.874761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.861663Z","title":"Reveal: Retrieval-augmented visual-language pre-training with multi-source multimodal knowledge mem- ory","venue":null,"work_id":"7265e5a4-f561-4232-b88e-52c5eca945f9","year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.939817Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:078bf082464efa9b0dc2daed94c9c686eefab1d6de34578a027d6a567ba4831b","observation_id":"97fb0400-2a4e-4e51-8ccb-fad1c82afafc","resolution":{"observed_at":"2026-08-08T05:54:16.865028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.852151Z","title":"Openclip, 2021","venue":null,"work_id":"d651a393-929d-46b1-b517-9e7e0de0f237","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.943126Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:b8efb0c0b6fc83659f00634928ec6688f6ef432164563d404ab91d00ec9e89b0","observation_id":"88d8d982-2371-488e-9f1d-7496f0ef343d","resolution":{"observed_at":"2026-08-08T05:54:16.855413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.842054Z","title":"Mantis: Interleaved multi-image instruction tuning, 2024","venue":null,"work_id":"7d111ebc-fbd6-4edf-9c1e-5dbb21dcea2f","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.946618Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6ff2eda53242c554b0d94180e87fbe355dc1a7356f70b280fe32c68b6e084d17","observation_id":"aeb94a3a-7f2b-4238-a29d-50dc08a65f5f","resolution":{"observed_at":"2026-08-08T05:54:16.845876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-08T05:54:15.949814Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.949814Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:a57d696efdb637cbb53f1a5d822b080fdb06f68e1bc53bcbe6f8095a80634797","observation_id":"11b4e977-6a6e-4ec8-8e66-6549b62d0d4e","resolution":{"observed_at":"2026-08-08T05:54:15.949814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-08-08T05:54:15.953157Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.953157Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:10dc39cb2a00cdc9c6da2012856eda2760a8aa705d3106434ec48ceb30f21f4f","observation_id":"40be1038-6517-4deb-a45e-396b5470b8e5","resolution":{"observed_at":"2026-08-08T05:54:15.953157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09291","last_updated":"2024-02-26T18:59:49Z","snapshot_observed_at":"2026-08-08T20:12:12.510339Z","submitted_at":"2023-10-13T17:59:38Z","title":"Vision-by-Language for Training-Free Compositional Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09291","snapshot_observed_at":"2026-08-08T05:54:15.956672Z","title":"Vision-by-language for training- free compositional image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.956672Z"},"links":{"cited_paper":"/paper/2310.09291","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:25e10bcda8a5dc8e0b380a2d0a47f01e50ff4a6371d64ddcce76d43e87898b27","observation_id":"a2540e4b-15b0-4ffc-b70e-47acf8f5fe44","resolution":{"observed_at":"2026-08-08T05:54:15.956672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.831627Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"b543fd3f-d437-4a3b-be6b-be40ddc9d31b","year":2014},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.960045Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:cfcecd6417889bec960dcb07a26b43e2d5f00e61653a97c6cb72e8ebd7f0f203","observation_id":"2fefdf49-ab73-4198-b080-6f82ff96ad3f","resolution":{"observed_at":"2026-08-08T05:54:16.835520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.821434Z","title":"Grounding language models to images for multimodal in- puts and outputs","venue":null,"work_id":"14aeaa69-c537-4a53-9786-b85ebf841be2","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.963359Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ee06b5f2cf8808792d724086307cfb94b9e2f65c32e09031aa235dde19aa9814","observation_id":"449e2b1a-41d0-4cf8-bf8d-2f5a379d0626","resolution":{"observed_at":"2026-08-08T05:54:16.824825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13430","last_updated":"2022-10-31T12:36:18Z","snapshot_observed_at":"2026-07-06T13:56:50.670071Z","submitted_at":"2022-09-27T14:36:16Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13430","snapshot_observed_at":"2026-08-08T05:54:15.966675Z","title":"Uni- clip: Unified framework for contrastive language-image pre- training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.966675Z"},"links":{"cited_paper":"/paper/2209.13430","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5c11c0caa20da6c4097d4cbb279e345585278618f68e4f53cec5f02057abde23","observation_id":"a4e72049-9e5a-47b4-9670-8f0756296a55","resolution":{"observed_at":"2026-08-08T05:54:15.966675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00300","last_updated":"2019-06-27T21:06:12Z","snapshot_observed_at":"2026-08-03T13:18:49.452264Z","submitted_at":"2019-06-01T22:02:39Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00300","snapshot_observed_at":"2026-08-08T05:54:15.970255Z","title":"La- tent retrieval for weakly supervised open domain question answering","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.970255Z"},"links":{"cited_paper":"/paper/1906.00300","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:01801b172db109f9b19a4b4f1a1074b23a0c59563d1dcbfa810efab625f7ce5a","observation_id":"24c7f62a-e6d4-4eb0-85a4-49e7e456ee08","resolution":{"observed_at":"2026-08-08T05:54:15.970255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.811511Z","title":"Chatting makes perfect: Chat-based image retrieval","venue":null,"work_id":"99911928-22fb-4d05-9879-e7af9311968c","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.974015Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:56ace74fa54d26bcdfabcdfb885536ef4b029f65eebeb75527846a65d51ab835","observation_id":"a26127f8-216b-4c52-99f4-09b99c72868e","resolution":{"observed_at":"2026-08-08T05:54:16.814878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.801967Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"445a2822-1a1c-4c56-ba67-35c04c8dfdfe","year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.977277Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ad0ad5901ca068a468255fef8d9bce9e87a88019f63a4ef7ad9f6f0fa002ac70","observation_id":"707197bd-11e0-4063-856c-5150dd2e5bbf","resolution":{"observed_at":"2026-08-08T05:54:16.805378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.792221Z","title":"Retrieval-augmented genera- tion for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":"7f0127f2-bd35-4cb5-8b40-5b613ed74e08","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.980488Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:56ee34ba6dc181c0fa8e929d493c55bbf7456c79df498124bf67f4d0f40425fe","observation_id":"c1f5bef1-4759-4615-879e-d60368870870","resolution":{"observed_at":"2026-08-08T05:54:16.795786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.782018Z","title":"Textbind: Multi-turn interleaved multimodal instruction- following in the wild","venue":null,"work_id":"a3637302-9207-407f-8056-062dc35f2187","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.983696Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:61500e1a4789c4cda8d79b83920ee11eafa435585b13b3e12b76cee8d2872169","observation_id":"96d48774-0e2e-4239-a0e7-7e03dee3e2a1","resolution":{"observed_at":"2026-08-08T05:54:16.785517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.987047Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.987047Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5e4e6cc1df2d1169a8b74b5a7cf236f87bec593d387d5700863b4c0d44c31e62","observation_id":"fd3196f1-a8bc-467e-954c-0fcacac5b9c5","resolution":{"observed_at":"2026-08-08T05:54:15.987047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.990318Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.990318Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:160f3f3003a26e52d605c3c8e8c89147246f15d3cf0d4a8cb390c208656134f5","observation_id":"2e4636fd-fcbc-470c-b437-31dd485575b2","resolution":{"observed_at":"2026-08-08T05:54:15.990318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-08T05:54:15.993546Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.993546Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:52ff72caa4a4e3c5746cacc58f6f3436d34ec0b6298422d4e24dd2555649d703","observation_id":"591ce93e-7e28-434c-9f98-8987dc53e7b8","resolution":{"observed_at":"2026-08-08T05:54:15.993546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.759557Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"e24a1abb-3711-4971-99be-48be5a0f0988","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.997037Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:be913cbcbba15f14d98992f7f9f03ecb35521622d128ade0ba6f8302cb5a0aff","observation_id":"7ee84982-63be-4cba-a493-145152d42283","resolution":{"observed_at":"2026-08-08T05:54:16.762848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.748097Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"327d3463-23d6-4e4d-828b-c26e8cf40f19","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.000680Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ed7707a6aad1ae5e69d84290668e0af49f9c7379c68fcef6438716dd179d3f68","observation_id":"88b233ce-38d6-4a2a-9fd8-41b3558cbc82","resolution":{"observed_at":"2026-08-08T05:54:16.751844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.736271Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"3aff7d4b-844d-46ac-a54a-abe7b96db769","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.003945Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3f8e8cbab94a668799ed288b5f22adc6eb6e8219025d9e25ddb5a378e4089b79","observation_id":"5d36c078-a63d-47a0-9cb2-52bd215e595f","resolution":{"observed_at":"2026-08-08T05:54:16.739618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.007282Z","title":"Image retrieval on real-life images with pre- trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.007282Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6f6db9c9bd0df25051cc648c91662621a7eb70257d132133e65cf04c5282773c","observation_id":"cc3c7b49-a857-4c7a-bcc2-088717bdaeae","resolution":{"observed_at":"2026-08-08T05:54:16.007282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.719959Z","title":"Bi-directional training for composed im- age retrieval via text prompt learning","venue":null,"work_id":"d459fd1b-7074-4c47-9242-5512c63364c0","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.010587Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c7d9dadb29cdac6dd01602690d5a35ca6b94908245c40f343f54adfae3abc3d3","observation_id":"4bb2271a-8d20-46fd-ae2b-601b1da7987c","resolution":{"observed_at":"2026-08-08T05:54:16.723592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.710013Z","title":"Three facets of visual and verbal learners: Cognitive ability, cognitive style, and learning preference","venue":null,"work_id":"e28993d7-544b-49e9-9085-3566e27f9163","year":2003},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.013721Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:fe88e1a5475cd09223bed0e1927f7cb0c18a9329bb0c61c9a41471abfcb54dba","observation_id":"6d68932e-aee0-4a36-9613-52f3a90496fe","resolution":{"observed_at":"2026-08-08T05:54:16.713434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-08T05:54:16.017042Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.017042Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d0b140aa2259957d17583d7dd5c12def6899b30b9cb2a1c6a5e1af43207b37db","observation_id":"e1354ed6-e14f-4de9-8f5e-bbb089595898","resolution":{"observed_at":"2026-08-08T05:54:16.017042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.700108Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"79cd07b2-5540-4745-9e08-5cdf6367ad6b","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.020707Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9192c006117c1917088569d3d6413ea26e1f645f1529264187abd3e403516fbf","observation_id":"f95c9202-b167-4158-9d88-f3e1a0bdc10d","resolution":{"observed_at":"2026-08-08T05:54:16.703498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.024210Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.024210Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2d0babf2b891276becaa631f2e21cfab6d6ca402b4080dafa2eba125349a1621","observation_id":"4b4b17d4-a55e-4555-89c1-548ddd5e7829","resolution":{"observed_at":"2026-08-08T05:54:16.024210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.683832Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"618e307f-be3d-4b39-8e6a-2ff280f1e95a","year":2002},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.027601Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c503450391ad82fd75ed014acbf5a0e6e92679ff24fb08357e91d9e7d318af88","observation_id":"342eb1c4-f58d-44fa-931b-f0ff86bb93fd","resolution":{"observed_at":"2026-08-08T05:54:16.687287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.674370Z","title":"Rora-vlm: Robust retrieval-augmented vision language models, 2024","venue":null,"work_id":"280c87d0-fa62-4f28-9024-8dfceafb8189","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.031009Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:184186c27b363c8425f129876049bdbc768243b3fac94d10a8f70c6bf071843a","observation_id":"a94d9f92-3caa-43da-9e5f-d4e191272feb","resolution":{"observed_at":"2026-08-08T05:54:16.677710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00555","last_updated":"2024-08-01T13:38:58Z","snapshot_observed_at":"2026-07-06T18:55:37.298696Z","submitted_at":"2024-08-01T13:38:58Z","title":"Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00555","snapshot_observed_at":"2026-08-08T05:54:16.035119Z","title":"Alleviating hallucination in large vision-language models with active retrieval augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.035119Z"},"links":{"cited_paper":"/paper/2408.00555","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:92ba0921d318e80395805efacdcedda20f3978b3feb67fd196b9ac8787055e6b","observation_id":"19c69085-513f-47e0-9035-33bc8a69694c","resolution":{"observed_at":"2026-08-08T05:54:16.035119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-08T05:54:16.038739Z","title":"Learning transferable vi- sual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.038739Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1d041d438ce596fc619715721eafae8584246d8c1f1ff84e67857f562e2f8a59","observation_id":"7b0afb44-c106-4e9a-8e51-81e36db8fc49","resolution":{"observed_at":"2026-08-08T05:54:16.038739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-08T05:54:16.042435Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.042435Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e9149279413c93eface34bfbd5b69f17d81d1bd8f27fc3bb4558681ce89ad7a0","observation_id":"645a6847-16b2-456f-b901-afd2f19c4813","resolution":{"observed_at":"2026-08-08T05:54:16.042435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.664319Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"555bc705-7108-4fde-9ff4-9984b22ef56e","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.045951Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:412824375637252e1cf057a9288d3328064571709bd32050fdb3f443ea9e14d0","observation_id":"94e1b93c-2782-482f-8579-efdd03bdd4a6","resolution":{"observed_at":"2026-08-08T05:54:16.667678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.653855Z","title":"Kvqa: Knowledge-aware visual question answering","venue":null,"work_id":"af0a8887-106b-47ac-ab78-f97d76a6cc92","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.049269Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1627cc7c1757c90912b7ef87ef2214019380e602b7bcce9d9e5883aee55706e4","observation_id":"084a3a0d-94b5-4e4c-b964-2dc08e73e7bd","resolution":{"observed_at":"2026-08-08T05:54:16.657548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.643133Z","title":"Towards vqa models that can read","venue":null,"work_id":"30193382-e180-4e5f-a3f6-d248a3866776","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.052474Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c92578e6078c49dd103c98efdf4f87904c5b7fa9a1af6707f8b2a9f3e62f7cc0","observation_id":"5932d71f-7388-4f8e-885e-54ca21648e15","resolution":{"observed_at":"2026-08-08T05:54:16.646486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.632507Z","title":"Knowledge-enhanced dual-stream zero-shot composed im- age retrieval","venue":null,"work_id":"b97a26f3-80f0-49e3-872a-59b72e567c98","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.056213Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:25100cf20adc72c78adb5132013ec176d4cc335f95026744a18354fd0c285819","observation_id":"b0f5bc17-34e7-4571-bb41-9805ece0c23a","resolution":{"observed_at":"2026-08-08T05:54:16.635984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T05:54:16.059617Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.059617Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:953893fe3eff368749de67ea5fd6a2fedea240f54ee3bfe011a4be9fa2344921","observation_id":"e5afdb99-5d1e-4271-a2e3-02333f732556","resolution":{"observed_at":"2026-08-08T05:54:16.059617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.622386Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context, 2024","venue":null,"work_id":"3ac8b7bd-94b2-4f46-90d5-5dd410f46861","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.063185Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:bee138db616635ed5fd633fdb2f2fd7a7b1da388407f4da0dd1b825abd3874fb","observation_id":"17392f1e-64e6-4937-80c0-e3260e4c6c9f","resolution":{"observed_at":"2026-08-08T05:54:16.625967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-08T05:54:16.066474Z","title":"Mm-interleaved: Interleaved image-text generative model- ing via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.066474Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2720c679a4ccbf05f2631f376ad4421bab2dc22cf9666dda2d279b36509c54dd","observation_id":"918b30d8-a3b9-4390-9cec-7a5a6d442a61","resolution":{"observed_at":"2026-08-08T05:54:16.066474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.611932Z","title":"Genecis: A benchmark for general conditional image similarity","venue":null,"work_id":"02fe3b97-3720-410e-a03f-01b17cf2bb08","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.069876Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:61d78d7cf7f503257507a235b6d4a628fe3e7938d4dd7c83ea4f2b85a8183e22","observation_id":"faeba532-7ee5-473f-a4ec-791afc12438a","resolution":{"observed_at":"2026-08-08T05:54:16.615682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.601734Z","title":"Composing text and image for image retrieval - an empirical odyssey","venue":null,"work_id":"2dfe9a09-9d9c-4009-b99b-11e8f9b186bc","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.073150Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:69c816e38b22173b5c8da0b0eebd765ad60b98c10e2e089fb5ff14feed63800f","observation_id":"c4307a2c-2981-4e25-ac03-72277d72af1e","resolution":{"observed_at":"2026-08-08T05:54:16.605302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.076600Z","title":"Composing text and image for image retrieval-an empirical odyssey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.076600Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:391a3ceacf449ce36b37ffaa57510bcb0a6fd6f9b01383839bd593153b9effb8","observation_id":"8a47854d-ddaf-4635-ba28-df7b6e540b35","resolution":{"observed_at":"2026-08-08T05:54:16.076600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.585369Z","title":"Cross-modal feature alignment and fusion for com- posed image retrieval","venue":null,"work_id":"e2139728-5190-41b6-9609-7d6fc294b759","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.079980Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:bf6c8bb3718716c691b92465aa084fb619211c14a6a8db95799d9a2cd9af1f49","observation_id":"d573bb81-416d-4a88-87cc-ffb22d910204","resolution":{"observed_at":"2026-08-08T05:54:16.589090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T05:54:16.083564Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.083564Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5e5f256f75d249e3423275039a2b869d5012ea455de022acb736e6bb6581608e","observation_id":"891a069f-594a-423f-a1ca-f90029ac0587","resolution":{"observed_at":"2026-08-08T05:54:16.083564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.575572Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":"54d1dcf5-03f2-47df-b74f-7319804cab9c","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.087345Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:63b30ee38e3f2f80cf06eb75a68d0bc32b9e8c5254de170a023711a20ba316ba","observation_id":"182dbbdc-3271-4672-97ca-4db2bebad9f2","resolution":{"observed_at":"2026-08-08T05:54:16.578986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-08T05:54:16.090827Z","title":"Uniir: Training and benchmarking universal multimodal information retriev- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.090827Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f652ab52ede725cca5f4c44488610446e8f6c0e80b44fc2da9bd65ea1b8f18af","observation_id":"8462c595-82f9-4c73-9e8a-f598044ab3da","resolution":{"observed_at":"2026-08-08T05:54:16.090827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.565604Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"6f0b6832-953c-4309-a0c9-d5923fde954f","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.094338Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:17633d1020afa93a807de092b08344f05930ed0be55d6275878aa088a3c97d06","observation_id":"7faf818e-0027-4616-b6a6-dba6c7623a02","resolution":{"observed_at":"2026-08-08T05:54:16.569127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.555426Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"d1c861f6-4985-464d-8e3c-0658f0fbaac8","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.097683Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8d1e4dad2224e45cac7c64b89533f2a629b0b8122a226cab167fbe9a14d4983e","observation_id":"f480dfe3-c184-478b-a138-44100814778a","resolution":{"observed_at":"2026-08-08T05:54:16.558907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.101159Z","title":"Visual question answer- ing: A survey of methods and datasets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.101159Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:705d4044f324c950899144aa02288c42ae44cd452430c5b4a58ee2bac81584a5","observation_id":"f981b359-073d-4059-9f45-42a1fba8df2e","resolution":{"observed_at":"2026-08-08T05:54:16.101159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-08T05:54:16.104506Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.104506Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ea31d479a81915d27d8ecb8753e47c0c3b8296031acbd15cb31921e31ec1fded","observation_id":"cb9d029c-c0d8-463e-80cb-d7253de4152e","resolution":{"observed_at":"2026-08-08T05:54:16.104506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.539157Z","title":"EchoSight: Advancing visual- language models with Wiki knowledge","venue":null,"work_id":"3a8ac2a9-a08f-4b63-aa2c-12e7daae4407","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.108201Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:4cc998958c404ce3434845735490f5e41551cca683ff0c50174acfe37fc3b7c8","observation_id":"22ec78be-1e28-48a4-af82-7030b566ab26","resolution":{"observed_at":"2026-08-08T05:54:16.542820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-08T05:54:16.111778Z","title":"Filip: fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.111778Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:23cbe9f5b7a4cd5626f85a3df2064df5735a7faabe8c0c153e9730d57017c1b1","observation_id":"44e175a0-ec5e-4e91-9d78-8d43d48b7cc9","resolution":{"observed_at":"2026-08-08T05:54:16.111778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-08T05:54:16.115407Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.115407Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:49f55b89930a961d39941c56e0045c85f1e631a908decd8ca3d06d323eebdfbf","observation_id":"f3622b38-edbd-4faf-8681-7c8a7e89af82","resolution":{"observed_at":"2026-08-08T05:54:16.115407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-08T05:54:16.119075Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.119075Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8f3488649dc56bb7b410ac5cea8fa6f1792328718ec1f67bf1109df33d320781","observation_id":"962fba5b-9b5b-4d40-b138-8a495af5dd8b","resolution":{"observed_at":"2026-08-08T05:54:16.119075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-08T05:54:16.122413Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.122413Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:42a1e37fc883ce8af051b699a50f09679067e1eaa7ffcf72ff959f42335156ed","observation_id":"43394a8b-a74f-4e12-ad5a-39f6911df660","resolution":{"observed_at":"2026-08-08T05:54:16.122413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-08T05:54:16.126629Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.126629Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9c59db9b7fdbde9cb9761013347435c09882b2fcf6b8090c0e67c2b3d97f64e4","observation_id":"00b79990-a65d-40ee-9b7d-cc78b3d733dc","resolution":{"observed_at":"2026-08-08T05:54:16.126629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-08T05:54:16.130352Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.130352Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e07ac3173e90236f1e2125230fa022adfae51e65d02d726826b73be2ba143fe5","observation_id":"3382d6d5-1c24-40b4-a9db-3d32e9e0b111","resolution":{"observed_at":"2026-08-08T05:54:16.130352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-03T18:52:32.049047Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-08T05:54:16.134206Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.134206Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e434973b0725e3ead0197c6264476e25289106c7e21d50c50133233a73127c49","observation_id":"5ebec1ff-b09f-4a7e-ba09-4104836ad76b","resolution":{"observed_at":"2026-08-08T05:54:16.134206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.528968Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"6880512b-d89b-4b9d-acbd-566bc37716f1","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.137913Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6fdbf3cc46aa6d811c873086d0d5cc490f2caa1ba7598561b6d3e8ee291f925b","observation_id":"a892aaff-44e9-478b-91be-e937e72ad97f","resolution":{"observed_at":"2026-08-08T05:54:16.532426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-08-08T05:54:16.141327Z","title":"Magi- clens: Self-supervised image retrieval with open-ended in- structions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.141327Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d0c6b6dfc981626503a0b26c2a825969388cf0c5845b0e10471aab698b637096","observation_id":"151d9cde-c624-4470-b210-bd4e414baa0f","resolution":{"observed_at":"2026-08-08T05:54:16.141327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09304","last_updated":"2022-10-17T17:57:46Z","snapshot_observed_at":"2026-07-06T14:06:48.707061Z","submitted_at":"2022-10-17T17:57:46Z","title":"Non-Contrastive Learning Meets Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2210.09304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09304","snapshot_observed_at":"2026-08-08T05:54:16.178366Z","title":"Non-Contrastive Learning Meets Language-Image Pre-Training","venue":"cs.CV","work_id":"206a6ef0-8fbf-4000-8b4d-b6975e92f551","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.145165Z"},"links":{"cited_paper":"/paper/2210.09304","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e4f8ad5bd9a90d05c236c7ce55f64d8e672e6e32dc848650b5a38f7eb8e3a2eb","observation_id":"a4528704-16cb-4ea1-b256-d898499e5c46","resolution":{"observed_at":"2026-08-08T05:54:16.184255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.518720Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"670a0375-a6b5-41f6-8b8c-ce135483937f","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.148845Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:38560a2c19511efc1ab7652a8d56ad963b66baccabc73b37f8841b31fd4c1908","observation_id":"e6957db2-f559-4b6d-bc2e-ba3a7e2a2f08","resolution":{"observed_at":"2026-08-08T05:54:16.522347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2502.08254."}