{"as_of":"2026-08-08T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b12d1a99cf9511e08662bdadd268e50779d0c651f52238686a42863ff051e65","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:28.606467Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:28.067052Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:55:29.193720Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"cited_work":{"arxiv_id":"2506.03096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03096","snapshot_observed_at":"2026-08-06T11:55:29.193720Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","venue":"cs.CV","work_id":"cfefb165-0b6a-4b63-9f2b-4ba2174bac8c","year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-08T04:16:24.237115Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.067052Z"},"links":{"cited_paper":"/paper/2506.03096","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:31ddd9c65d6dd3d5ab0caade5726023b310158e89aa987329098f157be838221","observation_id":"cdce7db5-aaeb-44ed-b0dc-df797bdead84","resolution":{"observed_at":"2026-08-06T11:55:29.196787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03096/citation-record","integrity":"/paper/2506.03096/integrity","json":"/paper/2506.03096/citation-record.json","paper":"/paper/2506.03096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:34.425075Z","title":"4M-21: An any-to-any vision model for tens of tasks and modalities","venue":null,"work_id":"7d995f66-9f43-43ab-923c-153981e31937","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.087022Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:9d8c9386e83f57519f1edd1195a63cea3880cc8888ca35d572936c05cb260504","observation_id":"9ed39858-fade-4067-98e7-e06caba8e887","resolution":{"observed_at":"2026-08-07T11:14:34.557399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:34.186453Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":"9c48b558-021c-4ff9-94de-3163e38be8b1","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.178855Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:4a8c9dbd24b5cc7b55b46bbef96263585dbdecabb8ed76ac11282eb1fe55dfe7","observation_id":"9cb93a64-e857-4b93-9163-3b379ce22227","resolution":{"observed_at":"2026-08-07T11:14:34.296341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:34.063693Z","title":"BEiT: BERT pre-training of image transformers","venue":null,"work_id":"e522733a-10b2-4189-92dd-8c8cae3c0fbd","year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.280121Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:4b8d39e3d7773a96a0c3059af7d261f44310de8568771de544c8772f97eac5b2","observation_id":"843f6fe7-90e7-4cd0-9951-977d031bbeda","resolution":{"observed_at":"2026-08-07T11:14:34.129683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T11:14:23.390643Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.390643Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:b80db2721c0cfb20d103ce455919b2fa7279dea75b0c2f53ea87b5867ec5fbaf","observation_id":"1b869257-70c1-4cce-97e8-a88289041117","resolution":{"observed_at":"2026-08-07T11:14:23.390643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.925763Z","title":"All you may need for vqa are image captions","venue":null,"work_id":"a8f3350f-224b-42ba-85a3-65320d59a418","year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.517383Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:a83d03b6d50ae9511a455ca07e596cb07609ee3384cafc9e59895b63424dcde2","observation_id":"d894bb48-436a-48e4-ba01-d7f94534e70f","resolution":{"observed_at":"2026-08-07T11:14:33.990034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.848018Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"bbb7bf13-65b1-4f82-9849-cd7c54503b83","year":2021},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.580996Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:0a76dea8119d9727666a63d87c084876dfc68c15df3834b32329a532e68946f4","observation_id":"494f61e7-b2b6-47b9-9471-a78c51515c42","resolution":{"observed_at":"2026-08-07T11:14:33.886746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.721543Z","title":"Understanding transferable representation learning and zero-shot transfer in CLIP","venue":null,"work_id":"6c9f4218-92dc-422d-8d08-5ecc4b31509e","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.639244Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:42d9a52cbef5f487d30ae9f6e03453bd6f38ddfaeaf0a15ce1ca44e059819d13","observation_id":"08e897f4-988d-438c-bc76-ef9b4c3b8f12","resolution":{"observed_at":"2026-08-07T11:14:33.775659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.640579Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"6151ba63-bc3d-4da3-8148-6a00f1872c30","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.759334Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:491485a784a154f29bedb37c066e47183470f41fdea908429a3a22dbfc1e3330","observation_id":"1cf73c11-e53e-4c18-9520-d7be9186633c","resolution":{"observed_at":"2026-08-07T11:14:33.682817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.512556Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"60d6a9f7-1011-4843-83cc-83a40d7483ac","year":2009},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.837170Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:092900206c73c8731af6dcca27a29d5919c5b326c679dd4819d9aad9530d7556","observation_id":"aa8602d3-d47b-443a-b5d2-dcfca48a8565","resolution":{"observed_at":"2026-08-07T11:14:33.557702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.397873Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":"68f56635-4a1e-42b1-b45b-e07d6d20b11d","year":2019},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:23.956817Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:9e8ac0bef49677504ee2eb1e701b4057c7f28f660167e981cfd6356e7c09a6fa","observation_id":"cb770c8c-2a79-4e1d-adb2-3049e3c59a6a","resolution":{"observed_at":"2026-08-07T11:14:33.464984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.299722Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"5e6d1e00-133d-4d74-9774-195b06afb9ce","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.060445Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:7e0a2f1a9994955da651b29ff2842c95c942e1aeab380137e6770833874af022","observation_id":"c432fe62-658c-4d53-ad9a-a9022fc97142","resolution":{"observed_at":"2026-08-07T11:14:33.354101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:14:24.193921Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.193921Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:7dbd0d82a6b5745688464cc948e71d01cf0c112e139dac44b9caa7fb1ae2d10b","observation_id":"0fd1af9d-39f7-4783-9788-f1d0f4d9fbdb","resolution":{"observed_at":"2026-08-07T11:14:24.193921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.194067Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"2d17325a-1a20-470c-ac49-8417c8d803f8","year":2021},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.311637Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:2f39e8ac23af12ed88699cc72b4e53f39d13568dbee877db2d9dd9104d8555ca","observation_id":"b11d3bb8-0ab1-4fa2-8f9b-27fc5fc7f308","resolution":{"observed_at":"2026-08-07T11:14:33.245457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:33.069169Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":"2e1136e3-52b0-4073-b284-11dfb8a8ef22","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.448475Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:9ecced73c87ac76aeb176ababb0eb9f11faa7392cb70bd058e33314bfe9829de","observation_id":"bb475763-a59d-427a-b4c8-7ae4b4a5f9c4","resolution":{"observed_at":"2026-08-07T11:14:33.129797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.973928Z","title":"Language-only efficient training of zero-shot composed image retrieval","venue":null,"work_id":"688dfdee-6f21-483f-b15c-62e629f299f8","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.584746Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:c2bd843c6767da8a3cac8978157a4398475035764ae94f628f1cb64022edc1df","observation_id":"7e2d01de-0b28-4cb6-8211-104430daa9f5","resolution":{"observed_at":"2026-08-07T11:14:33.021382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.880229Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"679f007f-6ae0-435b-b3fe-44ae8252c220","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.674048Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:e3cd4c46b5efbc6a0544cd9ff8aba732a96ca26f4dd25c917261b7c15191f98a","observation_id":"837e14ff-b602-40d5-b2fc-b2d9550d026a","resolution":{"observed_at":"2026-08-07T11:14:32.919515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.798456Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":"116164b7-2283-4773-a868-2a2e7fa5ead8","year":2025},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.789096Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:d648ede10d6a630ded5f8bba704ad3e47b19600c014eb23dd3af94ed79ea061b","observation_id":"f5f16587-952d-4cf0-b754-d2c365832953","resolution":{"observed_at":"2026-08-07T11:14:32.837374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:24.894088Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.894088Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:b12f485a48716e376c8dd206a96996fa3c219dd02d1354f5b269b1282df5a8bd","observation_id":"df0adcd8-bfce-482c-a84c-7dae883e1ac1","resolution":{"observed_at":"2026-08-07T11:14:24.894088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T11:14:24.985554Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:24.985554Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:c46cb2b876d72b75085cc0b9a56770f902872709fd0ef98b3e24741eb1679a7b","observation_id":"e334eac3-8f55-4ee9-8da4-99fb353502f9","resolution":{"observed_at":"2026-08-07T11:14:24.985554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.675521Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"b6132135-0000-46b7-ad22-a84c3e80e79a","year":2025},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.098746Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:19276e2bfe4562a3434fdbdb8577e38957569f52a00fcb8232aeefa428c5c7f7","observation_id":"b801fa92-b8c0-4041-8bb0-87e2ce385ef8","resolution":{"observed_at":"2026-08-07T11:14:32.716035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.583540Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"815df97f-9c7e-4e77-9123-1fc82632c466","year":2020},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.212454Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:06733881b046c38642bc5b4a32f1a4d7fd51e1b09130e932c773aeaade98a69a","observation_id":"5c55ce28-7e71-442b-9775-b612e8373450","resolution":{"observed_at":"2026-08-07T11:14:32.613227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07730","last_updated":"2025-08-02T07:11:16Z","snapshot_observed_at":"2026-07-06T20:20:37.632750Z","submitted_at":"2025-01-13T22:37:17Z","title":"Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07730","snapshot_observed_at":"2026-08-07T11:14:25.297748Z","title":"Democratizing text-to-image masked generative models with compact text-aware one-dimensional tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.297748Z"},"links":{"cited_paper":"/paper/2501.07730","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:413f6794753d5feafa3c7f2c0c045898b7c4df0c7ed0dc5f040ad2ee79642abd","observation_id":"b7f3d2fa-61a0-499e-b276-ddfe51cae974","resolution":{"observed_at":"2026-08-07T11:14:25.297748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.474885Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.IJCV, 2017","venue":null,"work_id":"13acef0d-928a-4d5b-a5b5-68757919fadd","year":2017},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.415308Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:00067e028e5e96cb2dfb8f52e5ab575f3138f670ebedb0cb0e146d040e203a1e","observation_id":"163d1407-a624-4fcd-ba8f-b3bfae928cfc","resolution":{"observed_at":"2026-08-07T11:14:32.525438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.365414Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"37d431d9-87da-45b9-b6a4-31496a85965f","year":2020},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.518996Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:71c9e43effbfc8b5171b65cab8a95e4fc39ebcf96bab1cf76fe62700d8c633d0","observation_id":"3d965c66-e85b-4216-a5ae-0e563dfeb644","resolution":{"observed_at":"2026-08-07T11:14:32.417980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.223303Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"aafad92f-38e7-4a9c-bf29-03616ddce78e","year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.630094Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:5288ba87c303ff5288c2d4ec3411e9628383e25bbac170247f83d190cf70a597","observation_id":"7d89c8a0-66b4-4823-8681-f9057a169c61","resolution":{"observed_at":"2026-08-07T11:14:32.304284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:25.764193Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.764193Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:2dfc65d2cf50bbeb9a2a1f7fe57f2d7bc1db1a0fd173177810dd7c3cc0bf472f","observation_id":"e07f0e3f-31d0-427a-8f86-cc262e0424ec","resolution":{"observed_at":"2026-08-07T11:14:25.764193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:32.056791Z","title":"Universal vision-language dense retrieval: Learning a unified representation space for multi-modal retrieval","venue":null,"work_id":"76323c96-56fa-4883-a1e7-2436677bc65c","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.869859Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:5e230f515bd36f302bf03e5a91af854947d0a324043d7ced9013df4a0720cb07","observation_id":"9267b3c3-057a-4a59-b17b-dc84985ae7ee","resolution":{"observed_at":"2026-08-07T11:14:32.155301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.949962Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"e0936624-8592-48ac-922d-d2d66639ff9c","year":2018},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:25.953221Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:ef88261508e8bb39d99d6ee7179b992674f8d272b831925f33bbeb9538416f50","observation_id":"f831d799-616a-4c29-a57a-844c122c90c8","resolution":{"observed_at":"2026-08-07T11:14:31.992247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T11:14:26.091512Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.091512Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:d01e6d3ee1e0dd27230a14ccbece06ad9467b13830ef4683191cf6684e412faa","observation_id":"0330e435-b54c-45b0-8640-3fb3636ff3be","resolution":{"observed_at":"2026-08-07T11:14:26.091512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.823983Z","title":"4M: Massively multimodal masked modeling","venue":null,"work_id":"8a7d96f4-ce56-4a16-bb1a-603af66fde17","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.267694Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:66ce13f51d8fb0df708951f257693f7c5eb2e6025defa9edc9f30e7dbb064f66","observation_id":"ebb90a6d-3e34-4faf-94fa-06e656d78717","resolution":{"observed_at":"2026-08-07T11:14:31.867994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.719679Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c9d61f1e-6bc5-4f16-abef-017e5ddb2c51","year":2021},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.367835Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:238ecd9d379a5806339f5bb9c75e1bc8adf0225783cffc822b0dbbb9e7fb7e16","observation_id":"5ca6bf1b-f61f-42b0-9b94-3fb20cabc4f3","resolution":{"observed_at":"2026-08-07T11:14:31.778503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.598112Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"b060608d-ca70-4c91-aa60-c907757f9b7d","year":2020},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.479501Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:d7a847d6893c7fdf4903614e4b5d87dd6d42dfa64226f59dda485999fa4f9063","observation_id":"685d25df-f3bd-4182-9146-cbfbb3299bdf","resolution":{"observed_at":"2026-08-07T11:14:31.649413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T11:14:26.584738Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.584738Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:75a261fbec4af259d25141aa16bbe4e61540112e8f193abcdfffd840aa8f7a08","observation_id":"726aa4b1-bdb6-4c82-bcfc-c29f883b32f8","resolution":{"observed_at":"2026-08-07T11:14:26.584738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.471428Z","title":"Contrastive learning with hard negative samples","venue":null,"work_id":"e262729f-be38-4554-b26c-d9235e15b3ca","year":2021},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.665589Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:bd21435b21ca284a7bc423d0ffa27b9a61f08cb43d3094ca76cd82ee9caf8ddb","observation_id":"fe737f5e-fc12-40b2-bf4a-a691b7b3fc69","resolution":{"observed_at":"2026-08-07T11:14:31.556519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.367624Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"98cc20ac-51d2-461d-a470-914670b0bab1","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.746652Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:e548084ff433845073d8c3ffe4e7a8ea0634cf1df9275cd79c593d6e08112cd9","observation_id":"a161c2c6-7052-44f3-b35f-02ce37ba2616","resolution":{"observed_at":"2026-08-07T11:14:31.418550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.237030Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"65a14789-7260-4906-b643-862ec4ff8dca","year":2018},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.802857Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:0db7451b1e7f41fb942bb3c4381a87b719346d6faff3de52e49f2a1924479765","observation_id":"0b3b8330-ed67-48e4-be40-aaa806d0b0c1","resolution":{"observed_at":"2026-08-07T11:14:31.299067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.091674Z","title":"Towards understanding the modality gap in clip","venue":null,"work_id":"c24ad3fa-2201-459d-a23c-1085c1428b1c","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.901538Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:db7528d1edc7039567ada9144f212624d0e9348e7fa5d887e62e90a2fd46d0fb","observation_id":"e467b26d-a173-4250-b527-28093c29a0e8","resolution":{"observed_at":"2026-08-07T11:14:31.178468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.974955Z","title":"FLA V A: A foundational language and vision alignment model","venue":null,"work_id":"d9cbc7c9-b0d8-4159-a8d4-0a1fc038e974","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.965593Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:230fa460768dd9d8e1bba5734a2c7ce1676f38f753aa61647120ef15c6268d23","observation_id":"90f3f5d9-5e2a-4835-8190-6877d5b1b812","resolution":{"observed_at":"2026-08-07T11:14:31.046467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T11:14:27.042563Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.042563Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:6decac2e86fa66612b9034a02abb78a7dda54b1fb78d70c207f9b160b380437f","observation_id":"a10a96e6-01a0-4da0-9c8d-1df34c23561d","resolution":{"observed_at":"2026-08-07T11:14:27.042563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:14:27.136459Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.136459Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:8d7e884ae01e0e71dbaa94135e4f23ad9f03df6e00df37c432ebab8fd3b8062c","observation_id":"613cdf8f-2a49-4ec4-8fa3-f44c17f4e834","resolution":{"observed_at":"2026-08-07T11:14:27.136459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:27.251290Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.251290Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:867b6bfeb90f439f39807da3eea8b26b4dba553970c6904d639545643934ac9b","observation_id":"497cf7b5-a8b4-43e8-8fea-914f796a061b","resolution":{"observed_at":"2026-08-07T11:14:27.251290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.807877Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to- sequence learning framework","venue":null,"work_id":"8788fcfe-f0f1-440f-992d-433554d30fde","year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.350816Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:b33ed0b86a9dd97287603317ca865ef6e2e7ee871758148c86c1271d4b4a551d","observation_id":"05ee0f4a-8ca8-4684-bd1b-1a62196deba7","resolution":{"observed_at":"2026-08-07T11:14:30.869888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.639490Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":"526ee435-1071-49e9-84c4-92016451824c","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.482449Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:b221dac099fa6db27751ce74a8288088b4b7a40250fa38a5c28e8238f243bb0f","observation_id":"505e623d-3c28-4808-bf86-62e062430458","resolution":{"observed_at":"2026-08-07T11:14:30.710665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.494050Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"d3acfe6b-32a7-41ce-8a0b-de6a425c477b","year":2022},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.604662Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:19aa06f1025db6b5281d5532db903aae420ecc3ea86c795be152dc9f9eda0d68","observation_id":"112ca790-d670-4692-8f41-5d4b31f18c51","resolution":{"observed_at":"2026-08-07T11:14:30.570571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.385977Z","title":"Bridgetower: Building bridges between encoders in vision-language representation learning","venue":null,"work_id":"b1a3d10a-4120-45e9-b792-2a1db6ba2853","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.701150Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:fb5b3488201c7e7e805864617d4e95574d13c4a4dc421852926d6985a611573e","observation_id":"9d2c0216-9f12-4504-8b26-37d8d0e3c5f9","resolution":{"observed_at":"2026-08-07T11:14:30.449384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.241966Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"bfbce8df-0d7d-4aae-b771-8d498e50e7e9","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.794105Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:32876362b0a8e5ba03fb5b3d7197c810f3262d0685c518e5214b2362129eeb4c","observation_id":"f278eb64-6d5f-4f50-ab75-56c4c614c8fd","resolution":{"observed_at":"2026-08-07T11:14:30.310541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.094349Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"43724195-ddcb-432b-8b47-af3293f70368","year":2023},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.896708Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:1ef29b11ccbe9c4e56a8d5ca574b37de7d1b3137591faa845169f6c1038b06f3","observation_id":"01dc3f6d-aaf4-4c64-b5ba-ac51523ae568","resolution":{"observed_at":"2026-08-07T11:14:30.160191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.925281Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"6b30e513-7f43-477e-8d6b-928eb97ea713","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.988902Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:94f0e98b49ac1771a7270d16dbb85174e1f45145018fd1516d1f3d7de97049f7","observation_id":"d637248f-3224-45c9-ab61-2d67cb6366af","resolution":{"observed_at":"2026-08-07T11:14:30.023795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.784213Z","title":"upper left, upper center,","venue":null,"work_id":"ab5d22af-fc85-4b37-8cf8-bf935a14c0d1","year":2024},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.101210Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:41bd141b0f7cc8d7d9a0a86500f8d25afecc98faa31483dc7ab2a9a02b93bee8","observation_id":"d2b67434-2652-493e-b0bb-6da00b6f1b67","resolution":{"observed_at":"2026-08-07T11:14:29.864818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.623781Z","title":null,"venue":null,"work_id":"14bf25d3-39a3-4e7c-8392-09be0cbc9bd4","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.138032Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:e0274c4ba5701196af0da76899c520076768a5e9b3cf32015707af73cb85d487","observation_id":"87177a54-1e14-4952-9ab1-f70f33b5a5aa","resolution":{"observed_at":"2026-08-07T11:14:29.704991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.489604Z","title":null,"venue":null,"work_id":"e0c8eb32-a89d-441d-8315-ae25d9aeb0f3","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.217502Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:cffbf5940cefc2690104c51bec96d197551c6faec97150b80a82a6b0ed37d463","observation_id":"484e56ad-241c-484d-8993-449bba093f24","resolution":{"observed_at":"2026-08-07T11:14:29.574570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.331067Z","title":null,"venue":null,"work_id":"752d4f3c-312f-4b0a-9b44-879b5fc212fe","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.321253Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:894948900abad5b3e36dd5a1805c82729c62bc38b2ce4efc50d8e9fd6a2ae88d","observation_id":"7691d229-b6cf-4efc-8da9-85f6e5f3b099","resolution":{"observed_at":"2026-08-07T11:14:29.421030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.192346Z","title":null,"venue":null,"work_id":"c2082806-8917-40b9-a0b2-8d179465c2f1","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.404311Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:7028e1029ecf199788e13dd9d0610ff4bccf6cb492f2a2b8fa72638b387d7b8c","observation_id":"dc538a3b-e078-43bc-9b44-b08d22f7d502","resolution":{"observed_at":"2026-08-07T11:14:29.252149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.967046Z","title":"The {object_name} on the left/right","venue":null,"work_id":"0389ffb1-d262-486e-a1e9-1cacc6e16dc8","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.511265Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:1ff5b76f4e792bf551b6a642f5077e011cc86221b29e22825a802fe5fa6ee2d8","observation_id":"dd478e66-6fbf-4a1c-81b5-6c79b2bb817e","resolution":{"observed_at":"2026-08-07T11:14:29.054862Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.789626Z","title":"Notably, this model is much larger in the amount of parameters (4.15B, i.e","venue":null,"work_id":"e098b1bd-4264-42c1-bc52-c06d3ab13db2","year":null},"citing_paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.606467Z"},"links":{"citing_paper":"/paper/2506.03096"},"observation_digest":"sha256:428c417d009d4475680b9a2495c722715f039307b2b6dbd633d46cfb51f5494e","observation_id":"53a2cc21-01d7-4499-973b-e6ec13121e93","resolution":{"observed_at":"2026-08-07T11:14:28.889029Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03096","last_updated":"2025-06-03T17:27:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:06:32.974059Z","submitted_at":"2025-06-03T17:27:12Z","title":"FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2506.03096."}