{"as_of":"2026-08-08T13:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ff77c1afba7372f64ea2b0079f0f1a91d0cc7f38d4142ed4bf48d19e5fe532a","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:12.272631Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19614/citation-record","integrity":"/paper/2505.19614/integrity","json":"/paper/2505.19614/citation-record.json","paper":"/paper/2505.19614"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:05.393365Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.393365Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:87c524eb730bca6d5f7d4eda5013830b2f0d931671155c11c2434267e88c93a5","observation_id":"88fcee8e-b536-4f23-83ed-61fc586f5465","resolution":{"observed_at":"2026-08-07T14:16:05.393365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.985384Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"6bee6d57-bdd5-48d2-b839-c9be8bcd4846","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.461560Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:06bd3fdc0860078465f66a92f9dfe77a337091b09ebaacc71dd46ac060b1abd3","observation_id":"1a2feed3-2c2a-48c5-aad5-5a56d1975b13","resolution":{"observed_at":"2026-08-07T14:16:28.050920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.794997Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":"ce6fce5e-bc99-41d7-81c1-4b485bd08406","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.566619Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:336ce34694b565435cb6f3fc4f86612d2fba4019beaa9c7b241b89d01a52a921","observation_id":"d31fb068-aa02-483f-8c6c-6df90c3e9834","resolution":{"observed_at":"2026-08-07T14:16:27.897788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.601771Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems (NeurIPS), 36:34892–34916, 2023","venue":null,"work_id":"9298d68c-f032-4be1-8af9-5ff3b17a717d","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.701492Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:04adc3a0f43d65ef40ac96cad7f2d59f63fe6aacb8de45c86d394e58f526c9f2","observation_id":"6cc936eb-e062-43a3-bdb6-1c687a1a83cb","resolution":{"observed_at":"2026-08-07T14:16:27.687236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.443252Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"c563ee6e-ddfc-414d-82f3-a63da8d43541","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.774627Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:759cb53ee48e9e0fdb35881146b81a1e84241f68904b3bcdb6809dcd5bbbf4b2","observation_id":"c6f33397-522f-42cd-8094-c5cfab1360d3","resolution":{"observed_at":"2026-08-07T14:16:27.514038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T14:16:05.878432Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.878432Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8598c836f2077da6f08433057ca9cdfafcb5aaa6bd0b35605c82c38628c73a5e","observation_id":"5c4c8073-19af-4a27-b687-cff42eba5f52","resolution":{"observed_at":"2026-08-07T14:16:05.878432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.272035Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":"19a8798a-28e6-48b4-bb3a-c0dd8779ebea","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.950601Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a0b19ed4ec89542d13c3936e14483d547076593c5657a58e9f28c780ba63ce60","observation_id":"9b56f72f-eea8-4795-abaf-b5d88fc79a24","resolution":{"observed_at":"2026-08-07T14:16:27.334741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:16:06.031371Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.031371Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e356675bff43fed9e56d023a1466d604832eac8b7fd383fc9c34e1a54fa54ff3","observation_id":"7dc6fdd1-c18e-4b37-8101-5201b6a14cb4","resolution":{"observed_at":"2026-08-07T14:16:06.031371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.051055Z","title":null,"venue":null,"work_id":"7ab3c76a-6c00-4026-ba78-4dbf2da4f038","year":1956},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.101633Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6df49f0a73b459bf048dbeb57257fb2cd013156c553e590967a54b2be1fd0c6a","observation_id":"f98bee01-7044-4b51-9a05-ba13b9253fdc","resolution":{"observed_at":"2026-08-07T14:16:27.119430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T14:16:06.169961Z","title":"Microsoft COCO captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.169961Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6fcecbf1d9ec306999c99b0e32c633986420d6c2beb3d958b9660152955830a8","observation_id":"bb525eaa-311a-4eef-aec7-f4475c1724a4","resolution":{"observed_at":"2026-08-07T14:16:06.169961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.752681Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"3e9d0733-9b2a-4e1d-ad06-0f90b95f53cc","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.276324Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:43fa402161787bc8226e80ff929e950d46fa410a6cf032b5a09ab171d119db5a","observation_id":"dff39a45-fe4b-4fa8-8198-90a08189ac11","resolution":{"observed_at":"2026-08-07T14:16:26.911464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.511256Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"46cf090f-0840-4a11-ae3b-caa64951ba0a","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.397674Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f87a9f14e00b40d75b3dba0dbd09c8838bf7fafb00d175ee28479dc8bb7ed075","observation_id":"142a3491-806f-4dc7-a033-8f7a8a3a199e","resolution":{"observed_at":"2026-08-07T14:16:26.588612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T14:16:06.500633Z","title":"Are we done with ImageNet?arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.500633Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:32bb212cfe0196af8bfa0730b2cb3be677a356c37b55358264ff1b3656e7d8a0","observation_id":"b8ae5879-52e0-4302-b0dd-7353b7da03df","resolution":{"observed_at":"2026-08-07T14:16:06.500633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.308317Z","title":"Evaluating machine accuracy on imagenet","venue":null,"work_id":"dcf023cc-f177-4b6a-94cf-0276199d03b6","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.606651Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:63d163cf328623730a500237a2f9dcb997a87f2e77b26b21c58b746d40244262","observation_id":"2e4d0c3a-e70b-4d10-bbfc-6b85c3195bad","resolution":{"observed_at":"2026-08-07T14:16:26.404136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.146384Z","title":"Re- labeling imagenet: from single to multi-labels, from global to localized labels","venue":null,"work_id":"2ebb91ff-0695-4a07-b8d7-979f3eb14a4f","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.690804Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a20f63beeb809914db9d7049fb7a43d1f330f3ebc26cbafa794ecc0822df790c","observation_id":"0fff740e-d227-4abd-9ad4-e4e989bed8cf","resolution":{"observed_at":"2026-08-07T14:16:26.223810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.048010Z","title":"Models, reasoning and inference.Cambridge, UK: CambridgeUniversityPress, 19(2):3,","venue":null,"work_id":"7ee76921-f811-47a5-b2d2-6c7b031d76fc","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.811710Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8bde5ccddb899165ec2df67014b1b76f43545869469fdb1efab9dd1715b5d79c","observation_id":"9652c807-8017-4912-8362-afd002cc5401","resolution":{"observed_at":"2026-08-07T14:16:26.092597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.893790Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"00e33a94-3bec-40bf-bd38-edc47cb08025","year":2014},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.933915Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1fbb6457e826e95fd221e3ad9b3e79ae2429662e9674a229e90eae9780cebc7b","observation_id":"b0d93ccc-3424-4853-ab96-60a1082ac02b","resolution":{"observed_at":"2026-08-07T14:16:25.948923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.697926Z","title":"Probabilistic embeddings for cross-modal retrieval","venue":null,"work_id":"49d2171e-1967-4404-a698-a878f7911363","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.028758Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:7f174e806371cceaed7039d6b8a7145f44c1466c856f03161619d621014e5417","observation_id":"7139b64b-5da4-44b6-b221-4861050926a7","resolution":{"observed_at":"2026-08-07T14:16:25.776407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.497907Z","title":"Oxford university press, 1990","venue":null,"work_id":"540635d0-093e-41f5-9f5e-1bf5e747657c","year":1990},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.093770Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f11bcda11698030de404fdcebbe3f3d2b755cef33b415d4bdae5095d986337e1","observation_id":"4a85e4c9-76e1-4166-9392-0df686d5e03b","resolution":{"observed_at":"2026-08-07T14:16:25.561562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.312066Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"6b1642fc-86eb-4195-a628-77a18344167b","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.201446Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:9b6408181b9eb2969ba99e717d0b5fcc937a457da219ceb9e38ed6c95863bb30","observation_id":"cfe9893d-95d1-4852-964f-04aa0824699b","resolution":{"observed_at":"2026-08-07T14:16:25.415556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.108450Z","title":"Visualcomet: Reasoning about the dynamic context of a still image","venue":null,"work_id":"14920373-03a3-4222-805b-960add8a5350","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.262034Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c6a42d1de2b46882f803db1fa08ed9e9aa5b4138a986f01e218e9e71dbf866a3","observation_id":"29c3743b-6a58-4133-be19-750a60e8020f","resolution":{"observed_at":"2026-08-07T14:16:25.238817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.835338Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"afc4f102-6791-43c7-8f1b-f85ad01d340f","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.355020Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a7d6199095c3c5051daa7f961ff7c5b6ee49da37c8b6c5362a4b5b79f50774bd","observation_id":"fe3fb05f-9d79-4172-968a-ec84917c188e","resolution":{"observed_at":"2026-08-07T14:16:24.983610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-07T14:16:07.422341Z","title":"V oxceleb: a large-scale speaker identification dataset.arXiv preprint arXiv:1706.08612, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.422341Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6ceba051a62cad480ce721c1da6d606d7fdbbb8d8f29eaf0790e600f240458b5","observation_id":"fe62f28c-1a6c-4369-a2c3-898356804cdd","resolution":{"observed_at":"2026-08-07T14:16:07.422341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.504501Z","title":"Visually indicated sounds","venue":null,"work_id":"11678b47-f3c8-4914-8f81-2d5629e00439","year":2016},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.517773Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:bbbddbc7a578e487fc70cf861a7cda8c48d1902b0c0da44df87bc32a9a7ba121","observation_id":"2f726f4f-0836-4d02-8c76-76efbc048ecf","resolution":{"observed_at":"2026-08-07T14:16:24.667638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.190254Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"d35b24d4-1dc8-4685-87fd-12d1778d9ade","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.601271Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:28858ef0a6854691781d7e58ffda762baa5fcec6d128d7ae4a700dd15bfc1bfb","observation_id":"e8ede0a3-0f9a-4702-9f96-9313e1eefa83","resolution":{"observed_at":"2026-08-07T14:16:24.331459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.924083Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"d01befc3-4949-4972-9367-91b6a07c7b25","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.663877Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a4763cbbe6d955022613d00352220ae4513c438619665586004e3054aad1efee","observation_id":"ec61533e-39b9-41f8-ab92-dc5113647f6d","resolution":{"observed_at":"2026-08-07T14:16:24.049480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.674877Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"ab4a89e3-6d28-446c-9d85-6881431c4d8e","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.715195Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5a80ed5451cc11019dd3e3756ac2d7aafb02cea1afcdcc395839fb47f195b613","observation_id":"0b80c615-85be-452a-8e20-6740b123a55c","resolution":{"observed_at":"2026-08-07T14:16:23.801664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.367871Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"c07afa12-38dc-4c4f-8f28-5de5a20738a7","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.791555Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:93c3b1fccd3e197db164926f2460e7d6ea04b942004ade7201d325ed2da65b31","observation_id":"b3d608b0-59b5-4866-8b7f-7cddee563ae0","resolution":{"observed_at":"2026-08-07T14:16:23.496510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.050706Z","title":"RedCaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":"ea455948-34c8-4f42-baf2-c3a731cbcbcb","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.892764Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c4a4dc587694bad9b558d3d589e63a43cd070a4e1a81c66908abc85a8b423a16","observation_id":"2f78cc14-814a-4a25-b081-bc4cbb78fd77","resolution":{"observed_at":"2026-08-07T14:16:23.210366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T14:16:08.000380Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs.arXiv preprint arXiv:2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.000380Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:2e4a450aabd82d7b304ae4a9b2fcd9c776a5c96f9b40a9d8c90743b29ce6f93c","observation_id":"937ad39b-8511-42b5-ac2d-ed3afa494e1a","resolution":{"observed_at":"2026-08-07T14:16:08.000380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.761857Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems (NeurIPS), 35:25278–25294, 2022","venue":null,"work_id":"9f849563-158d-41b5-8f77-167b0f8612c8","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.082104Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:082abc8a0cb20f15b2d65db5d2eba9f066fd50a66b75ba5f8d14a367ec183324","observation_id":"9111481b-70bb-45ee-9e46-a7fefb0adf85","resolution":{"observed_at":"2026-08-07T14:16:22.890150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.485564Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems (NeurIPS), 36,","venue":null,"work_id":"3873207d-0fe9-40ad-8a24-70e59eef62bf","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.188692Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5bb342a3666dc5f17a8644eafd52b4739c4df75d8278723694b85772d8f2fa5b","observation_id":"bf47952b-83a7-4ee4-b559-7f76b20181d5","resolution":{"observed_at":"2026-08-07T14:16:22.628648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.250195Z","title":"VSE++: Improving visual-semantic embeddings with hard negatives","venue":null,"work_id":"38068879-1fc8-4fc5-afeb-4d7a80caddac","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.264838Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:13f891bfb7a3a2f452380edb9523c4a463be2134f07de362d8dca06d08591f62","observation_id":"dd90efe1-357c-4267-a0ee-cc6d119c435f","resolution":{"observed_at":"2026-08-07T14:16:22.345250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.085619Z","title":"Learning the best pooling strategy for visual semantic embedding","venue":null,"work_id":"748d215e-879e-4f86-a695-697759c27446","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.365444Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:94ac336cbf2e7b4b593c85bb17fc5d88f439e3e6331ae9284461268b8776cb57","observation_id":"7e0c6622-3003-4019-92a1-741253ba847b","resolution":{"observed_at":"2026-08-07T14:16:22.200546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.881118Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems (NeurIPS), 35:17612–17625, 2022","venue":null,"work_id":"1b9bea4b-8efc-40f9-a5d6-877f65ca9f8c","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.462465Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:2a396af5c9575d2f7835acc0c9603e4a7588d8bae8dc0b54990143df5cc986d0","observation_id":"115bcd22-c773-4c82-99da-0461a4ef534e","resolution":{"observed_at":"2026-08-07T14:16:21.974675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.645074Z","title":"Boosting contrastive self-supervised learning with false negative cancellation","venue":null,"work_id":"b837e842-1403-4fd4-96bb-364307466f56","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.552516Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:38ebf9b6f6cca7ce6658cedd0ae51f53c27240a449ca19525b7dbcdc6e6557ec","observation_id":"d0a88a38-2277-43d7-a0a5-1935022173e7","resolution":{"observed_at":"2026-08-07T14:16:21.751468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.380276Z","title":"Mafa: Managing false negatives for vision-language pre-training","venue":null,"work_id":"f903d57d-3432-4e13-94c8-08d1ce25be14","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.621165Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1406ba0ccda8229a83589db2fb18ef31d18faa1d32982cc3df374b899c05f5f7","observation_id":"f5a38849-a44d-4dd0-ac94-a2ba19fdad94","resolution":{"observed_at":"2026-08-07T14:16:21.466329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.183725Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":"264584ad-587f-4480-8db3-e1ce93ec4f69","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.706697Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c6d5f6fe4c62f3bbf756988f42e4614ef7030eae64a172108ec4eaa63bb3c404","observation_id":"72991341-5e02-4cdf-a121-5a421aa04c61","resolution":{"observed_at":"2026-08-07T14:16:21.286635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.982839Z","title":"Improved probabilistic image-text representations","venue":null,"work_id":"3891a708-0c45-4558-ab6d-36cd9f1aa44f","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.809784Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:556def05458b848f190d7fb406aeeb41eedc0d05256c9149a2d3c2ec882d4e96","observation_id":"a9ab1f8c-4fbc-41ec-9e19-8a5ad39b8410","resolution":{"observed_at":"2026-08-07T14:16:21.060033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.779563Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":"5a0c74de-dd70-464d-a1a8-efbaced775e6","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.911082Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8d3ed9024aca68b8776a6e226a58ebdde12c169b0d803c4aa6b254d6efcd2315","observation_id":"0a986dc8-3c61-44ad-982b-6e5fa6297429","resolution":{"observed_at":"2026-08-07T14:16:20.859342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.592260Z","title":"CutMix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"c2793f07-8018-4b5c-b5a5-2f9efeb842bb","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.991881Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e3969bbefd7258c54b947c24b7d2c43830060067ba0389e2d0f32fbb7ada330f","observation_id":"fbf3a614-dc65-4cf2-a544-6ae6407c82ac","resolution":{"observed_at":"2026-08-07T14:16:20.664206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.387178Z","title":"Learning with noisy correspondence for cross-modal matching","venue":null,"work_id":"d2fe166e-4b8d-417d-b815-02973be0f8d5","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.054473Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:99fa6c78368eccf0e4f87d0c6e73cd76f9cd4b7dee978beef594325c52358f68","observation_id":"79beb560-2e5e-4200-a7c6-de599eb6a595","resolution":{"observed_at":"2026-08-07T14:16:20.473658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.185547Z","title":"Learning from noisy labels with deep neural networks: A survey.IEEE transactions on neural networks and learning systems, 34(11):8135–8153, 2022","venue":null,"work_id":"b1e50659-b48f-42e6-b7eb-71d90d62a657","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.118685Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:9e3a7c7ec93286a8d9a0b6e09a117d39f998e3c84436dd462f6883a42b713bc8","observation_id":"2151e1d7-8984-4e74-8063-81f39327de5e","resolution":{"observed_at":"2026-08-07T14:16:20.252868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.965316Z","title":"Learning from positive and unlabeled data: A survey.Machine Learning, 109(4):719–760, 2020","venue":null,"work_id":"b8ebac9c-f26d-4ec4-baaa-6ee166ffc7ff","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.218339Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1e091a5ead1bd16fff1bcbfc9a12d7be6fb459699334862f18aab10c0c7f548c","observation_id":"86c4ac82-01ab-4dbf-9a7d-6d8be4e8a92f","resolution":{"observed_at":"2026-08-07T14:16:20.059181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.732842Z","title":"Polysemous visual-semantic embedding for cross-modal retrieval","venue":null,"work_id":"2437fc17-fa10-4fdf-856e-c56fcd21072b","year":1979},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.315824Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:d65bbac5eece3a7141fcc8ef7b82c5c83ae4ff595d710a7830336bd221b9836b","observation_id":"9aea5a1a-eeb8-4aaa-9c98-68305bb7741e","resolution":{"observed_at":"2026-08-07T14:16:19.844161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.592987Z","title":"Improving cross-modal retrieval with set of diverse embeddings","venue":null,"work_id":"ae470752-fd3d-4458-9649-e2a1e2ac1e38","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.372395Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:de0bf13a7af84f666086613d4c2b44c561d05ba694b59b0acd1698e8ecc277ed","observation_id":"b1512ce2-d6b2-4d52-86e1-04247c610a34","resolution":{"observed_at":"2026-08-07T14:16:19.667256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T14:16:09.462903Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.462903Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:eab11e120512a304bd4d0b509808fb935945fe70569694f820e47724e271746c","observation_id":"d4ae136b-7ad8-48e5-a63b-d41067ff60a9","resolution":{"observed_at":"2026-08-07T14:16:09.462903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T14:16:09.536726Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models.arXiv preprint arXiv:2401.06066, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.536726Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e3fce678b906e20c588d4813937e24d50defbe2f1ff918d29bdfa6a4f5523b9b","observation_id":"cfc0da8c-fb56-46d1-9058-d3d0baaa0108","resolution":{"observed_at":"2026-08-07T14:16:09.536726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.425508Z","title":"Probvlm: Proba- bilistic adapter for frozen vison-language models","venue":null,"work_id":"83a7379f-73b1-46da-a52f-398ca1cce599","year":1910},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.610413Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:52e9c6a061e5203be69a519dafab7de1a024fb7aac01e6656ca79d7744bb786e","observation_id":"0160d01b-cc0a-48ef-80eb-cb5f4677f591","resolution":{"observed_at":"2026-08-07T14:16:19.533611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.205334Z","title":"Prototype-based aleatoric uncertainty quantification for cross-modal retrieval.Advances in Neural Information Processing Systems (NeurIPS), 36:24564–24585, 2023","venue":null,"work_id":"97933751-814d-419b-882f-ff70d60115d7","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.655836Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:978ce514161316a50f41ef3251e86b41655e55301f2f292560bc7c4b4bbaf978","observation_id":"930f59d4-a35e-4388-9a72-397b8a0b5b4f","resolution":{"observed_at":"2026-08-07T14:16:19.301851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:09.747225Z","title":"Post-hoc probabilistic vision-language models.arXiv preprint arXiv:2412.06014, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.747225Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:0c910968946b98d547478352574fd0d658a991a870ce7cce47d52dc2a727fd66","observation_id":"3e149e25-a357-4f1b-9df8-7c57d2adcdc5","resolution":{"observed_at":"2026-08-07T14:16:09.747225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.013683Z","title":"Probabilistic language-image pre-training","venue":null,"work_id":"bc82f679-a80f-4140-ab10-0eafc4ed723a","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.797960Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:cf1b5e991f0bdaa093b6d3196334dd712ac1e3fe9cf2d0c3340bfc9fe598f009","observation_id":"b94099c9-1a2a-4588-93b1-d6f314d53663","resolution":{"observed_at":"2026-08-07T14:16:19.077995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.796764Z","title":"LongProLIP: A probabilistic vision-language model with long context text","venue":null,"work_id":"81586c3c-6fde-4894-a905-40cecd716f23","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.872720Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:51388e23d1a0c32e7eaf0fa3e2e445d692d730e6a0dabf582472f2a8d1d51202","observation_id":"3a7c1829-a0bd-4cd4-981c-b9f94ef1548c","resolution":{"observed_at":"2026-08-07T14:16:18.899901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.670643Z","title":"Seeing what you say: Expressive image generation from speech.Under review, 2025","venue":null,"work_id":"39385ea1-b94f-421b-b823-c2229112b3da","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.938780Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:21406b054f635ee8bdbb0ed88b5abd4438116090f7c331b7c70ce2ce8a28aeba","observation_id":"f130cd30-0d9b-417e-a315-b0d5d9f36064","resolution":{"observed_at":"2026-08-07T14:16:18.723468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.481293Z","title":"Flaws of imagenet, com- puter vision’s favorite dataset","venue":null,"work_id":"80e2559b-c632-47e1-865d-8178bcfa8de8","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.019342Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:25a1444064f99cfbb375152b4c0f7cc044a37ad24d39f0925d2d5a533dc4eff6","observation_id":"aab51bfb-cf2e-4660-bb27-e1e0b7e248f5","resolution":{"observed_at":"2026-08-07T14:16:18.549313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.248336Z","title":"ECCV Caption: Correcting false negatives by collecting machine-and-human-verified image-caption associations for MS-COCO","venue":null,"work_id":"9488eada-08c2-4927-8612-35ee2be931ae","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.095597Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a12d9cb58cff7ad110c1f21fee4770e77c0c400414fadbde0462d5ec127fa1a3","observation_id":"a1611fd9-3d99-4cf0-af30-bcecd8896d65","resolution":{"observed_at":"2026-08-07T14:16:18.353786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.085129Z","title":"A metric learning reality check","venue":null,"work_id":"f1b0ee93-a2bc-4d63-9417-74b1148adebc","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.176737Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1ddb25c7cf195e83684c92f285d3137733d556d9d82a532e8677aa36421b37be","observation_id":"21230f8e-0a9e-440c-ad8f-371df56e56e5","resolution":{"observed_at":"2026-08-07T14:16:18.177846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.862725Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"059aa7d5-1c6f-4d35-bc37-11cd421a11b6","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.236474Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:65e87da8d6ef5f83a552573ca8ebd8dea044877f9381b7b94ea1b51163fab0ba","observation_id":"aec1ba88-db07-472e-b3dc-2d2a662d2d8f","resolution":{"observed_at":"2026-08-07T14:16:17.972297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.636815Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in Neural Information Processing Systems (NeurIPS), 30, 2017","venue":null,"work_id":"d36fce30-b9ff-4544-a4c1-abfceb3e6aa4","year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.323690Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:617562a016b64d36c19281c158ad83873f6d9f85b1a95cf5fe5d530ae10ed38a","observation_id":"139dfd9e-ff68-4140-b77f-e3d614e57d84","resolution":{"observed_at":"2026-08-07T14:16:17.717520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.458852Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"035e4b14-d567-444f-93e4-787164364569","year":2002},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.381784Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6bd22004b9e6da89bc8050cee20fd43b0233006529a2829dae5934eed9029812","observation_id":"a6b36c31-f7bc-4be1-9e88-dcd69c13a0d8","resolution":{"observed_at":"2026-08-07T14:16:17.518665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:10.445461Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.445461Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:83baf7c75dcd9558a073df9b64a3f5f82827c44fc1da157c2a08250ed527b39e","observation_id":"6e859e9c-831e-4ccb-b2a7-0fb689c8239a","resolution":{"observed_at":"2026-08-07T14:16:10.445461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.218224Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"c49e0f36-013d-4015-9ecb-7dbea3120b60","year":2005},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.452537Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:ce811b38b23aeed297ce2de39208ba07e1a6d253321074d41efdb1394d10d738","observation_id":"3f19c540-9c5e-4908-857e-fd6e2f38542c","resolution":{"observed_at":"2026-08-07T14:16:17.327520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.077780Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"581d08e1-ec98-428f-86f4-26c1c23c07f5","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.534178Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e3f5d07297b510bee02e982722fca6c656c38e54f57a004fa539ba913b09314a","observation_id":"084c31fe-2b0c-492d-b952-a66bc4e0f290","resolution":{"observed_at":"2026-08-07T14:16:17.171214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.847356Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"72a1283d-c85e-4e8d-9f06-9184565091b2","year":1952},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.618233Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:73cd368333464a064683792764f37e9b3f93a395c3675b492fa4a92cfd79b571","observation_id":"e0ea2121-3621-4b41-9bb0-e9bdce7a2395","resolution":{"observed_at":"2026-08-07T14:16:16.945964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.621541Z","title":"The Caltech-UCSD Birds-200-2011 Dataset","venue":null,"work_id":"c9386107-2bca-48e0-8b92-2fbc9d4926b7","year":2011},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.710456Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:3f52b41141b970f3a1cbff794bc4dff8f7c4a9e111386deaa3a663b4d41e78b3","observation_id":"7f28daa8-e56b-4409-8b05-c120f18f9220","resolution":{"observed_at":"2026-08-07T14:16:16.724783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.278601Z","title":"On semantic similarity in video retrieval","venue":null,"work_id":"0b129025-11a6-47fe-8d33-eec315d4f31c","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.780954Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:ab4371db3fea202e9481d803a2ce6319d736167c5cd31fab47f3664ebb370c10","observation_id":"1dfcf618-c394-44b3-9c31-dba4c45a9c59","resolution":{"observed_at":"2026-08-07T14:16:16.447933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.985612Z","title":"Crisscrossed captions: Extended intramodal and intermodal semantic similarity judgments for MS-COCO","venue":null,"work_id":"b3eedcac-bae0-47cd-99ee-e4d141bb874e","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.873783Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:33a1583fdf4a36ac1003ced258b55049079ebdb7fb04406066e4d11d5826d471","observation_id":"9d49a3ce-90dd-43b9-8e1c-bf4e6a153432","resolution":{"observed_at":"2026-08-07T14:16:16.109279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.757214Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"a8bf817f-2314-4852-aae6-bb36c00f4fa4","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.984748Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f3465a992c478921aa2e76c8aff3575c1de36a4ca7428eb46f424f8699a41301","observation_id":"8dc0f6f4-9bac-471e-b39e-ba384511d26f","resolution":{"observed_at":"2026-08-07T14:16:15.833602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.458491Z","title":"T-mars: Improving visual representations by circumventing text feature learning","venue":null,"work_id":"3c994932-40d9-48b7-ab11-1b3f103716a7","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.114209Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:d1b3bf4c6d5edc47fe95d5d8d964d924f5572526415ec21a65bde4aeffa89aee","observation_id":"73e8ebde-88fb-464c-9d2b-aef37f4a43a1","resolution":{"observed_at":"2026-08-07T14:16:15.603277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.212841Z","title":"Data filtering networks","venue":null,"work_id":"6ff256ca-51b7-4a85-adb4-8f7a7707060a","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.203201Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:080a0be15379981a99a595516da02d09ff15f75c044a8c01d3cb922688cd69e9","observation_id":"9e67b893-2440-4618-9dd5-b1d381a2ab94","resolution":{"observed_at":"2026-08-07T14:16:15.312960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.974395Z","title":"Text-only training for image captioning using noise- injected clip","venue":null,"work_id":"5a792639-8e7a-433a-963b-9410cc3fd125","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.250594Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8a348a7cf509d71957d1ee878c0d4e54b096369756ae6eed0beac704ea391521","observation_id":"0fcd36cb-bf55-4e59-9dc4-9adbcde8eab7","resolution":{"observed_at":"2026-08-07T14:16:15.052907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.682647Z","title":"I can’t believe there’s no images! learning visual tasks using only language supervision","venue":null,"work_id":"47c2f5a8-2a5b-4479-8e93-2d0ddb37fadb","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.338200Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:54f24dd8822f8706f3c6cc2062235e1f1fd4a3063068c9cded91279aa9e0b280","observation_id":"28f0f437-fada-4eb0-a288-e6d5acb6a66e","resolution":{"observed_at":"2026-08-07T14:16:14.791979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.351186Z","title":"Decap: Decoding clip latents for zero-shot captioning via text-only training","venue":null,"work_id":"06aa994f-1aaa-4d83-b314-8b612c90f3b0","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.429970Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:7c88e4bc5ebe430593bfef2d35b07b08ea6b88ad2dd336eb83ad7659a6cd9861","observation_id":"0f01aa81-1d49-455d-ab01-900f8926ee97","resolution":{"observed_at":"2026-08-07T14:16:14.504866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.164227Z","title":"Language-only efficient training of zero-shot composed image retrieval","venue":null,"work_id":"90cf3213-ea3a-4b92-9d3f-2424290ac550","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.525152Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:814defed0456d4032ef42e5190f4f381f59a15fa468c478175e5e0a48029b2d1","observation_id":"b45afb86-ea2f-48b9-867d-829e06dd8dd2","resolution":{"observed_at":"2026-08-07T14:16:14.237872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15954","last_updated":"2023-09-27T19:10:43Z","snapshot_observed_at":"2026-07-06T16:24:34.528987Z","submitted_at":"2023-09-27T19:10:43Z","title":"The Devil is in the Details: A Deep Dive into the Rabbit Hole of Data Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15954","snapshot_observed_at":"2026-08-07T14:16:11.606628Z","title":"The devil is in the details: A deep dive into the rabbit hole of data filtering.arXiv preprint arXiv:2309.15954, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.606628Z"},"links":{"cited_paper":"/paper/2309.15954","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5cff643f52625b65545dfd78de1660bf2a88e797e338238db80cd841edc43f43","observation_id":"312dc320-60fe-457b-8e96-7256b5cfb945","resolution":{"observed_at":"2026-08-07T14:16:11.606628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:11.706817Z","title":"Icons: Influence consensus for vision-language data selection.arXiv preprint arXiv:2501.00654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.706817Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f851c67aef2c49b7b8b37c80ba41de2848de3e989aaf6ad3bf17df0824c2dfdb","observation_id":"0ecaad2b-9a75-4fa0-9f55-103d82bdab4b","resolution":{"observed_at":"2026-08-07T14:16:11.706817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.001883Z","title":"HYPE: Hyperbolic entailment filtering for underspecified images and texts","venue":null,"work_id":"4cdb89f6-1285-4ff4-8b2d-62fb33b6cc8a","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.876698Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:48049155dd7df82fc7873db7adbfcb79ba6e5bb056adbda0903775174b5b0f9d","observation_id":"541a3817-2404-4547-a1fa-85460bdb1ed8","resolution":{"observed_at":"2026-08-07T14:16:14.068636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.836951Z","title":"CompoDiff: Versatile composed image retrieval with latent diffusion.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":"2f560f64-4a60-4008-937d-00bda3f8037d","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.993785Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:b175ceb32098d961fdd42655b17f1848a08b066a4b09a1ff9871317e7783698e","observation_id":"90c3b615-9367-4153-990d-e42b3283cb62","resolution":{"observed_at":"2026-08-07T14:16:13.920023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.656818Z","title":"Toward interactive regional understanding in vision- large language models","venue":null,"work_id":"5673397a-f782-4d26-b7f0-31fcf2ca76bc","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.044436Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e3e803a4a248b410824edfdba19690f1011511de8cab0a1c76fffaccf620fe22","observation_id":"5b275adf-e4f9-41c6-9e98-b2c9742cd007","resolution":{"observed_at":"2026-08-07T14:16:13.737946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.471179Z","title":"Crepe: Can vision-language foundation models reason compositionally? InIEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10910–10921, 2023","venue":null,"work_id":"a542b4bb-46f4-48f3-a86b-3a0ae3a9346f","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.131779Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c2cb6132ddb74060fe8ed2de4bcc53d96aacc10a60d686ae15c7b9c45dbbc9ea","observation_id":"17b406e2-2a86-4fc4-9ac5-03dd33e32755","resolution":{"observed_at":"2026-08-07T14:16:13.572416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.223641Z","title":"Large-scale interactive object segmentation with human annotators","venue":null,"work_id":"4cb8f215-7909-46f5-80d9-3756d8b504ad","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.272631Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:237125de6f9adc6bb01c84fb7f6e12406c9e4bc3f7b32b08d1a6a62a7216f7cd","observation_id":"1a411e0c-72d0-41a3-b175-3ab5af0fc8ef","resolution":{"observed_at":"2026-08-07T14:16:13.369741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2505.19614."}